内容最近更新 / (上海时间)

林悦己 / ARCHIVE

GLM-5.2 使用案例

聚合 GLM-5.2 的前沿评测、编码 Agent、长上下文流程、工具集成与部署经验。

258 个真实案例6 类任务三语内容

USE CASE MAP / 01

GLM-5.2 的真实用法,不只是一张能力表

这套合集保留 258 个公开案例的核心结论、证据类型、作者和原始出处,便于快速判断哪些方法值得复用。

258经整理的真实案例
6任务类别
3英语、中文与日语

HOW TO USE / 02

从案例发现到工作流验证

先按任务类别缩小范围,再回到原贴核对上下文,最后用 EvoLink 复现最有价值的路径。

  1. 01

    按任务类别浏览

    从编码、Agent、创意或评测等任务入口缩小范围。

  2. 02

    搜索具体目标

    按标题、方法或作者找到与你当前问题最接近的案例。

  3. 03

    回到原始出处

    点击作者核对演示、限制、上下文和创作者的完整说明。

  4. 04

    在 EvoLink 复现

    选择值得验证的方法,通过 EvoLink 接入模型并形成自己的流程。

REAL CREATOR CASES / 03

258 个 GLM-5.2 Use Case

每行最多四个案例;点击作者可打开该案例的原始出处。图片与视频按需加载。

按类别筛选

258 个案例

案例 250评测
基准与前沿评测

FP16 Indexer 带来的 ToolEval 提升

如果你想 benchmark 的是 fine-tune 之后的本地 GLM-5.2 tool use,而不是原始 API baseline,可以看这个案例;volatilemarkts 表示,一个 753GB 的 FP8 fine-tune 再加上 custom FP16 indexer,让 SeraphimSerapis/tool-eval-bench 从标准 GLM 5.2 API 的 83% 提升到 94%。

案例 248评测
基准与前沿评测

Aikido 26-CVE 测试框架基线

如果你想在真实的 code-audit harness,而不是 chat demo 里评估 GLM-5.2,可以看这个案例;Aikido 表示,他们针对 26 个已知 CVE 的 AI Code Analysis benchmark 让 GLM-5.2 在 pass@3 下重找出 16 个,并在 max reasoning 下以大约 1.3 倍成本再多拿到 3 个发现。

案例 235评测
基准与前沿评测

DiligenceBench 金融评测排名

如果你想评估 GLM-5.2 在公开股票研究 agent 上的表现,可以看这个案例,因为 karinanguyen 说 DiligenceBench 把 GLM 5.2 放在前列,并证明 finance harness 能让强模型同时更强且更便宜。

案例 227评测
基准与前沿评测

Gargantua WebGL Raytracer 胜出

如果你想在偏物理的单文件 browser build 上 benchmark GLM-5.2,可以看这个案例,因为 AlicanKiraz0 说 GLM 5.2 Max 在 Gargantua geodesic raytracer 任务里更好地兼顾了数值正确性与 real-time rendering discipline。

案例 223评测
基准与前沿评测

智能指数 Token 效率差距

如果你想为长周期 benchmark 工作负载规划 GLM-5.2 预算,可以看这个案例,因为 Artificial Analysis 说,GLM-5.2 Max 在 Intelligence Index 每个任务上的平均输出 token 约为 43K,而 Inkling 是 25K,Kimi K2.6 和 DeepSeek v4 Pro Max 也都更低。

案例 217评测
基准与前沿评测

EvalPlus 救援路由胜过 Fable

如果你想测试一条带 verifier 的双模型 coding 路由,可以看这个案例,因为 gmicloud 说,先跑 Opus 4.8、失败时再用 GLM 5.2 FP8 救援的方案,在 100 个冻结 EvalPlus 任务里做对了 94 个,比 Fable 5 多 5 个,而且成本低约 47%。

案例 207评测
基准与前沿评测

稳定流体浏览器基准

如果你想在算法负载很重的浏览器物理 build 上比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 跑了一个 Stable Fluids HTML benchmark,给 GLM 5.2 Max 打了 88/100、成本约 1.17 美元,高于 Opus 4.8 和 Fable 5,但仍低于 GPT 5.6 Sol。

案例 199基准测试
基准与前沿评测

Epoch 开放权重指数领先

如果你想把 GLM-5.2 放到一条更长期的能力曲线上看,可以看这个案例,因为 Epoch AI 给它的 Capabilities Index 估分是 152,并称它是自己评估过的 open-weight 模型里最高的。

案例 196评测
基准与前沿评测

Databricks 内部线束评估

如果你想看 GLM-5.2 在大型私有工程 codebase 上的表现,可以看这个案例,因为 Databricks 说,他们覆盖 3000 多名工程师工作的内部评估发现 GLM 5.2 表现非常强,而且仅仅 harness 选择不同就能把成本压到约 2x。

案例 190基准测试
基准与前沿评测

NatureBench 公开重量级亚军

如果你想看 GLM-5.2 在 scientific-agent 工作里的基准表现,可以看这个案例,因为 NatureBench 说它在 6 个科学领域、90 个任务上首发即总榜第二,并拿到 open-weight 第一。

案例 189评测
基准与前沿评测

终端-工作台 45-任务成本权衡

如果你想在同一套 agent harness 下比较 GLM-5.2 和 GPT-5.5,可以看这个案例,因为一组 45 个 Terminal-Bench 任务里,GLM-5.2 解出 25 个,GPT-5.5 解出 29 个,但前者在 prompt caching 下便宜约 40%。

案例 188基准测试
基准与前沿评测

Harvey LAB-AA 法律代理领带

如果你想看 GLM-5.2 在真实法律 agent 工作里的基准表现,可以看这个案例,因为 Harvey LAB-AA 显示 GLM-5.2 Max 在 24 个法律领域、120 个私有任务上拿到 7.5% all-pass,并列 Claude Opus 4.8。

案例 184评测
基准与前沿评测

AutomationBench-AA 开放式重量领先

如果你想比较 GLM-5.2 在遵守业务规则的 SaaS automation 里的表现,而不只是看 coding benchmark,可以看这个案例,因为 Artificial Analysis 报告 GLM-5.2 Max 在 AutomationBench-AA 上拿到 27.8%,并称它是 open weights 里的第一名。

案例 178评测
基准与前沿评测

三体模拟器基准获胜

如果你想在带数值物理约束的 coding benchmark 里比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 跑了一个混沌三体模拟器任务,并给 GLM 5.2 Max 打出了 91/100 的最高分。

案例 167评测
基准与前沿评测

GameDevBench 333 任务开源负责人

如果你想在 agentic 游戏开发 benchmark 里追踪 GLM-5.2,可以看这个案例,因为 GameDevBench 已扩充到 333 个任务,并表示即使没有 vision,GLM-5.2 仍是排行榜上最强的 open-source model。

案例 175评测
基准与前沿评测

光标双摆记分卡

如果你想在一个受限的 Cursor coding benchmark 里比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 用 HTML double-pendulum simulator 跑了 6 个模型,给 GLM 5.2 Max 打了 88/100,虽然落后于 Fable 和 Sonnet,但仍高于 GPT-5.5、Kimi K2.7 Code 和 Composer。

案例 162评测
基准与前沿评测

VulcanBench 10 项任务 80% 平局

如果你想在成本和分数同样重要的 post-cutoff 真实工程任务中比较 GLM-5.2,可以看这个案例,因为 Morgan Linton 说 VulcanBench 让 GLM 5.2 High、Fable 5 Low 和 Sonnet 5 High 在 10 个 repo 上都拿到 80%,而 GLM 的成本落在中间。

案例 159评测
基准与前沿评测

SWE-重新基准 51.1% 检查点

如果你想持续跟踪 GLM-5.2 在 SWE agent 榜单上的位置,可以看这个案例,因为最新一条 SWE rebench 帖子给出的成绩是 51.1%,消耗 262 万 token,明显高于新加入的 DeepSeek、MiMo、Qwen 和 Gemma。

案例 154评测
基准与前沿评测

推出 Darkly Edge-Case 以 40/41 获胜

如果你想看 GLM-5.2 在企业工具型 agent 任务里的表现,而不是只看聊天评测,可以用这个案例,因为 Composio 说它在 GitHub、Jira 和 LaunchDarkly 的 41 个任务里做对了 40 个,而且只有 GLM 抓到了一个待审批边界条件。

案例 146评测
基准与前沿评测

CyberBench 开放重量补丁亚军

如果你想衡量 GLM-5.2 在偏攻防式漏洞发现与补丁生成上的能力,可以用这个案例,因为 CyberBench 把它放在 60 个真实 OSS-Fuzz 漏洞上的总榜第二。

案例 01基准测试
基准与前沿评测

人工智能分析智能指数

使用人工分析帖子将 GLM-5.2 与其他开放权重和专有前沿模型在智能和每项任务成本方面进行比较。

案例 02基准测试
基准与前沿评测

Code Arena 前端排名

使用此案例在通过竞技场式比较判断的真实前端编码任务上评估 GLM-5.2。

案例 03基准测试
基准与前沿评测

设计竞技场第一名

使用此案例来判断 GLM-5.2 是否可以处理设计加代码任务,而不仅仅是文本密集型编码基准。

案例 04基准测试
基准与前沿评测

FrontierSWE 结果

使用 FrontierSWE 帖子将 GLM-5.2 与 GPT-5.5、Opus 和 Fable 风格的模型在软件工程任务上进行比较。

案例 05基准测试
基准与前沿评测

DeepSWE 开源负责人

使用 DeepSWE 案例了解 GLM-5.2 作为用于困难的软件工程评估任务的强大开放模型。

案例 06基准测试
基准与前沿评测

终端工作台超过 80%

在评估面向终端的编码和代理工作流程的 GLM-5.2 时使用此案例。

案例 07评测
基准与前沿评测

SWELancer 与 GPT-5.5 的比较

使用此 SWELancer 案例作为 GLM-5.2 和 GPT-5.5 在任务成功、奖励和完成时间方面的具体多指标比较。

案例 08基准测试
基准与前沿评测

BridgeBench 满分信号

使用此案例来检查基于多步骤推理的 GLM-5.2,而不仅仅是编码排行榜。

案例 09基准测试
基准与前沿评测

BridgeBench 推理排名第一

使用此案例在扎根推理任务上将 GLM-5.2 与封闭边界模型进行比较。

案例 10评测
基准与前沿评测

KernelBench-Hard 没有捷径

在检查基准测试收益是否来自有效的实现行为而不是捷径时使用此案例。

案例 11基准测试
基准与前沿评测

Runescape 长凳追赶

使用此案例作为开放权重模型在类似游戏的基准任务上取得进展的快速信号。

案例 12基准测试
基准与前沿评测

BridgeBench 速度提升

使用此案例来评估对延迟敏感的工作流程,其中速度与智能同样重要。

案例 60基准测试
基准与前沿评测

KernelBench 硬核和巨型 GPU 编码

使用此案例跨 KernelBench-Hard 和 KernelBench-Mega 评估 GPU 内核编码上的 GLM-5.2,其中开放代理跟踪使结果可检查。

案例 70基准测试
基准与前沿评测

DeepSWE 高强度模式开源领先

用这个案例跟踪 GLM-5.2 在 DeepSWE 高强度设置下的表现;帖文榜单显示它以 44% pass@1 位列开源模型第一。

案例 72基准测试
基准与前沿评测

LLM 辩论基准第二名

用这个案例评估 GLM-5.2 在编码之外的对抗式多轮辩论表现;max-reasoning 版本在结果中位列 Claude 系列之后的第二名。

案例 76评测
基准与前沿评测

AA-Omniscience 幻觉率

用这个案例比较 GLM-5.2 的不确定性处理能力;帖文中的 AA-Omniscience 结果显示,它的幻觉率低于若干其他前沿模型。

案例 90评测
基准与前沿评测

GDPval-AA 代理工作指数

如果你想比较 GLM-5.2 在长期知识工作中的表现,而不是只看编码榜单,可以用这个案例。

案例 94评测
基准与前沿评测

游戏开发竞技场亚军

如果你想判断 GLM-5.2 的游戏构建质量,可以用这个案例。它在 Game Dev Arena 拿到第二名,并成为该榜单里开源权重阵营的第一名。

案例 120基准测试
基准与前沿评测

PostTrainBench 可靠性领先

如果你想比较 GLM-5.2 Max,不只看 headline 分数,也看它在 84 个任务上 failed run 为 0 的 agent reliability,可以用这个案例。

案例 121评测
基准与前沿评测

Fireworks + Faros 211 项仓库任务评测

如果你想在 private repo 的真实 engineering task 上评估 GLM-5.2,而不是只看公开 benchmark,可以用这个案例;帖子同时给出了分数、速度和每任务成本。

案例 110基准测试
基准与前沿评测

AA-Briefcase 每任务耗时前沿

用这个案例比较 GLM-5.2 在长周期知识工作上的表现,因为除了 benchmark 分数,单任务耗时同样关键。

案例 111基准测试
基准与前沿评测

Code Arena 前端对战优势

用这个案例查看 GLM-5.2 在前端任务上的成对对战优势,而不是只看一张排名截图。

案例 113基准测试
基准与前沿评测

SWE Atlas 代码库问答亚军

用这个案例跟踪 GLM-5.2 在代码库问答、测试编写和重构三条 SWE Atlas 榜单上的表现,而不是只看单项 SWE 榜单。

案例 257集成
编码代理与长上下文工作流

OpenCodex 模型切换工作流

如果你想在以 Codex 为中心的 coding loop 里给 GLM-5.2 做路由,而不是被锁定在单一模型上,可以看这个案例,因为 vista8 说 OpenCodex 让同一套环境可以在 GLM 5.2、Kimi K3、GPT-5.6 Sol 和 Grok 4.5 之间切换,用于前端设计、后端工作和实时 X 搜索。

案例 255集成
编码代理与长上下文工作流

Hermes 11 代理混合实验室

如果你想围绕 GLM-5.2 搭一套按角色分工的多代理实验室,而不是只用一个单体助手,可以看这个案例,因为 MichaelGannotti 说一套 11 代理的 Hermes 配置,会在 DGX Spark、Ryzen 工作站和云端模型之间动态路由任务,其中就包括用于软件、研究、营销和协调工作的 GLM 5.2。

案例 243评测
编码代理与长上下文工作流

Hermes 混合式 API 对等部署

如果你想把一套 self-hosted 的 GLM-5.2 coding agent 和官方路线对照验证,可以看这个案例,因为 dangerm00se 说一套跑在 4x RTX 6000 PCIe 上的 Hermes + GLM-5.2 hybrid,和官方 API 的 60 个任务对上了 59 个,同时做到了 3,149 tok/s prefill、0.37 秒 warm TTFT 与 35.9 tok/s decode。

案例 237集成
编码代理与长上下文工作流

LM Studio Bionic GLM 代理

如果你想评估一套 local-first 的 GLM-5.2 coding agent,可以看这个案例,因为 chenzeling4 说 LM Studio Bionic 把 GLM 5.2 与本地文档 sandbox、inline code diff、rollback checkpoint 和端侧语音转写结合在了一起。

案例 236评测
编码代理与长上下文工作流

Claude Code Web 开发质量优势

如果你想比较首轮生成的 Web 开发质量,而不是单看完成速度,可以看这个案例,因为 Lumenix0 说在三个真实任务里,Claude Code 上的 GLM 5.2 在设计质量和功能完成度上都超过了 Codex 上的 GPT 5.5。

当前显示 48 / 258

BUILD WITH EVOLINK / 04

把 GLM-5.2 案例变成自己的工作流

通过 EvoLink 接入模型,沿着已验证的案例方向开始构建。