FP16 Indexer 带来的 ToolEval 提升
如果你想 benchmark 的是 fine-tune 之后的本地 GLM-5.2 tool use,而不是原始 API baseline,可以看这个案例;volatilemarkts 表示,一个 753GB 的 FP8 fine-tune 再加上 custom FP16 indexer,让 SeraphimSerapis/tool-eval-bench 从标准 GLM 5.2 API 的 83% 提升到 94%。
内容最近更新 / (上海时间)
林悦己 / ARCHIVE
聚合 GLM-5.2 的前沿评测、编码 Agent、长上下文流程、工具集成与部署经验。
USE CASE MAP / 01
这套合集保留 258 个公开案例的核心结论、证据类型、作者和原始出处,便于快速判断哪些方法值得复用。
HOW TO USE / 02
先按任务类别缩小范围,再回到原贴核对上下文,最后用 EvoLink 复现最有价值的路径。
从编码、Agent、创意或评测等任务入口缩小范围。
按标题、方法或作者找到与你当前问题最接近的案例。
点击作者核对演示、限制、上下文和创作者的完整说明。
选择值得验证的方法,通过 EvoLink 接入模型并形成自己的流程。
REAL CREATOR CASES / 03
每行最多四个案例;点击作者可打开该案例的原始出处。图片与视频按需加载。
258 个案例
如果你想 benchmark 的是 fine-tune 之后的本地 GLM-5.2 tool use,而不是原始 API baseline,可以看这个案例;volatilemarkts 表示,一个 753GB 的 FP8 fine-tune 再加上 custom FP16 indexer,让 SeraphimSerapis/tool-eval-bench 从标准 GLM 5.2 API 的 83% 提升到 94%。
如果你想在真实的 code-audit harness,而不是 chat demo 里评估 GLM-5.2,可以看这个案例;Aikido 表示,他们针对 26 个已知 CVE 的 AI Code Analysis benchmark 让 GLM-5.2 在 pass@3 下重找出 16 个,并在 max reasoning 下以大约 1.3 倍成本再多拿到 3 个发现。
如果你想评估 GLM-5.2 在公开股票研究 agent 上的表现,可以看这个案例,因为 karinanguyen 说 DiligenceBench 把 GLM 5.2 放在前列,并证明 finance harness 能让强模型同时更强且更便宜。
如果你想在偏物理的单文件 browser build 上 benchmark GLM-5.2,可以看这个案例,因为 AlicanKiraz0 说 GLM 5.2 Max 在 Gargantua geodesic raytracer 任务里更好地兼顾了数值正确性与 real-time rendering discipline。
如果你想为长周期 benchmark 工作负载规划 GLM-5.2 预算,可以看这个案例,因为 Artificial Analysis 说,GLM-5.2 Max 在 Intelligence Index 每个任务上的平均输出 token 约为 43K,而 Inkling 是 25K,Kimi K2.6 和 DeepSeek v4 Pro Max 也都更低。
如果你想测试一条带 verifier 的双模型 coding 路由,可以看这个案例,因为 gmicloud 说,先跑 Opus 4.8、失败时再用 GLM 5.2 FP8 救援的方案,在 100 个冻结 EvalPlus 任务里做对了 94 个,比 Fable 5 多 5 个,而且成本低约 47%。
如果你想在算法负载很重的浏览器物理 build 上比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 跑了一个 Stable Fluids HTML benchmark,给 GLM 5.2 Max 打了 88/100、成本约 1.17 美元,高于 Opus 4.8 和 Fable 5,但仍低于 GPT 5.6 Sol。
如果你想把 GLM-5.2 放到一条更长期的能力曲线上看,可以看这个案例,因为 Epoch AI 给它的 Capabilities Index 估分是 152,并称它是自己评估过的 open-weight 模型里最高的。
如果你想看 GLM-5.2 在大型私有工程 codebase 上的表现,可以看这个案例,因为 Databricks 说,他们覆盖 3000 多名工程师工作的内部评估发现 GLM 5.2 表现非常强,而且仅仅 harness 选择不同就能把成本压到约 2x。
如果你想看 GLM-5.2 在 scientific-agent 工作里的基准表现,可以看这个案例,因为 NatureBench 说它在 6 个科学领域、90 个任务上首发即总榜第二,并拿到 open-weight 第一。
如果你想在同一套 agent harness 下比较 GLM-5.2 和 GPT-5.5,可以看这个案例,因为一组 45 个 Terminal-Bench 任务里,GLM-5.2 解出 25 个,GPT-5.5 解出 29 个,但前者在 prompt caching 下便宜约 40%。
如果你想看 GLM-5.2 在真实法律 agent 工作里的基准表现,可以看这个案例,因为 Harvey LAB-AA 显示 GLM-5.2 Max 在 24 个法律领域、120 个私有任务上拿到 7.5% all-pass,并列 Claude Opus 4.8。
如果你想比较 GLM-5.2 在遵守业务规则的 SaaS automation 里的表现,而不只是看 coding benchmark,可以看这个案例,因为 Artificial Analysis 报告 GLM-5.2 Max 在 AutomationBench-AA 上拿到 27.8%,并称它是 open weights 里的第一名。
如果你想在带数值物理约束的 coding benchmark 里比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 跑了一个混沌三体模拟器任务,并给 GLM 5.2 Max 打出了 91/100 的最高分。
如果你想在 agentic 游戏开发 benchmark 里追踪 GLM-5.2,可以看这个案例,因为 GameDevBench 已扩充到 333 个任务,并表示即使没有 vision,GLM-5.2 仍是排行榜上最强的 open-source model。
如果你想在一个受限的 Cursor coding benchmark 里比较 GLM-5.2,可以看这个案例,因为 AlicanKiraz0 用 HTML double-pendulum simulator 跑了 6 个模型,给 GLM 5.2 Max 打了 88/100,虽然落后于 Fable 和 Sonnet,但仍高于 GPT-5.5、Kimi K2.7 Code 和 Composer。
如果你想在成本和分数同样重要的 post-cutoff 真实工程任务中比较 GLM-5.2,可以看这个案例,因为 Morgan Linton 说 VulcanBench 让 GLM 5.2 High、Fable 5 Low 和 Sonnet 5 High 在 10 个 repo 上都拿到 80%,而 GLM 的成本落在中间。
如果你想持续跟踪 GLM-5.2 在 SWE agent 榜单上的位置,可以看这个案例,因为最新一条 SWE rebench 帖子给出的成绩是 51.1%,消耗 262 万 token,明显高于新加入的 DeepSeek、MiMo、Qwen 和 Gemma。
如果你想看 GLM-5.2 在企业工具型 agent 任务里的表现,而不是只看聊天评测,可以用这个案例,因为 Composio 说它在 GitHub、Jira 和 LaunchDarkly 的 41 个任务里做对了 40 个,而且只有 GLM 抓到了一个待审批边界条件。
如果你想衡量 GLM-5.2 在偏攻防式漏洞发现与补丁生成上的能力,可以用这个案例,因为 CyberBench 把它放在 60 个真实 OSS-Fuzz 漏洞上的总榜第二。
使用人工分析帖子将 GLM-5.2 与其他开放权重和专有前沿模型在智能和每项任务成本方面进行比较。
使用此案例在通过竞技场式比较判断的真实前端编码任务上评估 GLM-5.2。
使用此案例来判断 GLM-5.2 是否可以处理设计加代码任务,而不仅仅是文本密集型编码基准。
使用 FrontierSWE 帖子将 GLM-5.2 与 GPT-5.5、Opus 和 Fable 风格的模型在软件工程任务上进行比较。
使用 DeepSWE 案例了解 GLM-5.2 作为用于困难的软件工程评估任务的强大开放模型。
在评估面向终端的编码和代理工作流程的 GLM-5.2 时使用此案例。
使用此 SWELancer 案例作为 GLM-5.2 和 GPT-5.5 在任务成功、奖励和完成时间方面的具体多指标比较。
使用此案例来检查基于多步骤推理的 GLM-5.2,而不仅仅是编码排行榜。
使用此案例在扎根推理任务上将 GLM-5.2 与封闭边界模型进行比较。
在检查基准测试收益是否来自有效的实现行为而不是捷径时使用此案例。
使用此案例作为开放权重模型在类似游戏的基准任务上取得进展的快速信号。
使用此案例来评估对延迟敏感的工作流程,其中速度与智能同样重要。
使用此案例跨 KernelBench-Hard 和 KernelBench-Mega 评估 GPU 内核编码上的 GLM-5.2,其中开放代理跟踪使结果可检查。
用这个案例跟踪 GLM-5.2 在 DeepSWE 高强度设置下的表现;帖文榜单显示它以 44% pass@1 位列开源模型第一。
用这个案例评估 GLM-5.2 在编码之外的对抗式多轮辩论表现;max-reasoning 版本在结果中位列 Claude 系列之后的第二名。
用这个案例比较 GLM-5.2 的不确定性处理能力;帖文中的 AA-Omniscience 结果显示,它的幻觉率低于若干其他前沿模型。
如果你想比较 GLM-5.2 在长期知识工作中的表现,而不是只看编码榜单,可以用这个案例。
如果你想判断 GLM-5.2 的游戏构建质量,可以用这个案例。它在 Game Dev Arena 拿到第二名,并成为该榜单里开源权重阵营的第一名。
如果你想比较 GLM-5.2 Max,不只看 headline 分数,也看它在 84 个任务上 failed run 为 0 的 agent reliability,可以用这个案例。
如果你想在 private repo 的真实 engineering task 上评估 GLM-5.2,而不是只看公开 benchmark,可以用这个案例;帖子同时给出了分数、速度和每任务成本。
用这个案例比较 GLM-5.2 在长周期知识工作上的表现,因为除了 benchmark 分数,单任务耗时同样关键。
用这个案例查看 GLM-5.2 在前端任务上的成对对战优势,而不是只看一张排名截图。
用这个案例跟踪 GLM-5.2 在代码库问答、测试编写和重构三条 SWE Atlas 榜单上的表现,而不是只看单项 SWE 榜单。
如果你想在以 Codex 为中心的 coding loop 里给 GLM-5.2 做路由,而不是被锁定在单一模型上,可以看这个案例,因为 vista8 说 OpenCodex 让同一套环境可以在 GLM 5.2、Kimi K3、GPT-5.6 Sol 和 Grok 4.5 之间切换,用于前端设计、后端工作和实时 X 搜索。
如果你想围绕 GLM-5.2 搭一套按角色分工的多代理实验室,而不是只用一个单体助手,可以看这个案例,因为 MichaelGannotti 说一套 11 代理的 Hermes 配置,会在 DGX Spark、Ryzen 工作站和云端模型之间动态路由任务,其中就包括用于软件、研究、营销和协调工作的 GLM 5.2。
如果你想把一套 self-hosted 的 GLM-5.2 coding agent 和官方路线对照验证,可以看这个案例,因为 dangerm00se 说一套跑在 4x RTX 6000 PCIe 上的 Hermes + GLM-5.2 hybrid,和官方 API 的 60 个任务对上了 59 个,同时做到了 3,149 tok/s prefill、0.37 秒 warm TTFT 与 35.9 tok/s decode。
如果你想评估一套 local-first 的 GLM-5.2 coding agent,可以看这个案例,因为 chenzeling4 说 LM Studio Bionic 把 GLM 5.2 与本地文档 sandbox、inline code diff、rollback checkpoint 和端侧语音转写结合在了一起。
如果你想比较首轮生成的 Web 开发质量,而不是单看完成速度,可以看这个案例,因为 Lumenix0 说在三个真实任务里,Claude Code 上的 GLM 5.2 在设计质量和功能完成度上都超过了 Codex 上的 GPT 5.5。
当前显示 48 / 258
BUILD WITH EVOLINK / 04
通过 EvoLink 接入模型,沿着已验证的案例方向开始构建。