最近の更新 / (上海時間)

林悦己 / アーカイブ

GLM-5.2 活用事例

GLM-5.2の評価、コーディングエージェント、長文脈ワークフロー、連携、運用事例をまとめています。

258 件の実例6 カテゴリ3言語

USE CASE MAP / 01

GLM-5.2の実際の使い方を、能力表の先まで

258件の公開事例から、要点、証拠タイプ、作者、元ソースを保持し、再利用すべき方法をすばやく判断できます。

258整理済みの実例
6タスクカテゴリ
3英語・中国語・日本語

HOW TO USE / 02

事例発見からワークフロー検証へ

タスク分類で候補を絞り、元ソースで文脈を確認し、EvoLinkで価値の高い流れを再現します。

  1. 01

    タスク別に見る

    コーディング、エージェント、制作、評価などから範囲を絞ります。

  2. 02

    目的を検索する

    タイトル、方法、作者から現在の課題に近い事例を探します。

  3. 03

    元ソースを確認する

    作者名からデモ、制約、文脈、完全な説明を確認します。

  4. 04

    EvoLinkで再現する

    検証したい方法を選び、モデルに接続して自分のフローにします。

REAL CREATOR CASES / 03

GLM-5.2 Use Case 258件

1行最大4件。作者名を選ぶと元の事例を開けます。画像と動画は必要なときだけ読み込みます。

カテゴリで絞り込む

258

CASE 250評価
ベンチマークとフロンティア評価

ToolEval FP16 Indexer 向上

このケースは、生の API baseline ではなく、fine-tune 済みローカル GLM-5.2 の tool use を benchmark したいときに使えます。volatilemarkts によると、753GB FP8 fine-tune と custom FP16 indexer により、SeraphimSerapis/tool-eval-bench が標準の GLM 5.2 API の 83 percent から 94 percent に上がったためです。

CASE 248評価
ベンチマークとフロンティア評価

Aikido 26-CVE ハーネス基準線

このケースは、chat demo ではなく実際の code-audit harness で GLM-5.2 を benchmark したいときに使えます。AikidoSecurity によると、26 件の既知 CVE を使った AI Code Analysis benchmark で、GLM-5.2 は pass@3 で 16 件を再発見し、max reasoning ではコスト約 1.3x でさらに 3 件増やしたためです。

CASE 235評価
ベンチマークとフロンティア評価

DiligenceBench 金融ハーネス上位

このケースは、公開株式リサーチ agent に対する GLM-5.2 の実力を評価したいときに使えます。karinanguyen によると、DiligenceBench では GLM 5.2 が上位に入り、この金融ハーネスが強いモデルをより高性能かつ低コストにできることを示したためです。

CASE 227評価
ベンチマークとフロンティア評価

Gargantua WebGL Raytracer 勝利

このケースは、物理寄りの単一ファイル browser build で GLM-5.2 を benchmark したいときに使えます。AlicanKiraz0 によると、GLM 5.2 Max は Gargantua geodesic raytracer 課題で、数値的正しさと real-time rendering discipline の両立によって比較対象を上回ったためです。

CASE 223評価
ベンチマークとフロンティア評価

Intelligence Index Token Efficiency Gap

このケースは、長期的な benchmark workload 向けに GLM-5.2 の予算を見積もるときに使えます。Artificial Analysis によると、GLM-5.2 Max は Intelligence Index の 1 タスクあたり平均約 43K の output tokens を使い、Inkling は 25K、Kimi K2.6 と DeepSeek v4 Pro Max もそれより少なかったためです。

CASE 217評価
ベンチマークとフロンティア評価

EvalPlus レスキュールートが Fable 超え

このケースは、verifier 付きの二段モデル coding ルートを試したいときに使えます。gmicloud によると、最初に Opus 4.8 を走らせ、失敗時だけ GLM 5.2 FP8 を救援投入する構成で、凍結した EvalPlus 100 問のうち 94 問を解き、Fable 5 を 5 問上回りつつコストは約 47 パーセント低かったためです。

CASE 207評価
ベンチマークとフロンティア評価

安定した流体のブラウザ ベンチマーク

このケースは、algorithm-heavy な browser physics build で GLM-5.2 を比較したいときに使えます。AlicanKiraz0 が Stable Fluids の HTML benchmark を実行し、GLM 5.2 Max に 100 点中 88 点、コスト約 1.17 ドルを付け、Opus 4.8 と Fable 5 を上回りつつ GPT 5.6 Sol は下回ったためです。

CASE 199ベンチマーク
ベンチマークとフロンティア評価

エポックオープンウェイト指数リード

このケースは、GLM-5.2 を長期的な capability curve の中で位置づけたいときに使えます。Epoch AI が Capabilities Index で推定 152 を与え、評価済み open-weight model の中で最高だとしているためです。

CASE 196評価
ベンチマークとフロンティア評価

Databricks 内部ハーネスの評価

このケースは、GLM-5.2 を大規模な private engineering codebase 上で benchmark したいときに使えます。Databricks によると、3,000 人超の engineer の仕事を含む内部評価で GLM 5.2 は非常に強く、harness の選び方だけでコストを約 2x 下げられるためです。

CASE 190ベンチマーク
ベンチマークとフロンティア評価

ネイチャーベンチ無差別級準優勝

このケースは、GLM-5.2 を scientific-agent workflow で benchmark したいときに使えます。NatureBench が、6 つの scientific domain、90 task において GLM-5.2 が総合 2 位かつ open-weight 首位で debut したと述べているためです。

CASE 189評価
ベンチマークとフロンティア評価

ターミナルとベンチの 45 タスクのコストのトレードオフ

このケースは、同じ agent harness で GLM-5.2 と GPT-5.5 を比較したいときに使えます。45 件の Terminal-Bench で GLM-5.2 が 25 勝、GPT-5.5 が 29 勝となり、GLM は prompt caching 込みで約 40% 安かったためです。

CASE 188ベンチマーク
ベンチマークとフロンティア評価

Harvey LAB-AA 法務エージェント ネクタイ

このケースは、GLM-5.2 を実際の法務エージェント業務で benchmark したいときに使えます。Harvey LAB-AA で GLM-5.2 Max が 24 の practice area、120 の private task で Claude Opus 4.8 と同率の 7.5% all-pass を出しているためです。

CASE 184評価
ベンチマークとフロンティア評価

AutomationBench-AA オープンウェイト リード

このケースは、GLM-5.2 を coding benchmark だけでなく business rule を守る SaaS automation で比較したいときに使えます。Artificial Analysis が AutomationBench-AA で GLM-5.2 Max を 27.8% と報告し、open weights では首位だと述べているためです。

CASE 178評価
ベンチマークとフロンティア評価

Three-Body Simulator ベンチマーク勝利

このケースは、数値物理を含むコーディングベンチマークで GLM-5.2 を比較したいときに使えます。AlicanKiraz0 がカオス的な三体シミュレータ課題を走らせ、GLM 5.2 Max に 100 点中 91 点の最高評価を付けたためです。

CASE 167評価
ベンチマークとフロンティア評価

GameDevBench 333-タスク オープンソース リード

このケースは、エージェント型のゲーム開発ベンチマークで GLM-5.2 を追うのに役立ちます。GameDevBench は 333 タスクまで拡張され、GLM-5.2 が視覚機能なしでも leaderboard 上で最強の open-source model だと述べています。

CASE 175評価
ベンチマークとフロンティア評価

カーソル ダブル ペンデュラム スコアカード

このケースは、制約付きの Cursor coding benchmark で GLM-5.2 を比較したいときに使えます。AlicanKiraz0 は HTML の double-pendulum simulator で 6 モデルを比較し、GLM 5.2 Max に 100 点中 88 点を付け、Fable と Sonnet には届かなかったものの、GPT-5.5、Kimi K2.7 Code、Composer を上回りました。

CASE 162評価
ベンチマークとフロンティア評価

VulcanBench 10 タスク 80% タイ

このケースは、cost と score の両方が重要な post-cutoff の実エンジニアリング課題で GLM-5.2 を比較するのに役立ちます。Morgan Linton によると、VulcanBench では GLM 5.2 High、Fable 5 Low、Sonnet 5 High が 10 repo で同じ 80 percent になり、GLM の cost は中間でした。

CASE 159評価
ベンチマークとフロンティア評価

SWE-再ベンチ 51.1 パーセント チェックポイント

このケースは、更新が続く SWE エージェント系リーダーボードで GLM-5.2 を追うのに向いています。最新の SWE rebench 投稿では 2.62 million tokens で 51.1 percent とされ、新しく加わった DeepSeek、MiMo、Qwen、Gemma より明確に上です。

CASE 154評価
ベンチマークとフロンティア評価

LaunchDarkly エッジケースで 40/41 で勝利

このケースは、チャット専用評価ではなく業務ツールを使うエージェント作業で GLM-5.2 を試すのに向いています。Composio によれば、GitHub、Jira、LaunchDarkly の 41 タスク中 40 を取り、保留承認のエッジケースを拾えたのは GLM だけでした。

CASE 146評価
ベンチマークとフロンティア評価

CyberBench 無差別級パッチ準優勝

GLM-5.2 を攻撃寄りの脆弱性発見とパッチ作成で測りたいならこの事例が役立ちます。CyberBench で 60 件の実在 OSS-Fuzz 脆弱性に対して総合 2 位になっているからです。

CASE 01ベンチマーク
ベンチマークとフロンティア評価

人工分析インテリジェンスインデックス

Artificial Analysis ポストを使用して、インテリジェンスとタスクあたりのコストに関して GLM-5.2 を他のオープンウェイトおよび独自のフロンティア モデルと比較します。

CASE 02ベンチマーク
ベンチマークとフロンティア評価

コードアリーナフロントエンドランキング

このケースを使用して、アリーナ スタイルの比較によって判断される実際のフロントエンド コーディング タスクで GLM-5.2 を評価します。

CASE 03ベンチマーク
ベンチマークとフロンティア評価

デザインアリーナ1位

このケースを使用して、GLM-5.2 がテキスト中心のコーディング ベンチマークだけではなく、デザインとコードのタスクを処理できるかどうかを判断します。

CASE 04ベンチマーク
ベンチマークとフロンティア評価

FrontierSWEの結果

FrontierSWE の投稿を使用して、ソフトウェア エンジニアリング タスクに関して GLM-5.2 を GPT-5.5、Opus、および Fable スタイルのモデルと比較します。

CASE 05ベンチマーク
ベンチマークとフロンティア評価

DeepSWE オープンソース リーダー

DeepSWE のケースを使用して、難しいソフトウェア エンジニアリングの評価タスク用の強力なオープン モデルとしての GLM-5.2 を理解します。

CASE 06ベンチマーク
ベンチマークとフロンティア評価

ターミナルベンチが 80% 以上

端末指向のコーディングおよびエージェント ワークフローについて GLM-5.2 を評価する場合は、このケースを使用してください。

CASE 07評価
ベンチマークとフロンティア評価

SWELancer と GPT-5.5 の比較

この SWELancer のケースを、タスクの成功、報酬、完了時間に関する GLM-5.2 と GPT-5.5 の具体的なマルチメトリクスの比較として使用します。

CASE 08ベンチマーク
ベンチマークとフロンティア評価

BridgeBench パーフェクト スコア シグナル

このケースを使用して、リーダーボードをコーディングするだけではなく、根拠に基づいた複数ステップの推論に基づいて GLM-5.2 を検査します。

CASE 09ベンチマーク
ベンチマークとフロンティア評価

BridgeBench 推論その 1

このケースを使用して、根拠のある推論タスクに関して GLM-5.2 をクローズド フロンティア モデルと比較します。

CASE 10評価
ベンチマークとフロンティア評価

KernelBench - ショートカットなしのハード

ベンチマークのゲインがショートカットではなく有効な実装動作によるものであるかどうかを確認する場合は、このケースを使用してください。

CASE 11ベンチマーク
ベンチマークとフロンティア評価

ルーンスケープベンチの追い上げ

このケースは、ゲームのようなベンチマーク タスクにおける無重みモデルの進行状況を示す速い信号として使用します。

CASE 12ベンチマーク
ベンチマークとフロンティア評価

BridgeBench の速度向上

このケースを使用して、インテリジェンスとともに速度が重要となる、レイテンシーに敏感なワークフローを評価します。

CASE 60ベンチマーク
ベンチマークとフロンティア評価

KernelBench ハードおよびメガ GPU コーディング

このケースを使用して、KernelBench-Hard と KernelBench-Mega にわたる GPU カーネル コーディングで GLM-5.2 を評価します。オープン エージェント トレースにより結果が検査可能になります。

CASE 70ベンチマーク
ベンチマークとフロンティア評価

DeepSWE Max-Effort オープンソース首位

最大 effort 設定の DeepSWE で GLM-5.2 を追跡するためのケースです。公開リーダーボードでは open model 中 1 位、pass@1 は 44% と示されています。

CASE 72ベンチマーク
ベンチマークとフロンティア評価

LLM Debate Benchmark 準優勝

コーディング以外でも GLM-5.2 を評価するためのケースです。敵対的な multi-turn debate で、max-reasoning variant が Claude 系に次ぐ 2 位となっています。

CASE 76評価
ベンチマークとフロンティア評価

AA-Omniscience hallucination rate

不確実性の扱いを比較するためのケースです。公開された AA-Omniscience 結果では、GLM-5.2 の hallucination rate は複数の frontier model より低くなっています。

CASE 90評価
ベンチマークとフロンティア評価

GDPval-AA エージェント作業指数

コーディング専用のリーダーボードではなく、長期的な知識労働で GLM-5.2 を比較するためのケースです。

CASE 94評価
ベンチマークとフロンティア評価

ゲーム デベロッパー アリーナ 準優勝

ゲーム構築品質で GLM-5.2 を判断するためのケースです。Game Dev Arena で 2 位に入り、その順位ではオープンウェイト陣営の最上位になりました。

CASE 120ベンチマーク
ベンチマークとフロンティア評価

PostTrainBench 信頼性首位

見出しスコアだけでなく、84 タスクで failed run が 0 件だったという agent reliability も含めて GLM-5.2 Max を比較するためのケースです。

CASE 121評価
ベンチマークとフロンティア評価

Fireworks + Faros 211件リポジトリ課題評価

公開 benchmark だけでなく private repo の実務 engineering task で GLM-5.2 を判断するためのケースです。公開値には score、speed、task あたりの cost が含まれています。

CASE 110ベンチマーク
ベンチマークとフロンティア評価

AA-Briefcase タスク時間フロンティア

ベンチマークスコアだけでなく、1 タスクあたり時間も重要な長期知識労働で GLM-5.2 を比較するためのケースです。

CASE 111ベンチマーク
ベンチマークとフロンティア評価

Code Arena Frontend 直接対決マージン

単一の順位スクリーンショットではなく、ペアごとの直接対決結果から GLM-5.2 のフロントエンド優位を確認するためのケースです。

CASE 113ベンチマーク
ベンチマークとフロンティア評価

SWE Atlas Codebase QnA 準優勝

単一タスクの SWE リーダーボードだけでなく、Codebase QnA、テスト作成、リファクタリング全体で GLM-5.2 を追うためのケースです。

CASE 257連携
コーディングエージェントと長文脈ワークフロー

OpenCodex モデル切り替えワークフロー

このケースは、1 つの model に固定せず Codex 中心の coding loop の中で GLM-5.2 を切り替えて使いたいときに役立ちます。vista8 によると、OpenCodex では同じ環境のまま frontend design、backend work、ライブ X search に応じて GLM 5.2、Kimi K3、GPT-5.6 Sol、Grok 4.5 を切り替えられるためです。

CASE 255連携
コーディングエージェントと長文脈ワークフロー

Hermes 11-Agent ハイブリッドラボ

このケースは、1 つの monolithic assistant ではなく、GLM-5.2 を含む役割ベースの multi-agent lab を組みたいときに役立ちます。MichaelGannotti によると、11-agent の Hermes 構成が DGX Spark、Ryzen workstation、cloud models 間で task を動的に振り分け、software、research、marketing、coordination を回しているためです。

CASE 243評価
コーディングエージェントと長文脈ワークフロー

Hermes ハイブリッド API 同等運用

このケースは、自己ホストの GLM-5.2 coding agent を公式ルートと比較検証したいときに使えます。dangerm00se によると、4x RTX 6000 PCIe 上の Hermes と GLM-5.2 の hybrid は official API の 60 タスク中 59 件で一致し、3,149 tok/s の prefill、0.37 秒の warm TTFT、35.9 tok/s の decode を出したためです。

CASE 237連携
コーディングエージェントと長文脈ワークフロー

LM Studio Bionic GLM エージェント

このケースは、ローカル優先の GLM-5.2 coding agent を評価したいときに使えます。chenzeling4 によると、LM Studio Bionic は GLM 5.2 にローカル document sandbox、inline code diff、rollback checkpoint、端末内 voice transcription を組み合わせているためです。

CASE 236評価
コーディングエージェントと長文脈ワークフロー

Claude Code の Web 開発品質優位

このケースは、単純な完了速度ではなく初回生成時の Web 開発品質を比較したいときに使えます。Lumenix0 によると、Claude Code 上の GLM 5.2 は 3 つの実タスクで、Codex 上の GPT 5.5 を design quality と機能完成度で上回ったためです。

表示中 48 / 258

BUILD WITH EVOLINK / 04

GLM-5.2の事例を自分のワークフローへ

EvoLinkからモデルに接続し、実証済みの事例を起点に構築できます。