Featured image of post 四模型 Coding Agent 实测评分卡:Grok 4.6 / Qwen3.8-Max / DeepSeek-V4 Pro / GLM-5.2

四模型 Coding Agent 实测评分卡:Grok 4.6 / Qwen3.8-Max / DeepSeek-V4 Pro / GLM-5.2

2026-08-13 用 DeepSWE/SWE-rebench/Terminal-Bench 官方榜定向补测四个候选主力模型;DeepSWE 是唯一全覆盖的榜;GLM-5.2 rebench 强(62.9%)但 DeepSWE 弱(44%)——长程日常别被 rebench 骗;附成本/成功与路由建议。

结论先讲:这篇是上一篇《选日常 Coding Agent 主力模型:别再只看 SWE-bench 第一》的定向补测——把四个候选(grok-4.6、qwen3.8-max、deepseek-v4-pro、glm-5.2)放到官方榜上逐个钉分。四个里没有谁能压过公开前沿(claude-opus-5 74% / gpt-5.6-sol 73% / fable-5 70%);但论「便宜+够用」,有一条清晰的路由:GLM-5.2 当 80% 日常、Grok 4.6 顶硬任务、DeepSeek-V4 Pro 当廉价子 agent。最关键一个红灯:GLM-5.2 在「修新 issue」上排第 4,在「原创长程工程」上却近榜底——你的日常更接近后者,别被前者骗了。

为什么单独发这篇

上一篇讲的是「该盯哪几个公开榜」(Terminal-Bench / SWE-rebench / DeepSWE + 成本看板)。这篇回答的是更具体的问题:我手边这四个模型,到底谁该当主力? 所以方法不一样——不是泛泛看榜,是针对这四个逐个去官方页核对,能用就用,查不到就老老实实写「不在榜」,不编。

方法:4 个 research agent 并行 Grok 网搜 → 4 个 verify agent 逐条回查官方源 → 再对官方榜(swe-rebench.com / deepswe.datacurve.ai / tbench.ai)做最后一道源核对。时点 2026-08-13。

评分卡(官方源核对后)

先说一个意外发现:DeepSWE 是今天唯一一个四个模型都有官方数据的榜。 Terminal-Bench 2.1 对这四个几乎零覆盖(都不在官方榜),SWE-rebench 只覆盖到两个。所以横向比这四个,只能拿 DeepSWE 当主轴,rebench 作补充。

模型DeepSWE v1.1(8/13 更新·113题)SWE-rebench(15/05–01/07·111题)Terminal-Bench 2.1
Grok 4.667%±2% [xhigh] · $5.50 · 71k tok · 87步 ✅4.6 不在榜;4.5=63.8%/$1.474.6 不在官方榜
DeepSeek-V4 Pro63%±6% [max] · $0.06 · 106k · 155步 ✅40.2%/$0.15(第14)67.9% 是厂商自报、被驳回 ❌
Qwen3.8-Max57%±3% [xhigh] · $3.73 · 95k · 111步 ✅缺行不在官方榜
GLM-5.244%±2% [max] · $3.92 · 78k · 129步 ✅62.9%/$1.40(第4,Pass@5 81.1% 全榜第一)81%?第三方站报的、官方未确认 ⚠️

(✅ 官方榜直接核对;⚠️ 第三方存疑;❌ verify 驳回——厂商自报数字对不上官方榜。)

锚点参考(DeepSWE 同榜的公开前沿):claude-opus-5 [max] 74%/$11.84、gpt-5.6-sol [max] 73%/$8.39、claude-fable-5 [max] 70%/$21.63、kimi-k3 [max] 69%/$4.65。四个候选里最高的 Grok 4.6(67%)也只能排到中上,离前沿还差一截。

最重要的红灯:GLM-5.2 的严重分裂

如果只看 SWE-rebench,GLM-5.2 是这四个里最漂亮的——排第 4(62.9%),而且 Pass@5 是全榜第一(81.1%),意思是给它 5 次重试机会,它能修好的题比谁都多;加上 $1.40/题、已经接进 CPA 网关,看起来就是天生当主力的料。

但切到 DeepSWE,它只有 44%±2%,在 23 个模型里接近垫底。

为什么差这么多?两个榜测的不是一回事:

  • SWE-rebench = 拿「新鲜的、真实的 GitHub issue」让你修。模型对公开代码库的常见 issue 模式往往有记忆/熟悉度,修起来顺手。
  • DeepSWE = 「原创长程工程任务」,从零写、solution 要 5.5 倍代码量、2 倍输出 token,而且反污染——任务是从零构造的,预训练里没见过答案。这测的是真·长程工程能力。

你的日常是哪种?打开 Claude Code 丢一个真实仓库、改多文件、跑测试、看报错再改、顺手 Docker/Git/WSL/部署——这是长会话、原创改动的活,形态上更接近 DeepSWE,不是修现成 issue 的 SWE-rebench。

所以 rebench 的高分对你的日常有误导性。44% 才是更该盯的警戒线: GLM-5.2 擅长「修新 issue」,却不擅长「从零做长程工程」。

这不代表它不能当主力——它便宜、已集成、Pass@5 第一说明 retry-heavy 场景(反复重试的 debug)它很强。但最硬的长程原创任务别指望它顶,那些该路由给 Grok 4.6(67%)或直接用前沿。

成本/成功:你该真正优化的 KPI

旧报告的核心主张:别看裸分,看「每成功完成一个真实任务花多少钱」。DeepSWE 上粗算($/题 ÷ Pass@1):

  • DeepSeek-V4 Pro:约 $0.10/成功——碾压级便宜(但成功率也低,量大才划算)
  • Qwen3.8-Max:约 $6.5/成功
  • Grok 4.6:约 $7.5/成功
  • GLM-5.2:DeepSWE 成本未取到;rebench 口径约 $2.2/成功(注意这是修 issue 口径,不是长程)

单论「每成功一个长程任务花的钱」,DeepSeek-V4 Pro 便宜到异常,但成功率低;Grok 4.6 / Qwen3.8-Max 成功率高一截但贵约 60–75 倍。这就是为什么该走路由而不是死磕一个。

路由建议

1
2
3
4
Primary(80% 日常 / retry-heavy issue):  GLM-5.2        # 便宜+Pass@5第一,但长程上限低
Hard / 长程原创工程:                     Grok 4.6 或 claude-opus-5/gpt-5.6 前沿  # DeepSWE 67%+
Worker/Cheap(批量 / 子 agent):           DeepSeek-V4 Pro   # $0.06/题碾压级便宜(先验工具格式)
Challenger(待私有终审):                 Qwen3.8-Max       # 公开数据中段,不足定论

几点必须说清:

  • DeepSeek-V4 Pro 当子 agent 要先验工具格式。 DeepSeek 的 flash 档以前实测过:慢 4.8 倍、啰嗦 5.8 倍,不适合「又快又短」的子 agent;v4-pro 是推理档,得另测,别直接套用。
  • Grok 4.6 只有 DeepSWE 一个数据点,没 rebench/TB 交叉。而且 xAI/grok 在自建代理栈里有配额和稳定性历史坑,接入前心里有数。
  • GLM-5.2 的「Terminal-Bench 81%」我没法在官方榜确认——是第三方站(layer3labs)报的,别据此当它是 TB 冠军。
  • DeepSeek「TB 67.9% 排第一」是子 agent 幻觉。 调研阶段报了这个数,verify 阶段直接驳回:它不在官方 2.1 榜,67.9% 是厂商自报。这正是为什么核验阶段不能省。

诚实边界

以上全是公开 harness 的分。Princeton HAL 早就证明:同一个模型换一套 scaffold(工具配置、重试策略、上下文管理、补丁策略),分数能差几十个百分点。所以——

公开榜只做 shortlist,终审必须回到你自己的 Personal Suite:固定 Claude Code(或你主用的 harness)+ 你自己的仓库任务,记录每个模型的「成功数 / $ / token / 步数 / 是否跑偏 / 是否引入回归」。

GLM-5.2 的 rebench↔DeepSWE 分裂,恰好说明「不能只看一个榜定主力」——尤其当一个榜恰好是你擅长的、另一个恰好暴露短板的时候。

每隔一两个月,用固定套件把 GPT / Claude / Gemini / DeepSeek / Kimi / Qwen / GLM / MiniMax 重测一遍,看「每成功一个真实任务花多少钱、多少时间、多少人工接管」,那才是选主力的真秤。

一手源