结论先讲:这篇是上一篇《选日常 Coding Agent 主力模型:别再只看 SWE-bench 第一》的定向补测——把四个候选(grok-4.6、qwen3.8-max、deepseek-v4-pro、glm-5.2)放到官方榜上逐个钉分。四个里没有谁能压过公开前沿(claude-opus-5 74% / gpt-5.6-sol 73% / fable-5 70%);但论「便宜+够用」,有一条清晰的路由:GLM-5.2 当 80% 日常、Grok 4.6 顶硬任务、DeepSeek-V4 Pro 当廉价子 agent。最关键一个红灯:GLM-5.2 在「修新 issue」上排第 4,在「原创长程工程」上却近榜底——你的日常更接近后者,别被前者骗了。
为什么单独发这篇
上一篇讲的是「该盯哪几个公开榜」(Terminal-Bench / SWE-rebench / DeepSWE + 成本看板)。这篇回答的是更具体的问题:我手边这四个模型,到底谁该当主力? 所以方法不一样——不是泛泛看榜,是针对这四个逐个去官方页核对,能用就用,查不到就老老实实写「不在榜」,不编。
方法:4 个 research agent 并行 Grok 网搜 → 4 个 verify agent 逐条回查官方源 → 再对官方榜(swe-rebench.com / deepswe.datacurve.ai / tbench.ai)做最后一道源核对。时点 2026-08-13。
评分卡(官方源核对后)
先说一个意外发现:DeepSWE 是今天唯一一个四个模型都有官方数据的榜。 Terminal-Bench 2.1 对这四个几乎零覆盖(都不在官方榜),SWE-rebench 只覆盖到两个。所以横向比这四个,只能拿 DeepSWE 当主轴,rebench 作补充。
| 模型 | DeepSWE v1.1(8/13 更新·113题) | SWE-rebench(15/05–01/07·111题) | Terminal-Bench 2.1 |
|---|---|---|---|
| Grok 4.6 | 67%±2% [xhigh] · $5.50 · 71k tok · 87步 ✅ | 4.6 不在榜;4.5=63.8%/$1.47 | 4.6 不在官方榜 |
| DeepSeek-V4 Pro | 63%±6% [max] · $0.06 · 106k · 155步 ✅ | 40.2%/$0.15(第14) | 67.9% 是厂商自报、被驳回 ❌ |
| Qwen3.8-Max | 57%±3% [xhigh] · $3.73 · 95k · 111步 ✅ | 缺行 | 不在官方榜 |
| GLM-5.2 | 44%±2% [max] · $3.92 · 78k · 129步 ✅ | 62.9%/$1.40(第4,Pass@5 81.1% 全榜第一) | 81%?第三方站报的、官方未确认 ⚠️ |
(✅ 官方榜直接核对;⚠️ 第三方存疑;❌ verify 驳回——厂商自报数字对不上官方榜。)
锚点参考(DeepSWE 同榜的公开前沿):claude-opus-5 [max] 74%/$11.84、gpt-5.6-sol [max] 73%/$8.39、claude-fable-5 [max] 70%/$21.63、kimi-k3 [max] 69%/$4.65。四个候选里最高的 Grok 4.6(67%)也只能排到中上,离前沿还差一截。
最重要的红灯:GLM-5.2 的严重分裂
如果只看 SWE-rebench,GLM-5.2 是这四个里最漂亮的——排第 4(62.9%),而且 Pass@5 是全榜第一(81.1%),意思是给它 5 次重试机会,它能修好的题比谁都多;加上 $1.40/题、已经接进 CPA 网关,看起来就是天生当主力的料。
但切到 DeepSWE,它只有 44%±2%,在 23 个模型里接近垫底。
为什么差这么多?两个榜测的不是一回事:
- SWE-rebench = 拿「新鲜的、真实的 GitHub issue」让你修。模型对公开代码库的常见 issue 模式往往有记忆/熟悉度,修起来顺手。
- DeepSWE = 「原创长程工程任务」,从零写、solution 要 5.5 倍代码量、2 倍输出 token,而且反污染——任务是从零构造的,预训练里没见过答案。这测的是真·长程工程能力。
你的日常是哪种?打开 Claude Code 丢一个真实仓库、改多文件、跑测试、看报错再改、顺手 Docker/Git/WSL/部署——这是长会话、原创改动的活,形态上更接近 DeepSWE,不是修现成 issue 的 SWE-rebench。
所以 rebench 的高分对你的日常有误导性。44% 才是更该盯的警戒线: GLM-5.2 擅长「修新 issue」,却不擅长「从零做长程工程」。
这不代表它不能当主力——它便宜、已集成、Pass@5 第一说明 retry-heavy 场景(反复重试的 debug)它很强。但最硬的长程原创任务别指望它顶,那些该路由给 Grok 4.6(67%)或直接用前沿。
成本/成功:你该真正优化的 KPI
旧报告的核心主张:别看裸分,看「每成功完成一个真实任务花多少钱」。DeepSWE 上粗算($/题 ÷ Pass@1):
- DeepSeek-V4 Pro:约 $0.10/成功——碾压级便宜(但成功率也低,量大才划算)
- Qwen3.8-Max:约 $6.5/成功
- Grok 4.6:约 $7.5/成功
- GLM-5.2:DeepSWE 成本未取到;rebench 口径约 $2.2/成功(注意这是修 issue 口径,不是长程)
单论「每成功一个长程任务花的钱」,DeepSeek-V4 Pro 便宜到异常,但成功率低;Grok 4.6 / Qwen3.8-Max 成功率高一截但贵约 60–75 倍。这就是为什么该走路由而不是死磕一个。
路由建议
| |
几点必须说清:
- DeepSeek-V4 Pro 当子 agent 要先验工具格式。 DeepSeek 的 flash 档以前实测过:慢 4.8 倍、啰嗦 5.8 倍,不适合「又快又短」的子 agent;v4-pro 是推理档,得另测,别直接套用。
- Grok 4.6 只有 DeepSWE 一个数据点,没 rebench/TB 交叉。而且 xAI/grok 在自建代理栈里有配额和稳定性历史坑,接入前心里有数。
- GLM-5.2 的「Terminal-Bench 81%」我没法在官方榜确认——是第三方站(layer3labs)报的,别据此当它是 TB 冠军。
- DeepSeek「TB 67.9% 排第一」是子 agent 幻觉。 调研阶段报了这个数,verify 阶段直接驳回:它不在官方 2.1 榜,67.9% 是厂商自报。这正是为什么核验阶段不能省。
诚实边界
以上全是公开 harness 的分。Princeton HAL 早就证明:同一个模型换一套 scaffold(工具配置、重试策略、上下文管理、补丁策略),分数能差几十个百分点。所以——
公开榜只做 shortlist,终审必须回到你自己的 Personal Suite:固定 Claude Code(或你主用的 harness)+ 你自己的仓库任务,记录每个模型的「成功数 / $ / token / 步数 / 是否跑偏 / 是否引入回归」。
GLM-5.2 的 rebench↔DeepSWE 分裂,恰好说明「不能只看一个榜定主力」——尤其当一个榜恰好是你擅长的、另一个恰好暴露短板的时候。
每隔一两个月,用固定套件把 GPT / Claude / Gemini / DeepSeek / Kimi / Qwen / GLM / MiniMax 重测一遍,看「每成功一个真实任务花多少钱、多少时间、多少人工接管」,那才是选主力的真秤。
