结论先讲:日常用 Claude Code / Codex 写代码,不该再把「SWE-bench 第一」当成选主力的唯一尺子。2026 年更靠谱的公开组合是 Terminal-Bench + SWE-rebench/DeepSWE + 成本看板;最终判决还得回到你自己的仓库任务。
你要评的不是“会写函数”,是“能长期当工程师”
如果你的用法是:
- 打开 Claude Code / Codex / OpenCode
- 丢给它一个真实仓库
- 让它自己读代码、改多文件、跑测试、看报错、再改
- 顺手碰 Docker、Git、Linux、部署
那你评的对象就不是传统 coding model,而是 Software Engineering Agent。
HumanEval 那种「根据 docstring 写一个函数」当然还能测智力的边角,但和你每天的工作流几乎不是同一种运动。
2026 年榜单格局变了什么
粗线条是这条进化链:
会聊天 → 会写代码 → 会当 coding agent → 想当自动软件工程师
对应评测也在换代:
- 函数生成榜(HumanEval / MBPP)——多数已经顶满,区分不动前沿模型。
- 仓库 issue 榜(SWE-bench 家族)——曾经是标准答案;Verified 子集在 2026 被证明污染、测例质量、饱和三重问题。OpenAI 甚至公开写了为什么不再用 SWE-bench Verified 衡量前沿 coding。
- 终端与长程 agent 榜(Terminal-Bench、DeepSWE、SWE-rebench)——更接近真实 agent 闭环,并且开始认真报 每题成本 / token / 步数。
一句话:评测中心已经从「写得对不对」挪到「在环境里能不能闭环,以及花多少钱闭环」。
只盯三个公开榜就够了
第一优先:Terminal-Bench
官网:tbench.ai
它测的是 agent 在终端里装依赖、改文件、跑命令、完成任务的能力。形态上最像你每天开着的 Claude Code / Codex。
2026-08 我在 2.1 榜 看到的切片大意是:
- Claude Code + Fable 5:约 83.8%
- Codex + GPT-5.5:约 83.1%
- 同模型换 agent,名次和成本都会动
读法很重要:不要只看全场第一。先看你实际在用的 harness 那一行。
第二优先:SWE-rebench,并排看 DeepSWE
- SWE-rebench:按时间窗口滚新鲜 GitHub 问题,抗“背题”;榜上直接给成功率、Pass@5、每题美元、每题 token。
- DeepSWE:偏原创长程工程任务,同时报成本、输出 token、agent 步数。
这两个比“已经挤到 90%+ 的 SWE-bench Verified”更适合 2026 年做横向筛选。
例如 SWE-rebench 某一窗口里,头部模型成功率可能都在 60% 上下,但每题成本能差好几倍——这才是选日常主力时真正刺痛的地方。DeepSWE 上也常见:有的模型 70% 出头但很贵,有的略低却便宜一个数量级。
需要更硬、更抗污染的静态天花板时,再补 SWE-bench Pro(Scale,copyleft 公集 + 私有仓设计)。
第三优先:Artificial Analysis Coding Agent Index
它把 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 等权合成,并强调 cost per task。适合当“快速仪表盘”,不适合当唯一真理。
如果只能盯一个
Terminal-Bench,而且固定看你自己的 harness。
原因很朴素:你 80% 的时间都活在“终端 agent 循环”里。一个模型如果在这个形态上不稳,SWE 旧榜再高也救不了日常体感。
为什么榜一不等于最好用
常见错位:
- Verified 很高:可能吃到了老题、特化 harness,或“过测例但不可 merge”。
- 竞赛榜很高:算法强,大仓改不动。
- 绝对分高一点:token 翻倍,日耗受不了。
- 某官方 scaffold 第一:换到 Claude Code 的工具协议就掉。
背后还有一个被严重低估的变量:harness dependence(脚手架依赖)。
Princeton 的 HAL 把成绩拆成「模型 × scaffold × benchmark」。同模型换 scaffold,分差可以到几十个百分点。所以:
- 比模型,必须固定 harness
- 比 harness,必须固定模型
- 厂商不说清楚 scaffold / 重试 / best-of-N 的分数,当营销看
冲突时怎么判
假设:
- A 在 SWE 第一
- B 在 Terminal-Bench 第一
- C 在 LiveCodeBench 第一
按这个顺序:
- 你固定 harness 上的 Terminal-Bench
- SWE-rebench / DeepSWE 的 成功单价(钱和 token)
- 你自己的私有任务集终审
- LiveCodeBench 默认没有投票权,除非你大量写竞赛型算法
哪些榜可以直接放过
- HumanEval / MBPP:饱和 + 和工作流不匹配
- 把 SWE-bench Verified 当 2026 唯一主依据
- 没披露 harness 的发布会数字
- OSWorld / GAIA / 浏览器 agent 榜:除非你主业就是 computer-use
LiveCodeBench 可以当“还聪不聪明”的旁证,别当选 Claude Code 主力的主证据。
真正该优化的 KPI
别再只优化 Accuracy。日常主力更该看:
- 任务最终成功率(仓库终态,不是最后一句回复)
- 每个成功任务花多少钱
- 每个成功任务烧多少 token
- 每个成功任务要等多久
- 长任务会不会中途跑偏
- 回归率、人工接管次数
一句话:
在我的 Claude Code 工作流里,每成功完成一个真实软件工程任务,要花多少钱、多少时间、多少次人工救场?
公开榜只是滤网,私有套件才是判决
没有任何单一公开榜能完整代表一个人的仓库分布、权限边界和工程审美。比较诚实的流程是:
- 用 Terminal-Bench + SWE-rebench/DeepSWE + 成本看板,筛出 4–6 个候选
- 固定 Claude Code(或你主用的 agent)
- 用 20–30 道自己的题做终审:修 bug、加功能、重构、Docker、Git、API、长任务
- 按「成功率 × 成本 × 长程稳定性」定 Primary / Reasoning / Fast 三档路由
是的,我更建议 模型路由,而不是迷信一个绝对主力包打天下。
你要评的四台候选:Grok 4.6 / Qwen3.8-Max / DeepSeek-V4 Pro / GLM-5.2
上面讲的是尺子。尺子定完,才轮到你点名的这四个日常候选。
数据以 2026-08-13 能打开的官方页为准;DeepSeek-V4 Pro 0813 如果是窗口之后的热修,公开滚动榜可能还没吃进去,下面会标明。
先看 DeepSWE(长程工程 + 每题成本)
来源:deepswe.datacurve.ai(v1.1,页面标注更新到 2026-08-13)
| 模型 | 档位 | Pass@1 | 约 $/题 | 约输出 token | 约步数 | 怎么读 |
|---|---|---|---|---|---|---|
| Grok 4.6 | xhigh | 67% ±2% | $5.50 | 71k | 87 | 四家里成功率最高档之一,单价中等偏高 |
| DeepSeek-V4 Pro | max | 63% ±6% | $0.06 | 106k | 155 | 成功率接近头部,成功单价极低;步数偏多、方差更大 |
| Qwen3.8-Max | xhigh | 57% ±3% | $3.73 | 95k | 111 | 中上成功率,价格中等 |
| GLM-5.2 | max | 44% ±2% | $3.92 | 78k | 129 | 这张长程工程榜上偏弱,不宜只靠它吹“工程全能” |
对照锚点(同页):Claude Opus 5 max 约 74% / $11.84;GPT-5.6 Sol max 约 73% / $8.39。
也就是说:这四台里,没有谁在 DeepSWE 上碾压闭源第一梯队;但 DeepSeek-V4 Pro 的 $/成功 非常好看。
再看 SWE-rebench(新鲜仓库 issue + $/题)
来源:swe-rebench.com
页面窗口切片:2026-05-15 → 2026-07-01(111 problems / 65 repos)
| 模型 | Resolved | Pass@5 | $/题 | 备注 |
|---|---|---|---|---|
| GLM-5.2 high | 62.9% ±1.19% | 81.1% | $1.40 | 四家里(在该窗有分的)成功率最高,Pass@5 也最猛 |
| Grok 4.5 high | 63.8% | 77.5% | $1.47 | 有 4.5,没有 Grok 4.6 行 |
| DeepSeek-V4 Pro high | 40.2% ±1.29% | 64.0% | $0.15 | 成功率明显低于 GLM,但很便宜 |
| Qwen3.8-Max | — | — | — | 该窗未上榜(只有 Qwen3.6 小模型档) |
| Grok 4.6 | — | — | — | 该窗未上榜 |
读法:
- GLM-5.2 更像“新鲜真实 issue 修补很稳”的日常主力候选。
- DeepSeek-V4 Pro 在这张榜上成功率一般,但极便宜——更像高性价比 / 子 agent / 大规模试错。
- Grok 4.6、Qwen3.8-Max 不能拿这个窗口直接定生死,缺行 ≠ 很差,只是公开滚动窗还没给你可比数据。
- DeepSeek-V4 Pro 0813:若是 8 月中热更,上述 rebench 窗口天然覆盖不到;0813 相关宣传分(尤其 Terminal-Bench)先当厂商/二手信号,等官方 harness 复测再信。
Terminal-Bench 上这四台呢?
Terminal-Bench 2.1 已验证榜 当前展示的是 Claude Code / Codex / Cursor / Terminus 等行,没有把 Grok 4.6、Qwen3.8-Max、DeepSeek-V4 Pro 0813、GLM-5.2 完整放进同一张已验证主表。
2.0 历史榜里更多是旧版 GLM/DeepSeek/Qwen/Grok,不能拿来代表 4.6 / 3.8-max / V4 Pro / 5.2 今日体感。
所以对这四个候选,Terminal-Bench 的正确用法不是“看现成名次”,而是:
你自己用 Claude Code(或 Codex)挂这四个模型,按官方 harbor 协议各跑一轮。
这正是 TB 的设计目的:agent × model 一起测。
四台候选的实用排位(在“公开数据 + 你的用法”下)
这不是最终名次,是 shortlist 建议——最终仍要过你的 Claude Code 私有题。
GLM-5.2 — 最像“日常主 agent”的公开信号
rebench 成功率顶格;DeepSWE 一般说明它更吃“issue/仓库修补”分布,长程原创工程不是强项。适合先当 Primary 候选。DeepSeek-V4 Pro(含你说的 0813)— 最像“便宜强力工兵”
DeepSWE 成功率尚可且 $ 极低;rebench 成功率一般。适合 大规模子任务 / 初筛 / 穷举修补,0813 是否把终端 agent 拉上天,必须你本地 TB/私有题验收。Grok 4.6 — DeepSWE 四家里最能打的上限型
长程工程成功率最好看,但更贵;rebench 还缺 4.6 行。适合当 难任务 / Reasoning 档 候选,不急着全量替换日用。Qwen3.8-Max — 中位均衡,数据最不齐
DeepSWE 中上、单价中等;rebench/TB 公开行不足。值得进私有终审,但现在还不够格只靠公开榜封神或淘汰。
和闭源锚点怎么比(避免自我安慰)
同日 DeepSWE 上,Opus 5 / GPT-5.6 Sol 仍在 ~70%+ 且更贵。
对你这种“长期 agent 开发”:
- 若预算紧、任务可并行: GLM-5.2 主 + DeepSeek-V4 Pro 子 很合理
- 若单次难度高、愿意加钱:把 Grok 4.6 放进难任务路由
- Qwen3.8-Max 先当对照,跑完你自己的 20 题再决定是否挤进主路由
针对这四台的最小验收清单(比再刷榜有用)
固定 Claude Code,每模型同一套题:
- 3 个真实多文件 bug
- 2 个加功能 + 测试
- 2 个 Docker/WSL/依赖坑
- 1 个 90 分钟长任务
- 记录:成功率、$/成功、是否跑偏、工具调用是否炸格式
谁赢,谁当主力。公开表只负责告诉你:这四个都值得测,且测的时候别再用 HumanEval 决胜。
给你的可执行答案
重点追踪:
- Terminal-Bench
- SWE-rebench / DeepSWE
- Artificial Analysis Coding Agent Index(必要时加 SWE-bench Pro)
第一优先级:Terminal-Bench(看你自己的 harness 行)。
对你点名的四台:公开信号目前更偏向「GLM-5.2 主日常 / DeepSeek-V4 Pro 打性价比 / Grok 4.6 攻坚 / Qwen3.8-Max 待补数」。
别再把 HumanEval、MBPP、已经饱和的 SWE-bench Verified 当作主要决策依据。
公开榜负责减少噪音;你自己的任务集负责做决定。
调研时点:2026-08-13。榜上具体分数会周更;DeepSeek-V4 Pro 0813 等热更以你本地复测为准。框架比单次名次更耐用。
