Featured image of post 选日常 Coding Agent 主力模型:别再只看 SWE-bench 第一

选日常 Coding Agent 主力模型:别再只看 SWE-bench 第一

2026 年公开榜怎么读:Terminal-Bench 第一优先,SWE-rebench/DeepSWE 看成功成本,HumanEval 与饱和 Verified 别再当决策依据;附个人终审套件。

结论先讲:日常用 Claude Code / Codex 写代码,不该再把「SWE-bench 第一」当成选主力的唯一尺子。2026 年更靠谱的公开组合是 Terminal-Bench + SWE-rebench/DeepSWE + 成本看板;最终判决还得回到你自己的仓库任务。

你要评的不是“会写函数”,是“能长期当工程师”

如果你的用法是:

  • 打开 Claude Code / Codex / OpenCode
  • 丢给它一个真实仓库
  • 让它自己读代码、改多文件、跑测试、看报错、再改
  • 顺手碰 Docker、Git、Linux、部署

那你评的对象就不是传统 coding model,而是 Software Engineering Agent

HumanEval 那种「根据 docstring 写一个函数」当然还能测智力的边角,但和你每天的工作流几乎不是同一种运动。

2026 年榜单格局变了什么

粗线条是这条进化链:

会聊天 → 会写代码 → 会当 coding agent → 想当自动软件工程师

对应评测也在换代:

  1. 函数生成榜(HumanEval / MBPP)——多数已经顶满,区分不动前沿模型。
  2. 仓库 issue 榜(SWE-bench 家族)——曾经是标准答案;Verified 子集在 2026 被证明污染、测例质量、饱和三重问题。OpenAI 甚至公开写了为什么不再用 SWE-bench Verified 衡量前沿 coding
  3. 终端与长程 agent 榜Terminal-BenchDeepSWESWE-rebench)——更接近真实 agent 闭环,并且开始认真报 每题成本 / token / 步数

一句话:评测中心已经从「写得对不对」挪到「在环境里能不能闭环,以及花多少钱闭环」。

只盯三个公开榜就够了

第一优先:Terminal-Bench

官网:tbench.ai

它测的是 agent 在终端里装依赖、改文件、跑命令、完成任务的能力。形态上最像你每天开着的 Claude Code / Codex。

2026-08 我在 2.1 榜 看到的切片大意是:

  • Claude Code + Fable 5:约 83.8%
  • Codex + GPT-5.5:约 83.1%
  • 同模型换 agent,名次和成本都会动

读法很重要:不要只看全场第一。先看你实际在用的 harness 那一行。

第二优先:SWE-rebench,并排看 DeepSWE

  • SWE-rebench:按时间窗口滚新鲜 GitHub 问题,抗“背题”;榜上直接给成功率、Pass@5、每题美元、每题 token。
  • DeepSWE:偏原创长程工程任务,同时报成本、输出 token、agent 步数。

这两个比“已经挤到 90%+ 的 SWE-bench Verified”更适合 2026 年做横向筛选。

例如 SWE-rebench 某一窗口里,头部模型成功率可能都在 60% 上下,但每题成本能差好几倍——这才是选日常主力时真正刺痛的地方。DeepSWE 上也常见:有的模型 70% 出头但很贵,有的略低却便宜一个数量级。

需要更硬、更抗污染的静态天花板时,再补 SWE-bench Pro(Scale,copyleft 公集 + 私有仓设计)。

第三优先:Artificial Analysis Coding Agent Index

入口:Coding Agents 看板

它把 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA 等权合成,并强调 cost per task。适合当“快速仪表盘”,不适合当唯一真理。

如果只能盯一个

Terminal-Bench,而且固定看你自己的 harness。

原因很朴素:你 80% 的时间都活在“终端 agent 循环”里。一个模型如果在这个形态上不稳,SWE 旧榜再高也救不了日常体感。

为什么榜一不等于最好用

常见错位:

  • Verified 很高:可能吃到了老题、特化 harness,或“过测例但不可 merge”。
  • 竞赛榜很高:算法强,大仓改不动。
  • 绝对分高一点:token 翻倍,日耗受不了。
  • 某官方 scaffold 第一:换到 Claude Code 的工具协议就掉。

背后还有一个被严重低估的变量:harness dependence(脚手架依赖)

Princeton 的 HAL 把成绩拆成「模型 × scaffold × benchmark」。同模型换 scaffold,分差可以到几十个百分点。所以:

  • 比模型,必须固定 harness
  • 比 harness,必须固定模型
  • 厂商不说清楚 scaffold / 重试 / best-of-N 的分数,当营销看

冲突时怎么判

假设:

  • A 在 SWE 第一
  • B 在 Terminal-Bench 第一
  • C 在 LiveCodeBench 第一

按这个顺序:

  1. 你固定 harness 上的 Terminal-Bench
  2. SWE-rebench / DeepSWE 的 成功单价(钱和 token)
  3. 你自己的私有任务集终审
  4. LiveCodeBench 默认没有投票权,除非你大量写竞赛型算法

哪些榜可以直接放过

  • HumanEval / MBPP:饱和 + 和工作流不匹配
  • 把 SWE-bench Verified 当 2026 唯一主依据
  • 没披露 harness 的发布会数字
  • OSWorld / GAIA / 浏览器 agent 榜:除非你主业就是 computer-use

LiveCodeBench 可以当“还聪不聪明”的旁证,别当选 Claude Code 主力的主证据。

真正该优化的 KPI

别再只优化 Accuracy。日常主力更该看:

  • 任务最终成功率(仓库终态,不是最后一句回复)
  • 每个成功任务花多少钱
  • 每个成功任务烧多少 token
  • 每个成功任务要等多久
  • 长任务会不会中途跑偏
  • 回归率、人工接管次数

一句话:

在我的 Claude Code 工作流里,每成功完成一个真实软件工程任务,要花多少钱、多少时间、多少次人工救场?

公开榜只是滤网,私有套件才是判决

没有任何单一公开榜能完整代表一个人的仓库分布、权限边界和工程审美。比较诚实的流程是:

  1. 用 Terminal-Bench + SWE-rebench/DeepSWE + 成本看板,筛出 4–6 个候选
  2. 固定 Claude Code(或你主用的 agent)
  3. 用 20–30 道自己的题做终审:修 bug、加功能、重构、Docker、Git、API、长任务
  4. 按「成功率 × 成本 × 长程稳定性」定 Primary / Reasoning / Fast 三档路由

是的,我更建议 模型路由,而不是迷信一个绝对主力包打天下。

你要评的四台候选:Grok 4.6 / Qwen3.8-Max / DeepSeek-V4 Pro / GLM-5.2

上面讲的是尺子。尺子定完,才轮到你点名的这四个日常候选。
数据以 2026-08-13 能打开的官方页为准;DeepSeek-V4 Pro 0813 如果是窗口之后的热修,公开滚动榜可能还没吃进去,下面会标明。

先看 DeepSWE(长程工程 + 每题成本)

来源:deepswe.datacurve.ai(v1.1,页面标注更新到 2026-08-13)

模型档位Pass@1约 $/题约输出 token约步数怎么读
Grok 4.6xhigh67% ±2%$5.5071k87四家里成功率最高档之一,单价中等偏高
DeepSeek-V4 Promax63% ±6%$0.06106k155成功率接近头部,成功单价极低;步数偏多、方差更大
Qwen3.8-Maxxhigh57% ±3%$3.7395k111中上成功率,价格中等
GLM-5.2max44% ±2%$3.9278k129这张长程工程榜上偏弱,不宜只靠它吹“工程全能”

对照锚点(同页):Claude Opus 5 max 约 74% / $11.84;GPT-5.6 Sol max 约 73% / $8.39。
也就是说:这四台里,没有谁在 DeepSWE 上碾压闭源第一梯队;但 DeepSeek-V4 Pro 的 $/成功 非常好看。

再看 SWE-rebench(新鲜仓库 issue + $/题)

来源:swe-rebench.com
页面窗口切片:2026-05-15 → 2026-07-01(111 problems / 65 repos)

模型ResolvedPass@5$/题备注
GLM-5.2 high62.9% ±1.19%81.1%$1.40四家里(在该窗有分的)成功率最高,Pass@5 也最猛
Grok 4.5 high63.8%77.5%$1.47有 4.5,没有 Grok 4.6 行
DeepSeek-V4 Pro high40.2% ±1.29%64.0%$0.15成功率明显低于 GLM,但很便宜
Qwen3.8-Max该窗未上榜(只有 Qwen3.6 小模型档)
Grok 4.6该窗未上榜

读法:

  • GLM-5.2 更像“新鲜真实 issue 修补很稳”的日常主力候选。
  • DeepSeek-V4 Pro 在这张榜上成功率一般,但极便宜——更像高性价比 / 子 agent / 大规模试错。
  • Grok 4.6、Qwen3.8-Max 不能拿这个窗口直接定生死,缺行 ≠ 很差,只是公开滚动窗还没给你可比数据
  • DeepSeek-V4 Pro 0813:若是 8 月中热更,上述 rebench 窗口天然覆盖不到;0813 相关宣传分(尤其 Terminal-Bench)先当厂商/二手信号,等官方 harness 复测再信。

Terminal-Bench 上这四台呢?

Terminal-Bench 2.1 已验证榜 当前展示的是 Claude Code / Codex / Cursor / Terminus 等行,没有把 Grok 4.6、Qwen3.8-Max、DeepSeek-V4 Pro 0813、GLM-5.2 完整放进同一张已验证主表
2.0 历史榜里更多是旧版 GLM/DeepSeek/Qwen/Grok,不能拿来代表 4.6 / 3.8-max / V4 Pro / 5.2 今日体感

所以对这四个候选,Terminal-Bench 的正确用法不是“看现成名次”,而是:

你自己用 Claude Code(或 Codex)挂这四个模型,按官方 harbor 协议各跑一轮。
这正是 TB 的设计目的:agent × model 一起测。

四台候选的实用排位(在“公开数据 + 你的用法”下)

这不是最终名次,是 shortlist 建议——最终仍要过你的 Claude Code 私有题。

  1. GLM-5.2 — 最像“日常主 agent”的公开信号
    rebench 成功率顶格;DeepSWE 一般说明它更吃“issue/仓库修补”分布,长程原创工程不是强项。适合先当 Primary 候选

  2. DeepSeek-V4 Pro(含你说的 0813)— 最像“便宜强力工兵”
    DeepSWE 成功率尚可且 $ 极低;rebench 成功率一般。适合 大规模子任务 / 初筛 / 穷举修补,0813 是否把终端 agent 拉上天,必须你本地 TB/私有题验收。

  3. Grok 4.6 — DeepSWE 四家里最能打的上限型
    长程工程成功率最好看,但更贵;rebench 还缺 4.6 行。适合当 难任务 / Reasoning 档 候选,不急着全量替换日用。

  4. Qwen3.8-Max — 中位均衡,数据最不齐
    DeepSWE 中上、单价中等;rebench/TB 公开行不足。值得进私有终审,但现在还不够格只靠公开榜封神或淘汰

和闭源锚点怎么比(避免自我安慰)

同日 DeepSWE 上,Opus 5 / GPT-5.6 Sol 仍在 ~70%+ 且更贵。
对你这种“长期 agent 开发”:

  • 若预算紧、任务可并行: GLM-5.2 主 + DeepSeek-V4 Pro 子 很合理
  • 若单次难度高、愿意加钱:把 Grok 4.6 放进难任务路由
  • Qwen3.8-Max 先当对照,跑完你自己的 20 题再决定是否挤进主路由

针对这四台的最小验收清单(比再刷榜有用)

固定 Claude Code,每模型同一套题:

  1. 3 个真实多文件 bug
  2. 2 个加功能 + 测试
  3. 2 个 Docker/WSL/依赖坑
  4. 1 个 90 分钟长任务
  5. 记录:成功率、$/成功、是否跑偏、工具调用是否炸格式

谁赢,谁当主力。公开表只负责告诉你:这四个都值得测,且测的时候别再用 HumanEval 决胜。

给你的可执行答案

重点追踪:

  1. Terminal-Bench
  2. SWE-rebench / DeepSWE
  3. Artificial Analysis Coding Agent Index(必要时加 SWE-bench Pro)

第一优先级:Terminal-Bench(看你自己的 harness 行)。

对你点名的四台:公开信号目前更偏向「GLM-5.2 主日常 / DeepSeek-V4 Pro 打性价比 / Grok 4.6 攻坚 / Qwen3.8-Max 待补数」。

别再把 HumanEval、MBPP、已经饱和的 SWE-bench Verified 当作主要决策依据。

公开榜负责减少噪音;你自己的任务集负责做决定。


调研时点:2026-08-13。榜上具体分数会周更;DeepSeek-V4 Pro 0813 等热更以你本地复测为准。框架比单次名次更耐用。