Claude Code 的模型选择器里躺着六个可选项:qwen3.8-max、glm-5.2-fast-preview、glm-5.2、deepseek-v4-pro-0813、qwen3-coder-next、grok-4.6,全部经由本机 CPA(一个本地模型网关)转发到各家上游。日常用的时候我只有模糊体感:“这个好像快点"“那个好像聪明点”。体感不可靠,于是花一个晚上把它们拉到同一条起跑线,实测了速度、思考时间、长输入处理和一个 9 题自动判分的智商小测,再对照公开榜单交叉验证。
先说方法和口径,免得数字被误读:
- 测速:直连本地网关、零负载、流式响应,分三段计时——“思考时间”(第一个内容块到第一个字的间隔)、“首字延迟”(按下回车到看见第一个字)、“输出速率”(吐字阶段的纯速度)。
- 测智商:9 道零样本题自动判分:4 道代码题(容易/中等/困难/修 bug,真跑单元测试)、2 道数学题、1 道逻辑题、1 道 JSON 格式纪律题、1 道"系统指令优先级"题。
- 公开分只做参照,不替我下结论。

一、速度的真相:等待 = 思考 + 流畅度
很多人晒的"模型 tok/s"只有一半信息。真实体验里,你按下回车后先经历思考时间,然后才是吐字速度。把两者拆开测,六个模型的性格立刻现形:
- qwen3-coder-next 是闪电:零思考,首字只要 0.3 秒,输出 220 tok/s。打十个字它已经回完了。
- glm-5.2-fast-preview 是均衡生:思考 0.8 秒,首字 1.8 秒,输出 114 tok/s;中文输出它是池内最快的 250 tok/s。
- qwen3.8-max 是思考狂:英文问题它要想 42.5 秒才开始回答,对错另说,等待本身就很劝退;中文要好一些,22.5 秒。
- deepseek-v4-pro-0813 看语言下菜:英文要想 20 秒,中文几乎是秒回(1.6 秒首字、91 tok/s)。
- grok-4.6 是整段缓冲:它不是没思考,而是经号池链路把整段回答攒齐了才一次性倒给你——首字延迟 30~47 秒,期间空白;而且它无视 max_tokens(要 2048 给 4721),有烧额度的风险。
二、智商小测:满分只有一个,两家栽在"格式彩票”
9 题全部零样本、自动判分,结果如下(● 通过 ○ 未过):
三个值得说的点:
- 满分只有一个:qwen3.8-max 开了 42 秒思考,换来了唯一的 9/9。思考对它不是摆设,真能提高正确率。
- grok-4.6 的代码是"抽奖":它的两道代码题挂了 Python 缩进错误(IndentationError),另外一道却全对。抠出原始输出一看,缩进被剥掉了——
def summarize(...):\n s = sum(nums)。这不是模型写不出,是本栈号池链路里部分账号的包装层会剥行首空格。几千个账号轮流接单,你永远不知道下一单接住的是一个"正常号"还是"剥缩进号"。模型本身强(公开分与 GPT-5.6 Sol Max 并列),但在这条链路上写代码等于抽奖。 - 四家 8 分栽在同一题但不是蠢:那道"系统指令优先"题,四家都选择指出指令矛盾、拒绝盲从——这是安全训练痕迹,不是能力缺陷。
另外提一句:qwen3-coder-next 是唯一没开思考的选手,它的数学题两轮实测结果会变(第一轮同余错、第二轮折扣错)——不思考的模型单题有波动,使用时别用一道题给它们定罪。
三、长上下文:别人读一遍历史要 1.8 秒,grok 要 12.8 秒
Claude Code 的会话动不动几十万 token,长输入处理速度就是"上下文越大越肉"的隐藏瓶颈。实测 20K token 输入:
百炼系的 glm-5.2-fast-preview 最快(1.2 秒,约 1.6 万 token/秒),grok-4.6 经号池链路要 12.8 秒。同样的活差一个数量级,百万上下文的会话选模型时这行必须看。
四、汇总:能力×响应地图
把智商分画在纵轴、英文首字延迟画在横轴(对数刻度),一张图看懂谁在哪个位置:
配合公开榜单交叉验证:deepseek-v4-pro-0813 是 LiveCodeBench 93.5 的全场榜首、SWE-Bench Verified 80.6;qwen3.8-max 官方口径 Terminal-Bench 86.6、PaperBench 93;grok-4.6 的 AA Intelligence Index 61 与 GPT-5.6 Sol Max 并列。公开分和我这个小测的排序基本吻合,唯一的大反转是 grok:模型分很高,本地链路分很低——瓶颈不在脑子,在管道。
五、选型清单:什么活派什么模型
| 场景 | 用谁 | 为什么 |
|---|---|---|
| 日常主循环(默认) | glm-5.2-fast-preview | 首字 1.8 秒、中文 250 tok/s、IQ 8.0,交互代价最低 |
| 高难英文代码 / 深度推理 | deepseek-v4-pro-0813 | 公开码力榜第一;扛得住 20 秒前置思考就值 |
| 最高难一次性任务 | qwen3.8-max | IQ 满分;代价是 43 秒等待,别当日常 |
| 子 agent / 脏活(要快+短) | qwen3-coder-next | 0.3 秒首字、220 tok/s、IQ 8.0 |
| 中文长文 / 内容管线 | fast-preview(细)或 coder-next(快) | 中文吞吐 250 / 197 tok/s |
| 后台批量非代码(便宜量大) | grok-4.6 | 额度池大;但别让它写代码 |
| glm-5.2 标准版? | 基本不必 | 速度、思考、智力全被 fast-preview 压住,只便宜一半 |
落地到配置的话只有两处建议动(其余保持):默认主模型从 qwen3.8-max 换成 glm-5.2-fast-preview(现在是"每次等 43 秒"的状态);Haiku 档从 grok-4.6 换成 qwen3-coder-next(躲开缩进抽奖)。
六、几个顺手挖到的冷知识
- 配置里
qwen3.8-max[1M]这种带[1M]后缀的写法,其实是 Claude Code 客户端自己的上下文档位指令,发请求前会被剥掉——网关只认裸模型名。写脚本直连网关时记得用裸名。 - kimi-k3 已经从池子里下架(调它报 400),当前 OPUS 档已经换成 glm-5.2-fast-preview。
- 池子里还躺着没测的新货:grok-4.20 家族(含 reasoning / multi-agent 分支)、gpt-5.6-luna/terra、qwen3.8-2.4t-a95b。
复现:全部基准脚本和数据在 ~/model-bench-2026-08-15/,跑 python3 run_all.py 约 15 分钟出一轮完整结果;9 题判分器、测速逻辑全部开源在脚本里,欢迎对着我的数据挑错。
免责声明:智商部分是 9 题迷你基准,不是 SWE-bench 级评测;速度是"2026-08-15 当晚、本链路、零负载"快照,上游账号池和负载会漂移。




