上个月我写过一篇亲测六个 Claude Code 模型的文章。这次把范围扩大:本机 CPA(本地模型网关)里一共挂着 80 个模型,我做了两件事——先逐个发真实请求探活,再对活下来的模型做防背题的智力实测,最后对照公开榜单交叉验证。
结论先行:清单在列 ≠ 能用。80 个模型里,文本模型 59 个,实测能正常对话的只有 30 个左右;能通过新颖推理题的更少。下面是完整过程。
一、探活:80 个模型,先问"能不能说话"
方法很朴素:对每个模型发一条 “Reply with exactly: OK”,能返回正常内容就算活。中间踩了一个坑值得一提——
grok 系第一轮被误判全死。 探针返回体看起来是空的,复测才发现它们走的是 SSE 流式响应,内容藏在 delta.content 里,我的解析没剥流式包装。修正后 grok-4.5、grok-4.3 全系、grok-4.20 大部分都活了。教训:判定一个模型死活之前,先把响应解析做对。
真死的模型和死法各不相同:
| 死法 | 模型 |
|---|---|
| 上游端口超时 | gemini 全家(3.5/3.1/3.0 系) |
| Console API 404 | grok-4.6 |
| 凭据全部冷却 | glm-5.3 |
| 返回 HTML 网页 | gpt-4o-mini |
| 请求超时 | mistral-medium、grok-3-mini、grok-4.3 裸名 |
| Forbidden | qwen/qwen3.6-27b |
二、智力实测:经典谜题测不出差距,因为都在训练集里
活下来的模型里挑了 15 个头部,先做了一轮 7 道经典谜题(数列、三段论、鸡兔同笼式应用题)。结果:几乎全员满分,没有区分度。
换更难的经典题(Python 闭包陷阱、100! 尾零、时钟指针重叠、25 匹马赛马)再测:还是全员 5/6——唯一"错"的那题还是我判分正则写歪了。这些题全在训练集里,模型都背过。
最终有效的方法:现场生成没人见过的 Python 代码,先在沙箱里真跑一遍拿到标准答案,再让模型盲猜输出。 6 段代码覆盖字典默认值、切片扩展、带缓存递归、滑动窗口、reduce、对象排序。这个没法背,全靠真实执行推理。
结果终于拉开差距:
| 模型 | 得分 | 耗时 |
|---|---|---|
| glm-5.2-fast-preview | 6/6 | 13s |
| deepseek-v4-pro-0813 | 6/6 | 19s |
| qwen3.7-max-preview | 6/6 | 21s |
| qwen3.8-2.4t-a95b | 6/6 | 21s |
| glm-5.2 | 6/6 | 21s |
| qwen3.8-max | 6/6 | 26s |
| kimi-k3 | 6/6 | 40s |
| stealth/ox-alpha | 6/6 | 55s |
| agnes-2.5-pro-alpha | 6/6 | 74s |
| deepseek-v4-flash-0731 | 5/6 | 9s |
| kimi-k2.7-code | 5/6 | 12s |
| grok-4.5 | 5/6 | 78s |
| agnes-2.5-flash | 2/6 | 20s |
| agnes-2.0-flash | 2/6 | 6s |
| qwen3-coder-next | 0-2/6 | 1s |
三个意外发现:
- agnes 家族两极分化:pro-alpha 满分,flash 版只有 2/6,同家族差距大到不正常。别拿 agnes flash 干正经活。
- qwen3-coder-next 翻车:1 秒答完全错,两次跑答案还不一样(15 vs 14)。它快是真快,但新颖推理不稳定——日常脏活没事,关键判断别交给它。
- grok-4.3-high 满分且 11 秒:grok 系第一次确认智力在线,之前它一直被链路问题拖累名声。
三、公开榜单分数对照(含可信度标注)
实测之外,我联网核查了各模型的公开分数。先说前提:大部分分数是厂商自报的,第三方复核程度不一。
| 模型 | 公开分数 | 可信度备注 |
|---|---|---|
| deepseek-v4-pro-0813 | LiveCodeBench 93.5、SWE-V 80.6、GPQA 90.1 | MIT 开源可复核,最硬 |
| kimi-k2.7-code | SWE-V 78.2 | ⚠️ 有媒体实测"分数对不上"的公开质疑 |
| kimi-k3 | SWE-V 76.8、Frontend Code Arena 第 1 | 厂商自报 |
| glm-5.2 | SWE-bench Pro 62.1、Terminal-Bench 81.0 | 有第三方核验文章,大体成立 |
| agnes-2.5-pro-alpha | GPQA 87.6 | 上了 Artificial Analysis 榜;家族真伪有过争议 |
| grok-4.5/4.3 | 官方称 4.5 > 4.3 | 细分数值少,xAI 发分谨慎 |
| qwen3.8-max | Terminal-Bench 86.6、PaperBench 93 | 厂商自报,独立验证进行中 |
| stealth/ox-alpha | 无官方分 | stealth 模型无从核查 |
四、看 benchmark 的三个坑
这次实测撞上的,比看十篇榜单文章印象深:
坑一:训练集污染。 25 匹马、时钟指针、100! 尾零——这些经典题所有模型全对,因为都背过。想测真实推理,要么用现场生成的题,要么用 LiveCodeBench 这类滚动更新的榜。
坑二:厂商自报 ≠ 独立复核。 qwen3.8-max 和 kimi 系都有"分数对不上"的公开质疑;deepseek 因为开源权重最经得起查。看到分数先问:谁跑的?能复现吗?
坑三:榜分 ≠ 你链路上的表现。 grok-4.6 榜上再强,上游 404 就是零分。qwen3-coder-next 榜上编码分不低,新颖题上两次答案不一致。选型最终要回到自己机器上实测。
五、最终排序(聪明度 × 可用性)
综合"防背题实测 + 公开榜分 + 历史基准":
- deepseek-v4-pro-0813 — 满分 + 榜分最硬 + 开源可复核
- qwen3.8-max — 满分 + 历史基准 IQ 9/9(代价:慢)
- glm-5.2-fast-preview — 满分 + 满分组最快 + 中文吞吐王,日常主力首选
- qwen3.7-max-preview / kimi-k3 / grok-4.3-high — 满分梯队
- glm-5.2、qwen3.8-27b、deepseek-v4-flash、agnes-2.5-pro-alpha — 满分但各有短板(慢/小杯/家族存疑)
- kimi-k2.7-code、grok-4.5、deepseek-v4-flash-0731 — 5/6 档
- agnes-flash 系、qwen3-coder-next(新颖题)— 不建议关键任务
一句话选型:高难一次性任务给 deepseek-0813 或 qwen3.8-max,日常主力 glm-5.2-fast-preview,脏活子 agent 可以继续用 qwen3-coder-next 但别让它做关键判断。
