Featured image of post CPA 模型池全量体检:80 个模型谁活着、谁聪明、谁在裸奔

CPA 模型池全量体检:80 个模型谁活着、谁聪明、谁在裸奔

对本地模型网关里全部 80 个模型做可用性探测,再用'现场生成代码真跑取真值'的新颖题防背题实测,结合公开榜单交叉验证,给出可用的聪明模型排序和看 benchmark 的三个坑。

上个月我写过一篇亲测六个 Claude Code 模型的文章。这次把范围扩大:本机 CPA(本地模型网关)里一共挂着 80 个模型,我做了两件事——先逐个发真实请求探活,再对活下来的模型做防背题的智力实测,最后对照公开榜单交叉验证。

结论先行:清单在列 ≠ 能用。80 个模型里,文本模型 59 个,实测能正常对话的只有 30 个左右;能通过新颖推理题的更少。下面是完整过程。

一、探活:80 个模型,先问"能不能说话"

方法很朴素:对每个模型发一条 “Reply with exactly: OK”,能返回正常内容就算活。中间踩了一个坑值得一提——

grok 系第一轮被误判全死。 探针返回体看起来是空的,复测才发现它们走的是 SSE 流式响应,内容藏在 delta.content 里,我的解析没剥流式包装。修正后 grok-4.5、grok-4.3 全系、grok-4.20 大部分都活了。教训:判定一个模型死活之前,先把响应解析做对。

真死的模型和死法各不相同:

死法模型
上游端口超时gemini 全家(3.5/3.1/3.0 系)
Console API 404grok-4.6
凭据全部冷却glm-5.3
返回 HTML 网页gpt-4o-mini
请求超时mistral-medium、grok-3-mini、grok-4.3 裸名
Forbiddenqwen/qwen3.6-27b

二、智力实测:经典谜题测不出差距,因为都在训练集里

活下来的模型里挑了 15 个头部,先做了一轮 7 道经典谜题(数列、三段论、鸡兔同笼式应用题)。结果:几乎全员满分,没有区分度。

换更难的经典题(Python 闭包陷阱、100! 尾零、时钟指针重叠、25 匹马赛马)再测:还是全员 5/6——唯一"错"的那题还是我判分正则写歪了。这些题全在训练集里,模型都背过。

最终有效的方法:现场生成没人见过的 Python 代码,先在沙箱里真跑一遍拿到标准答案,再让模型盲猜输出。 6 段代码覆盖字典默认值、切片扩展、带缓存递归、滑动窗口、reduce、对象排序。这个没法背,全靠真实执行推理。

结果终于拉开差距:

模型得分耗时
glm-5.2-fast-preview6/613s
deepseek-v4-pro-08136/619s
qwen3.7-max-preview6/621s
qwen3.8-2.4t-a95b6/621s
glm-5.26/621s
qwen3.8-max6/626s
kimi-k36/640s
stealth/ox-alpha6/655s
agnes-2.5-pro-alpha6/674s
deepseek-v4-flash-07315/69s
kimi-k2.7-code5/612s
grok-4.55/678s
agnes-2.5-flash2/620s
agnes-2.0-flash2/66s
qwen3-coder-next0-2/61s

三个意外发现:

  • agnes 家族两极分化:pro-alpha 满分,flash 版只有 2/6,同家族差距大到不正常。别拿 agnes flash 干正经活。
  • qwen3-coder-next 翻车:1 秒答完全错,两次跑答案还不一样(15 vs 14)。它快是真快,但新颖推理不稳定——日常脏活没事,关键判断别交给它。
  • grok-4.3-high 满分且 11 秒:grok 系第一次确认智力在线,之前它一直被链路问题拖累名声。

三、公开榜单分数对照(含可信度标注)

实测之外,我联网核查了各模型的公开分数。先说前提:大部分分数是厂商自报的,第三方复核程度不一。

模型公开分数可信度备注
deepseek-v4-pro-0813LiveCodeBench 93.5、SWE-V 80.6、GPQA 90.1MIT 开源可复核,最硬
kimi-k2.7-codeSWE-V 78.2⚠️ 有媒体实测"分数对不上"的公开质疑
kimi-k3SWE-V 76.8、Frontend Code Arena 第 1厂商自报
glm-5.2SWE-bench Pro 62.1、Terminal-Bench 81.0有第三方核验文章,大体成立
agnes-2.5-pro-alphaGPQA 87.6上了 Artificial Analysis 榜;家族真伪有过争议
grok-4.5/4.3官方称 4.5 > 4.3细分数值少,xAI 发分谨慎
qwen3.8-maxTerminal-Bench 86.6、PaperBench 93厂商自报,独立验证进行中
stealth/ox-alpha无官方分stealth 模型无从核查

四、看 benchmark 的三个坑

这次实测撞上的,比看十篇榜单文章印象深:

坑一:训练集污染。 25 匹马、时钟指针、100! 尾零——这些经典题所有模型全对,因为都背过。想测真实推理,要么用现场生成的题,要么用 LiveCodeBench 这类滚动更新的榜。

坑二:厂商自报 ≠ 独立复核。 qwen3.8-max 和 kimi 系都有"分数对不上"的公开质疑;deepseek 因为开源权重最经得起查。看到分数先问:谁跑的?能复现吗?

坑三:榜分 ≠ 你链路上的表现。 grok-4.6 榜上再强,上游 404 就是零分。qwen3-coder-next 榜上编码分不低,新颖题上两次答案不一致。选型最终要回到自己机器上实测。

五、最终排序(聪明度 × 可用性)

综合"防背题实测 + 公开榜分 + 历史基准":

  1. deepseek-v4-pro-0813 — 满分 + 榜分最硬 + 开源可复核
  2. qwen3.8-max — 满分 + 历史基准 IQ 9/9(代价:慢)
  3. glm-5.2-fast-preview — 满分 + 满分组最快 + 中文吞吐王,日常主力首选
  4. qwen3.7-max-preview / kimi-k3 / grok-4.3-high — 满分梯队
  5. glm-5.2、qwen3.8-27b、deepseek-v4-flash、agnes-2.5-pro-alpha — 满分但各有短板(慢/小杯/家族存疑)
  6. kimi-k2.7-code、grok-4.5、deepseek-v4-flash-0731 — 5/6 档
  7. agnes-flash 系、qwen3-coder-next(新颖题)— 不建议关键任务

一句话选型:高难一次性任务给 deepseek-0813 或 qwen3.8-max,日常主力 glm-5.2-fast-preview,脏活子 agent 可以继续用 qwen3-coder-next 但别让它做关键判断。