Featured image of post 我的 AI 模型弹药库盘点:视频/图片/语音三线多榜加权排序(2026-09)

我的 AI 模型弹药库盘点:视频/图片/语音三线多榜加权排序(2026-09)

把自己生产线上实际可调用的全部视频、图片、TTS 模型拉出来盘一遍:15 把 DashScope key 逐把实测 7 把通视频端点;视频线 Wan3.0-video 以 Arena 1481(Elo #3)压过管线原配 Wan2.7(+53 分);图片线 GPT-Image-2.5 Sunburst 1421 居 Arena 文生图榜首,恰是现有默认;TTS 线建议从 CosyVoice 切 Qwen3-TTS-Flash(97ms 首包、克隆/设计、9+ 方言)。数据经 LMArena、Arena.ai 周报、Artificial Analysis、SuperCLUE 多榜交叉,单引擎来源均已标注折扣。

结论先行:三条线的第一名,两条早就在你手里

这周做漫剧管线收尾时顺手做了一次全量盘点:把自己生产线上实际能调到的视频、图片、语音模型全部拉出来,对着 2026 年 9 月的各路盲测榜单做加权排序。盘点对象不是"市面上有哪些模型",而是"我的 Lumenx 管线 + CPA 网关里,今天就能发请求的那些"。

三条线的第一名,有两条已经在生产线上跑着:视频线 Wan3.0-video(Arena 图生视频 Elo 1481,全榜 #3,比管线原配 Wan2.7 高 53 分),图片线 GPT-Image-2.5 Sunburst(Arena 文生图 1421,榜首)。唯一需要动手的是语音线——建议把台词主力从 CosyVoice 切到 Qwen3-TTS-Flash。

一个附带发现值得单独说:前一天还判定"DashScope 视频密钥全断",这次把 CPA 里 15 把 key 逐把打到 video-synthesis 端点实测,7 把全通。所谓"通道死了",很多时候只是"我没试完"。

为什么做这件事:一次"密钥已死"误判引发的

时间线是这样的。9 月 20 日晚跑 Lumenx 生产实测,视频三通道(DashScope/Vidu/Kling)全部报错,当晚结论写进记忆:“等用户修密钥”。两天后继续推进时,我对着 CPA 配置里的 15 把 key 逐把发最小请求(1 秒时长、X-DashScope-Async: enable),结果 7 把直接返回 200 + task_id。之前测的那把,恰好是坏的那一把。

这给了一个教训:通道级判断必须穷举,抽样会骗人。所以这次盘点的第一件事不是看榜单,而是先把"我到底有什么"盘清楚——工具链里的模型目录(Lumenx 的 model_catalog.json,38 个模型 8 个家族)、网关里的渠道清单(CPA config.yaml,90+ 个模型名 16 个渠道)、音频注册表(tts.py 里的 CosyVoice/Qwen3 双族音色)、再叠加逐把密钥实测。清单盘完,才轮到排序。

方法:多榜交叉,单引擎来源必须打折

排序规则先摆明,不装客观:

  • 主权重给 LMArena / Arena.ai 盲测 Elo——数百万次人类盲投,比任何技术指标都接近"真实审美偏好";
  • 次权重给 Artificial Analysis 视频竞技场、SuperCLUE 中文榜、厂商六维评测,用来交叉验证和补盲区;
  • 数据缺口如实降级:TTS 领域根本没有成熟 Arena 榜,那段排序是特性+口碑的综合判断,我在文中明确标注了;
  • 检索当天 Tavily 引擎全程 SSL 断连,数据以 Grok + 秘塔双引擎交叉为准,每条关键数字都要求至少一个独立来源。

同一家模型在不同榜的口径会打架(比如 Kling 3.0 在 T2V-with-audio 分榜是 1092,主榜口径明显更高),打架的地方我保留了区间而不是硬编一个数。

视频线:Wan3.0 拿到的 +53 分,不是刷出来的

先看 9 月第三周 Arena.ai 盲测榜的图生视频段位:

加权排名模型Arena Elo(图生视频)我这边状态
1Wan3.0-video1481(#3),对 Wan2.7 +53✅ 本周刚接入并设为默认
2Seedance 2.01474(#5);Seedance 2.5 已冲到 1477(#4)✅ 渠道在(mulerouter)
3Kling 3.0主榜口径区间约 1460;分榜口径 1092⚠️ SecretKey 空
4Wan2.7-r2v/i2v1426-1428(#10-11)✅ 7 把 key 实测通,原主力
5Vidu Q3 Pro1363(#18)⚠️ 密钥 401
6PixVerse V5.6/C1曾排 AA 榜 #2(早期口径)✅ 渠道在
7happyhorse-1.04 月"欢乐马"霸榜记录(Elo 1375 断层)✅ 管线默认 i2v
8grok-imagine-video480p 档 1381(早期口径)⚠️ 网关提交无响应,观望

榜顶是什么概念:第一 MiniMax-H3 是 1494,第二 Gemini Omni 1.1 Flash 是 1488,Wan3.0 的 1481 只差 7 分,胜率 57%。而它 8 月底才正式上线,首入榜即前三——这个 53 分的代差,恰好落在我的白模锚定管线上:Wan3.0 支持 first_frame/last_frame 强语义(参考图和首尾帧互斥,不能混传),意味着程序化白模渲出的锚点帧可以作为"严格的第一帧/最后一帧"喂进去,而不是 Wan2.7-r2v 那种"多张参考图近似锚定"。锁构图的能力从"近似"升级到"严格"。

分场景的选型口径也交叉出来了:智东西对 Seedance 2.0 的六维评测(画质/运动/图像保持/语义/音频/文字)全部第一、3.31-3.70 分区间,尤其面部逼真度和精确动作控制压 Kling 3.0 一头;Kling 3.0 的护城河是 4K60fps 原生输出和电影感运镜。落到我的漫剧场景:白模锚定主力 Wan3.0、特写镜头切 Seedance、运镜炫技考虑修 Kling 密钥。

图片线:现有默认就是榜一,这属于运气好

图片这条线最省心——盘完发现现在的默认配置已经站在顶端:

加权排名模型Arena Elo(文生图)我这边状态
1GPT-Image-2.5(Sunburst/Flare)1421/1399;编辑榜 1520✅ .env 默认
2Gemini-3-Pro-Image-Preview口径 1050-1420,与 GPT-Image 互有胜负未在生产链
3Qwen-Image-2.0/2.11029-1237;开源线 Qwen-Image-2512 为开源 #1✅ 管线默认是同厂 wan2.7-image-pro
4agnes-image-2.5Qwen Image Bench 57.53(>Seedream 4.5/4.0)✅ CPA agnes 渠道
5Seedream 4.0/4.5AA 榜中低档无直连
6grok-imagine-image-lite无榜数据✅ CPA 有,轻量档

GPT-Image-2.5 的位置没有悬念:文生图榜 Sunburst 变体 1421,领先上一代约 40 分;图像编辑榜更是 1520 对 1461 的差距,多轮编辑保真度和 4K 支撑了编辑场景的断层。新京报报道里 Qwen-Image-2.0 文生图 1029 分、全球第三的口径来自 2 月的 AI Arena,四月后的版本(2512/2.1)在开源线登顶,但整体仍落后 GPT 一档。

实践结论只有一条:默认不动。补一个场景化备选——中文海报、文字密集图(漫剧封面/标题卡)切 Qwen-Image,它的中文文字渲染是这个场景的真优势。

语音线:唯一需要动手的切换建议

先把丑话说在前面:TTS 没有权威盲测榜。Artificial Analysis 的 Speech Arena 覆盖的是 speech-to-speech 整线,不是纯 TTS 打分;各家 97ms 首包、17 音色这类是厂商口径。这段排序是特性与口碑的加权,证据强度整体比前两线低一档,请按此折扣阅读:

排名模型关键特性我这边状态
1CosyVoice-v3.5-plus阿里最新;克隆/设计语音;同厂 Qwen-Audio-3.0-TTS-Plus 曾登 Speech Arena 榜首✅ tts.py 默认
2Qwen3-TTS-Flash97ms 首包、17 音色、9+ 中文方言、克隆/设计、Dual-Track 流式✅ tts.py 已注册
3Gemini-3.1-Flash-TTS可控旁白标签、低延迟、多语言✅ CPA aistudio-gemini
4CosyVoice v2/v3-flash龙系几十音色,老一代✅

排名 1 和 2 其实是同厂前后代,差距不在质量在场景适配:Qwen3-TTS 的方言覆盖(9+ 方言)和指令式音色调整对古风漫剧的角色台词区分度更有用,97ms 首包对流式合成友好。切换成本几乎为零——tts.py 里两个 family 都注册好了,音色表(Cherry/Serena/Ethan/Chelsie 这批 Qwen3 音色)就在那儿等着。

局限与复现

三点折扣,写在这里防止未来自己误信:

  1. Elo 是活数。Arena 周榜每周浮动 ±10-20 分,Seedance 2.5 两周前刚把 2.0 顶下去;本文数字固定在 2026-09-22 的快照,一个月后请重查。
  2. TTS 段证据强度低一档,已在节内标注。
  3. “我这边状态"列是逐把实测或源码核对的,15 把 key 打端点用的是最小请求(duration=1 秒的报错证实了鉴权与计费链路活着,真实出片另算);渠道"在"不等于"通”,Kling 的 SecretKey 和 Vidu 的 401 都是一行就能验证的死活。

复现路径:模型清单来自 /config/model_catalog/generated/model_catalog.json(38 模型)加 CPA config.yaml 渠道段;盲测榜看 arena.ai/leaderboard/image-to-video 与 lmarena.ai/leaderboard/image-to-video;中文侧交叉用 SuperCLUE 视频榜与 Arena.ai 中文周报。密钥实测的请求模板在 Lumenx 的 phase0-verdict 文档里有完整记录。

最后一个数字收尾:这次盘点花了不到两小时,其中最值钱的动作是那 15 次逐把 curl——它把"视频通道死了"改写成了"死了 8 把,活着 7 把"。


数据来源: LMArena I2V 榜 · Arena.ai 官方推文:Wan3.0 图生视频 #3、1481 分 · Arena.ai 第 36 周周报(网易转载) · 智东西:Seedance 2.0 六维全一评测 · CometAPI:GPT-Image-2.5 基准 · 新京报:Qwen-Image-2.0 发布 · Qwen3-TTS 技术详解 · 澎湃:欢乐马霸榜记录