写小说选 AI 模型,网上的说法太多了——“Claude 文笔天花板”、“DeepSeek 伏笔密度最强”、“Kimi 超长上下文续写独一档”。这些说法哪些是实测、哪些是营销?这篇文章把 2026 年 9 月能拿到的所有公开榜单原始数据拉出来,按小说写作真正需要的五个维度逐一横评,给你一个能照着做的选型答案。
评测权重按长篇连载的实际需求设定:长文生成能力 30% · 长上下文召回 25% · 故事逻辑与一致性 25% · 文学性/文风 15% · 通用推理 5%(Coding 能力不计——和写小说基本无关)。
先给结论:综合排名
| 名次 | 模型 | 综合分 | 一句话理由 |
|---|---|---|---|
| 🥇 | Claude Opus 5 | 92 | 长篇写作榜第 1(86.3分,slop 最低 5.6)、创意写作 Elo 2120、多针长上下文召回 93%@128K——唯一无短板 |
| 🥈 | GPT-6 Astra | 88 | 通用能力天花板(GPQA 96),创意写作 Elo 2163 全场第一(暂定样本),但长篇 slop/重复偏多 |
| 🥉 | Claude Fable 5 / 5.1 | 87 | 文风与 Opus 5 平级(Elo 2152),EQ-Bench 情感智能榜第 2,但配额消耗大 |
| 4 | Kimi K3 | 82 | 中文最强:EQ 创意写作 2070(非美系第一)、EQ4 情感榜第 3、1M 上下文续写口碑独一档 |
| 5 | GLM-5.3 | 81 | 黑马:EQ 创意写作 2064、长篇 81.8 追平 GPT-5.6,AIME 2026 榜 0.992 |
| 6 | GPT-5.6 Sol | 79 | 写作强但"AI 味"重(slop 16.9),社区公认可读性短板 |
| 7 | DeepSeek V4 Pro | 78 | 384K 单次输出全场最长 + 中文伏笔编织口碑第一;弱在行文过密(slop 19.7) |
| 8 | Muse Spark 1.3(Meta) | 77 | 性价比之王,长篇 82.8 分追平 GPT-6 Astra |
| 9 | Qwen3.8-Max | 76 | LongBench v2 长文理解第一(66.3)、MRCR 256K 八针 92.9 |
| 10 | Gemini 3.1 Pro | 74 | 世界观设定细腻,但 128K 后召回掉 50 分,中文语感弱 |
综合分 = 五维证据按权重归一化估算,供排序参考,非精确测量。带 * 的是 EQ-Bench 暂定样本,名次可能漂移。
一句话答案:预算够就 Claude Opus 5;纯中文量产连载,Kimi K3 + DeepSeek V4 Pro + GLM-5.3 的组合能跑出 80% 的效果且成本极低。
维度一:长文生成能力(权重 30%)
1.1 EQ-Bench Creative Writing Longform(最对口的"写章节"榜)
这是目前唯一专门测"写长篇章节"的公开榜单(judge 为 Claude Sonnet 4.6,百分制,含 slop"AI 腔"和 repetition"重复度"两个扣分项)。数据源 creative_writing_longform.js,2026-09-07 快照,共 134 个模型。
| 名次 | 模型 | 总分 | 章节均长(token) | Slop↓ | 重复↓ |
|---|---|---|---|---|---|
| 1 | claude-opus-5 | 86.3 | 6264 | 5.64 | 5.0 |
| 2 | claude-fable-5-1 * | 85.3 | 5777 | 7.59 | 5.4 |
| 3 | claude-fable-5 | 83.0 | 6295 | 8.31 | 4.4 |
| 4 | gpt-6-astra * | 82.8 | 5845 | 9.07 | 6.3 |
| 4 | muse-spark-1.3 * | 82.8 | 6253 | 10.73 | 4.8 |
| 6 | claude-opus-4-7 | 81.8 | 5552 | 9.06 | 4.6 |
| 6 | GLM-5.3 * | 81.8 | 5928 | 7.09 | 4.6 |
| 8 | gpt-5.6-sol | 81.7 | 6881 | 11.98 | 6.3 |
| 9 | muse-spark-1.2 * | 81.5 | 7258 | 11.43 | 4.5 |
| 10 | claude-opus-4-8 | 80.8 | 5460 | 9.39 | 3.8 |
| 11 | claude-sonnet-4-6 * | 79.9 | 6893 | 10.56 | 5.5 |
| 11 | ox-alpha *(隐身模型) | 79.9 | 6302 | 7.43 | 4.0 |
| 13 | kimi-k3 | 79.6 | 7296 | 9.67 | 4.9 |
| 14 | Kimi-K2.6 | 78.5 | 6649 | 18.92 | 4.6 |
| 15 | gpt-5.4 | 78.3 | 8192 | 12.45 | 4.8 |
| 16 | claude-sonnet-5 | 78.3 | 5138 | 13.53 | 5.6 |
| 17 | gpt-5.5 | 78.2 | 8812 | 16.89 | 5.3 |
| 18 | gpt-5.6-terra | 78.0 | 7482 | 15.41 | 7.4 |
| 19 | GLM-5.2 | 77.9 | 5316 | 16.51 | 4.5 |
| 20 | claude-opus-4-6 * | 77.7 | 6189 | 16.86 | 4.7 |
| 21 | gemini-3.8-flash * | 76.8 | 7061 | 27.69 | 5.2 |
| 22 | DeepSeek-V4-Pro | 75.6 | 7516 | 21.83 | 3.9 |
| 24 | Kimi-K2.5 | 74.9 | 6315 | 17.28 | 4.8 |
| 27 | GLM-5.1 | 73.5 | 6271 | 24.94 | 4.4 |
| 31 | GLM-5 | 70.9 | 8065 | 24.04 | 4.4 |
| 35 | grok-4.20-beta | 68.5 | 8370 | 27.41 | 5.2 |
| 37 | gemini-3.1-pro-preview | 68.2 | 7433 | 38.12 | 4.9 |
| 40 | DeepSeek-V3.2 | 66.8 | 6496 | 41.24 | 4.9 |
| 41 | Qwen3-Max-2025-09-24 | 66.2 | 4403 | 49.19 | 7.7 |
| 42 | DeepSeek-V4-Flash | 66.0 | 5505 | 19.59 | 7.0 |
| 44 | DeepSeek-V4-Flash-0731 | 61.2 | 6221 | 31.44 | 7.6 |
| 46 | DeepSeek-R1 | 59.5 | 4035 | 56.44 | 6.4 |
| 51 | Qwen3.8-27B * | 53.3 | 6293 | 46.34 | 8.9 |
注意谁不在榜上:Qwen3.8-Max、Qwen3.8-2.4T-A95B、grok-4.5/4.6 均未参加 longform 评测——网上任何给这些模型标长篇分数的都是编的。
1.2 单次输出 token 上限(决定一章能不能一口气写完)
| 模型 | 最大输出 | 上下文窗口 |
|---|---|---|
| DeepSeek V4 全系(Pro/Flash/V4.1) | 384K(全场最长) | 1M |
| Claude Opus 5 / Fable 5.1 / Sonnet 5 | 128K | 1M |
| GPT-6 Astra | 128K | 1.05M |
| GLM-5.2 / 5.3 | 128K | 1M |
| Qwen3.8-2.4T-A95B(开源权重) | 推理 262K / 正文 131K(官方推荐配置) | 262K 原生,可扩展 1M |
| Kimi K3 | 官方未公开,实测口碑为"200 万字前文喂入无缝续写" | 1M |
DeepSeek 的 384K 输出上限意味着理论上一次能写 20 万字中文——虽然你大概率不会这么用,但写 1-2 万字的完整章节不用截断续写,这是实打实的优势。
维度二:文学性/文风(权重 15%)
2.1 EQ-Bench Creative Writing v3(创意写作主榜,Elo 制)
2026-09-07 快照,133 个模型。* = 暂定样本。
| 名次 | 模型 | Elo | 写作分/20 | Slop↓ | 重复↓ |
|---|---|---|---|---|---|
| 1 | gpt-6-astra * | 2163.9 | 16.80 | 8.41 | 3.54 |
| 2 | claude-fable-5-1 * | 2152.7 | 16.95 | 8.16 | 3.64 |
| 3 | claude-opus-5 | 2120.6 | 17.07 | 6.59 | 4.31 |
| 4 | kimi-k3 | 2070.6 | 16.85 | 9.70 | 3.73 |
| 5 | GLM-5.3 * | 2064.1 | 17.04 | 8.42 | 3.23 |
| 6 | gpt-5.6-sol | 1963.4 | 16.78 | 11.68 | 3.41 |
| 7 | ox-alpha * | 1960.6 | 16.89 | 9.83 | 3.05 |
| 8 | claude-fable-5 | 1934.6 | 16.81 | 10.28 | 3.92 |
| 9 | muse-spark-1.1 | 1916.1 | 16.54 | 12.11 | 3.49 |
| 10 | claude-opus-4-7 | 1907.1 | 16.57 | 11.09 | 4.00 |
| 11 | muse-spark-1.3 * | 1905.5 | 16.70 | 10.73 | 3.66 |
| 12 | gpt-5.6-terra | 1850.3 | 16.56 | 12.40 | 3.02 |
| 13 | gpt-5.5 | 1843.5 | 17.01 | 13.10 | 2.48 |
| 14 | Qwen3.8-2.4T-A95B * | 1840.9 | 16.72 | 12.26 | 3.50 |
| 15 | gpt-5.4 | 1835.6 | 16.89 | 12.20 | 2.71 |
| 16 | claude-opus-4-8 | 1835.2 | 16.66 | 13.16 | 3.68 |
| 17 | muse-spark-1.2 * | 1835.2 | 16.44 | 12.98 | 3.31 |
| 18 | gpt-5.6-luna | 1825.8 | 16.58 | 11.80 | 4.00 |
| 19 | claude-sonnet-4-6 | 1804.2 | 16.50 | 9.90 | 4.06 |
| 23 | GLM-5.2 | 1752.8 | 16.44 | 13.11 | 3.94 |
| 24 | gemini-3.8-flash * | 1749.7 | 16.54 | 22.60 | 3.12 |
| 25 | Kimi-K2.6 | 1721.3 | 16.67 | 13.30 | 3.77 |
| 26 | Qwen3.8-27B * | 1668.4 | 15.50 | 12.12 | 4.19 |
| 27 | Kimi-K2-Instruct | 1662.7 | 16.40 | 15.51 | 3.40 |
| 32 | GLM-5.1 | 1589.2 | 16.26 | 23.56 | 3.76 |
| 33 | grok-4.5 | 1576.0 | 16.25 | 17.73 | 3.52 |
| 35 | grok-4.20-beta | 1570.7 | 14.51 | 15.85 | 4.50 |
| 36 | DeepSeek-V4-Flash | 1555.7 | 16.29 | 20.92 | 4.30 |
| 37 | DeepSeek-V4-Pro | 1552.1 | 16.45 | 19.66 | 3.21 |
| 39 | DeepSeek-V3.2 | 1511.2 | 16.28 | 23.19 | 4.06 |
| 40 | DeepSeek-R1(基线) | 1500.0 | 15.68 | 31.21 | 4.62 |
| 48 | DeepSeek-V4-Flash-0731 | 1438.4 | 15.98 | 24.59 | 5.45 |
| 53 | gemini-2.5-pro-preview-06-05 | 1418.9 | 16.16 | 28.73 | 4.90 |
不在榜上的(重要):qwen3.8-max 本体、Qwen3-Max、grok-4.6、grok-4.3 均未参加本榜评测。
关键读数:GLM-5.3(2064)比 GLM-5.2(1752)整整高了 311 个 Elo——同底座纯靠后训练拉开的差距,智谱这代后训练是真下本了。Kimi K3(2070)是前 10 里唯一的非美系模型。DeepSeek V4 全系文风分都不高(1550 档),印证了"行文过密"的社区批评——EQ-Bench 雷达图里 V4-Pro 最弱的一项正是"Avoids Purple Prose(避免堆砌辞藻)",最强项是"Creativity"。
2.2 LMArena 创意写作分类(人类盲投,2026-09-11)
前 12 名被 Claude 和 Gemini 霸榜:1. claude-fable-5 · 2. claude-opus-4-6-high · 3-4. gemini-3.7/3.8-flash-high · 5. claude-opus-4-7-high · 6. claude-fable-5.1-max · 7. gemini-3-pro · …国产最高:glm-5.3-max #17、qwen3.8-max #18、kimi-k3-max #25。
注意 Arena 和 EQ-Bench 的分歧:Gemini Flash 高思考档在 Arena 短平快盲投里很吃香,但在 EQ-Bench 的精评里 slop 高达 22.6——短聊讨喜 ≠ 长篇耐看。
2.3 中文"AI 味"专项(社区实测共识)
四个独立中文来源交叉验证的结论:
- AI 味最轻:豆包(口语/网感)、Claude(文学性)
- 深度最强:DeepSeek、Kimi
- 没有任何模型中文裸输出能免润色——差别只在基础 AI 味的轻重
维度三:长上下文召回(权重 25%)
写长篇连载,模型必须记得住你 50 章前埋的伏笔。
3.1 MRCR v2 多针召回(OpenAI 出品,最接近"交叉引用故事圣经"的场景)
| 场景 | 模型 | 成绩 |
|---|---|---|
| 八针 @128K | Claude Opus 4.6 | 93.0%(领先) |
| 八针 @128K | Claude Sonnet 4.6 / Gemini 3.1 Pro | 84.9% |
| 八针 @128K | GPT-5.5 | 74.0% |
| 八针 @1M | Claude Opus 4.6 | 76-78% |
| 八针 @1M | Gemini 3 Pro | 26.3%(128K→1M 掉 50 分,悬崖) |
| 四针 @256K | GPT-5.2 | 98%(该规模首个接近满分) |
| 八针 @256K | Qwen3.8-Max | 92.9%(官方数据) |
| 八针 @256K | Qwen3.7-Max | 86.7% |
| MRCR 1M | DeepSeek-V4-Pro-Max | 83.5%(官方) |
3.2 Fiction.LiveBench(120K token 小说阅读理解,最对口"记住前 100 章")
2026-05 快照(早于 2026 下半年新旗舰,仅供参考格局):
| 名次 | 模型 | 分数 |
|---|---|---|
| 1 | o3 | 100.0 |
| 2 | GPT-5.2 | 96.9 |
| 2 | Grok 4 | 96.9 |
| 4 | Gemini 2.5 Pro | 90.6 |
| 5 | Qwen3 235B | 68.8 |
| 10 | MiniMax M2 | 59.4 |
| 13 | Claude 3.7 Sonnet | 53.1 |
| 16 | Kimi K2 Instruct | 40.6 |
| 19 | Claude Opus 4.5 | 37.5 |
| 21 | DeepSeek R1 | 33.3 |
⚠️ 注意:这个榜上 Claude 系成绩异常低(疑似推理模型方法论占优所致),与 MRCR 的结论相反——两个榜交叉看的结论是:OpenAI/xAI 在"小说文本定位回忆"强,Claude 在"多线索交叉召回"强。另外该榜官网目前已无法访问,2026 下半年旗舰均未上榜。
3.3 LongBench v2(8K-2M 字长文理解)
| 名次 | 模型 | 分数 |
|---|---|---|
| 1 | Qwen3.8-Max | 66.3(官方+第三方一致) |
| 2 | Claude Opus 4.5 | 64.4 |
| 3 | Qwen3.5-397B-A17B | 63.2 |
| — | DeepSeek-V4-Pro(官方自报) | 51.5 |
| — | DeepSeek-V4.1-Flash(官方自报) | 45.2 |
3.4 各厂标称 vs 实际可靠上下文(2026 年实测共识)
| 模型 | 标称 | 实测可靠区间 |
|---|---|---|
| Claude Opus 5 / Fable | 1M | ~200-400K |
| GPT-6 Astra | 1.05M | 单针到 1M 达 96% |
| Gemini 3.1 Pro | 1M(3 Pro 宣称 10M) | ≤128K 优秀,256K 后悬崖 |
| DeepSeek V4 全系 | 1M | 单针 @1M 有竞争力,下游任务打折 |
| Grok 4 Fast | 2M | 独立测试少 |
| Kimi K3 | 1M | 社区实测超长续写口碑独一档 |
行业共识:标称上下文的 50-70% 才是可靠区间。 写 10 万字以内的章节+故事圣经,头部模型都够;超 30 万字总上下文时,Claude(多针)和 GPT/Grok(单针定位)最稳。
维度四:故事逻辑与一致性(权重 25%)
这个维度没有任何公开的第三方量化榜——网上所有"百万字不崩"“角色一致性"的说法都来自写作平台的营销文(某平台自称"30 万字设定矛盾率 1.3 处 vs ChatGPT 4.7 处”,无第三方复算,不可信)。可靠证据来自中文社区的同题实测:
中文社区同题实测(2026-09,繁中博主 12 模型同一份网文细纲)
| 模型 | 实测结论 |
|---|---|
| Claude Opus 4.8 Max / 4.7 | 伏笔编织与整章布局最强,4.7 文字最自然 |
| DeepSeek V4 | 伏笔一个不漏,但"像浓缩咖啡,缺呼吸感" |
| 豆包 | 章节命名最有中文双关审美,思考仅 16 秒,但 3 万字后剧情易漂移 |
| GPT-5.5 Pro | 研究档思考 7 分钟,反而过度解读指令 |
| Gemini 3.x | 世界观设定细腻、自带构思解析 |
| Grok 4.x | 文+图一次到位唯一跑通,但中文文字平庸 |
网文作者圈分工共识(塔猴平台 2026-09 实测 10 款)
Claude 管文笔润色与情感戏、DeepSeek 管逻辑推演与设定查错、Kimi 管超长前文喂入续写、豆包管碎片灵感。
官方写作数据(DeepSeek V4 技术报告 §5.4.1,arXiv 2606.19348)
这是厂商里唯一把"中文写作"当核心场景发官方数据的:
| 对比 | 指令遵循胜率 | 写作质量胜率 |
|---|---|---|
| DS V4-Pro vs Gemini-3.1-Pro(创意写作) | 60.0% | 77.5% |
| DS V4-Pro vs Claude Opus 4.5(复杂指令多轮写作) | 45.9% vs 52.0% | — |
DeepSeek 官方自己都承认:最难的约束性写作上 Claude Opus 仍然领先。这和榜单数据、社区口碑三方互证了。
维度五:通用推理(权重 5%)
对小说几乎无区分度,简表带过:
| 榜单 | 第一 | 值得注意 |
|---|---|---|
| GPQA Diamond | GPT-6 Astra 96.0 | 已饱和,24 个模型 ≥90% |
| AIME 2026 | GLM-5.2 系 0.992 | 注意:26 个模型全部是厂商自报,0 个独立验证 |
| MathArena 竞赛综合 | GPT-6 Astra 90.7% 断层 | Claude Opus 5 第二 72.1% |
| HLE | Claude Fable 5.1 0.650 | DeepSeek-V4-Pro-0813 0.600(开源第一) |
| Artificial Analysis 智能指数 | Fable 5.1 = GPT-6 Astra = 53 | GLM-5.3 45、Kimi K3 44、Qwen3.8-Max 40 |
| LMArena 总榜 Elo | Fable 5.1 = GPT-6 Astra ≈ 1520 | Kimi K3 1506、Qwen3.8-Max 1506、GLM-5.3 1505、DeepSeek-V4.1-Flash 1503 |
重点型号澄清:三个你大概率会搞混的版本号
❌ “DeepSeek-V4-0831” 不存在
0831 这个日期属于 DeepSeek-V4-Flash-Vision-Exp(多模态实验版)——它 8 月 21 日宣布,但 HuggingFace 权重仓库 8 月 31 日才建,“0831"是仓库创建时间戳,不是文本模型快照。DeepSeek 官方更新日志里 8 月只有 08-13(V4-Pro GA)和 08-21(Vision-Exp)两个版本。
✅ DeepSeek V4 全系真实版本线
| 版本 | 发布日期 | 定位 |
|---|---|---|
| V4 / V4-Pro / V4-Flash(预览) | 2026-04-24 | 初代预览 |
| V4-Flash-0731 | 2026-07-31 | Flash 正式版 |
| V4-Pro-0813 | 2026-08-13 | Pro 正式版(HLE 0.600 开源第一那个) |
| V4-Flash-Vision-Exp | 2026-08-21 宣布 | 多模态实验 |
| V4.1-Flash | 2026-09-10(昨天) | 新架构 Flash,GPQA 90.9 / 官方称全面超越 V4 Pro |
⚠️ 重要时效:V4 Pro 将于 9 月 14 日降级
DeepSeek 官方定价页公告:2026-09-14 12:00(北京时间)起,deepseek-v4-pro 的 API 请求将被路由到 V4.1-Flash 并按 Flash 价格计费,理由是 V4.1-Flash 已全面超越 V4 Pro。V4.1 Pro 尚未发布。如果你现在用着 v4-pro,三天后注意输出行为变化。
❌ “qwen3.8-max-0902” 不存在
阿里云官方文档里带日期的快照只到 qwen3.7-max-2026-05-20 / qwen3.7-max-2026-06-08;qwen3.8-max 是不带日期的滚动别名。它的开源对应版本就是 Qwen3.8-2.4T-A95B(HF 官方原话:“Qwen3.8-Max is the official version based on Qwen3.8-2.4T-A95B”)。网上任何引用"0902"分数的都是不可验证的。
Qwen3.8 / GLM-5.x 版本线
| 型号 | 发布 | 上下文 | 输出上限 | 备注 |
|---|---|---|---|---|
| qwen3.8-max | 2026-08 | 1M(原生 262K) | 推理 262K / 正文 131K(推荐值) | = 2.4T-A95B 官方闭源版 + 视觉 + 非思考模式 |
| Qwen3.8-2.4T-A95B | 2026-08-12 | 262K 原生可扩 1M | 同上 | 开源权重,2.4T 总参/95B 激活 MoE |
| Qwen3.8-27B | 2026-08-14 | 262K 可扩 1M | 同上 | 27B 稠密小钢炮,原生多模态 |
| GLM-5.2 | 2026-06-16 | 1M | 128K | 744B-A40B MoE,MIT 开源 |
| GLM-5.3 | 2026-08-25 | 1M | 128K | 与 5.2 同底座,纯后训练提升 |
| GLM-5.3-Flash | 2026-08 底 | 1M | 128K | 新底座 320B/18B,首个原生多模态 GLM-5,价格约 5.3 的 1/10 |
(注:glm-5.2-fast-preview 在智谱官方文档里查不到,疑为中转渠道的临时别名,无法在官方口径验证。)
最终选型建议
单选冠军:Claude Opus 5
长篇第 1、文风前 3、多针召回最强、中文社区口碑天花板——五维权重下没有短板。预算允许就用它写关键章节。
按场景的多模型分工(中文长篇连载实操)
| 环节 | 推荐模型 | 理由 |
|---|---|---|
| 大纲/世界观脑洞 | Gemini 3.1 Pro / GLM-5.3 | 设定细腻、自带构思解析 |
| 关键章节正文 | Claude Opus 5 | 长篇 86.3 分 + slop 最低 |
| 量产章节正文 | Kimi K3 / GLM-5.3 | EQ 2070/2064,成本远低于 Claude |
| 一口气超长单章 | DeepSeek V4 Pro / V4.1-Flash | 384K 输出上限 |
| 设定审计/伏笔检查 | DeepSeek V4 Pro | 伏笔密度口碑第一,行文密正好干审计 |
| 超长前文续写 | Kimi K3 | 200 万字前文喂入口碑独一档 |
| 润色降 AI 味 | Claude Opus 5 / Kimi K3 | AI 味最轻梯队 |
三条避坑提醒
- “百万字不崩"没有可信第三方数据。唯一来源是写作平台营销文。实操靠"故事圣经 + 每 N 章 DeepSeek 审计"的流程兜底,别指望模型裸记。
- 带 * 的榜单成绩会漂移(GPT-6 Astra、GLM-5.3、ox-alpha 都是暂定样本),建议每月复核一次 EQ-Bench。
- 9 月 14 日 DeepSeek V4 Pro 降级为 V4.1-Flash——如果你的流水线写死了 v4-pro,提前测试 V4.1-Flash 的文风差异(它的技术报告里没有任何写作专项数据,是个未知数)。
数据来源:eqbench.com(creative_writing.js v1.0.91 / longform v1.0.9,2026-09-07 快照)、lmarena.ai、llm-stats.com、artificialanalysis.ai、matharena.ai、writingbench.hf.space、neosignal.io(Fiction.LiveBench 镜像)、api-docs.deepseek.com、huggingface.co/deepseek-ai | Qwen | zai-org、arXiv 2606.19348 / 2408.07055 / 2506.18841、maplefeather.com、tahou.com。所有标注"官方自报"的数字均为厂商声称、未经独立验证;查无实据的版本号已明确标注不存在。