2026年9月 AI 写小说模型完全指南:六大维度全数据横评(含 DeepSeek V4.1 / GLM-5.3 / Kimi K3 / Qwen3.8 实测数据)

基于 EQ-Bench、WritingBench、LongBench v2、Fiction.LiveBench、MRCR 等榜单 2026 年 9 月最新数据,对 30+ 旗舰模型的小说写作能力做全维度横评,附完整数据表。

写小说选 AI 模型,网上的说法太多了——“Claude 文笔天花板”、“DeepSeek 伏笔密度最强”、“Kimi 超长上下文续写独一档”。这些说法哪些是实测、哪些是营销?这篇文章把 2026 年 9 月能拿到的所有公开榜单原始数据拉出来,按小说写作真正需要的五个维度逐一横评,给你一个能照着做的选型答案。

评测权重按长篇连载的实际需求设定:长文生成能力 30% · 长上下文召回 25% · 故事逻辑与一致性 25% · 文学性/文风 15% · 通用推理 5%(Coding 能力不计——和写小说基本无关)。


先给结论:综合排名

名次模型综合分一句话理由
🥇Claude Opus 592长篇写作榜第 1(86.3分,slop 最低 5.6)、创意写作 Elo 2120、多针长上下文召回 93%@128K——唯一无短板
🥈GPT-6 Astra88通用能力天花板(GPQA 96),创意写作 Elo 2163 全场第一(暂定样本),但长篇 slop/重复偏多
🥉Claude Fable 5 / 5.187文风与 Opus 5 平级(Elo 2152),EQ-Bench 情感智能榜第 2,但配额消耗大
4Kimi K382中文最强:EQ 创意写作 2070(非美系第一)、EQ4 情感榜第 3、1M 上下文续写口碑独一档
5GLM-5.381黑马:EQ 创意写作 2064、长篇 81.8 追平 GPT-5.6,AIME 2026 榜 0.992
6GPT-5.6 Sol79写作强但"AI 味"重(slop 16.9),社区公认可读性短板
7DeepSeek V4 Pro78384K 单次输出全场最长 + 中文伏笔编织口碑第一;弱在行文过密(slop 19.7)
8Muse Spark 1.3(Meta)77性价比之王,长篇 82.8 分追平 GPT-6 Astra
9Qwen3.8-Max76LongBench v2 长文理解第一(66.3)、MRCR 256K 八针 92.9
10Gemini 3.1 Pro74世界观设定细腻,但 128K 后召回掉 50 分,中文语感弱

综合分 = 五维证据按权重归一化估算,供排序参考,非精确测量。带 * 的是 EQ-Bench 暂定样本,名次可能漂移。

一句话答案:预算够就 Claude Opus 5;纯中文量产连载,Kimi K3 + DeepSeek V4 Pro + GLM-5.3 的组合能跑出 80% 的效果且成本极低。


维度一:长文生成能力(权重 30%)

1.1 EQ-Bench Creative Writing Longform(最对口的"写章节"榜)

这是目前唯一专门测"写长篇章节"的公开榜单(judge 为 Claude Sonnet 4.6,百分制,含 slop"AI 腔"和 repetition"重复度"两个扣分项)。数据源 creative_writing_longform.js,2026-09-07 快照,共 134 个模型。

名次模型总分章节均长(token)Slop↓重复↓
1claude-opus-586.362645.645.0
2claude-fable-5-1 *85.357777.595.4
3claude-fable-583.062958.314.4
4gpt-6-astra *82.858459.076.3
4muse-spark-1.3 *82.8625310.734.8
6claude-opus-4-781.855529.064.6
6GLM-5.3 *81.859287.094.6
8gpt-5.6-sol81.7688111.986.3
9muse-spark-1.2 *81.5725811.434.5
10claude-opus-4-880.854609.393.8
11claude-sonnet-4-6 *79.9689310.565.5
11ox-alpha *(隐身模型)79.963027.434.0
13kimi-k379.672969.674.9
14Kimi-K2.678.5664918.924.6
15gpt-5.478.3819212.454.8
16claude-sonnet-578.3513813.535.6
17gpt-5.578.2881216.895.3
18gpt-5.6-terra78.0748215.417.4
19GLM-5.277.9531616.514.5
20claude-opus-4-6 *77.7618916.864.7
21gemini-3.8-flash *76.8706127.695.2
22DeepSeek-V4-Pro75.6751621.833.9
24Kimi-K2.574.9631517.284.8
27GLM-5.173.5627124.944.4
31GLM-570.9806524.044.4
35grok-4.20-beta68.5837027.415.2
37gemini-3.1-pro-preview68.2743338.124.9
40DeepSeek-V3.266.8649641.244.9
41Qwen3-Max-2025-09-2466.2440349.197.7
42DeepSeek-V4-Flash66.0550519.597.0
44DeepSeek-V4-Flash-073161.2622131.447.6
46DeepSeek-R159.5403556.446.4
51Qwen3.8-27B *53.3629346.348.9

注意谁不在榜上:Qwen3.8-Max、Qwen3.8-2.4T-A95B、grok-4.5/4.6 均未参加 longform 评测——网上任何给这些模型标长篇分数的都是编的。

1.2 单次输出 token 上限(决定一章能不能一口气写完)

模型最大输出上下文窗口
DeepSeek V4 全系(Pro/Flash/V4.1)384K(全场最长)1M
Claude Opus 5 / Fable 5.1 / Sonnet 5128K1M
GPT-6 Astra128K1.05M
GLM-5.2 / 5.3128K1M
Qwen3.8-2.4T-A95B(开源权重)推理 262K / 正文 131K(官方推荐配置)262K 原生,可扩展 1M
Kimi K3官方未公开,实测口碑为"200 万字前文喂入无缝续写"1M

DeepSeek 的 384K 输出上限意味着理论上一次能写 20 万字中文——虽然你大概率不会这么用,但写 1-2 万字的完整章节不用截断续写,这是实打实的优势。


维度二:文学性/文风(权重 15%)

2.1 EQ-Bench Creative Writing v3(创意写作主榜,Elo 制)

2026-09-07 快照,133 个模型。* = 暂定样本。

名次模型Elo写作分/20Slop↓重复↓
1gpt-6-astra *2163.916.808.413.54
2claude-fable-5-1 *2152.716.958.163.64
3claude-opus-52120.617.076.594.31
4kimi-k32070.616.859.703.73
5GLM-5.3 *2064.117.048.423.23
6gpt-5.6-sol1963.416.7811.683.41
7ox-alpha *1960.616.899.833.05
8claude-fable-51934.616.8110.283.92
9muse-spark-1.11916.116.5412.113.49
10claude-opus-4-71907.116.5711.094.00
11muse-spark-1.3 *1905.516.7010.733.66
12gpt-5.6-terra1850.316.5612.403.02
13gpt-5.51843.517.0113.102.48
14Qwen3.8-2.4T-A95B *1840.916.7212.263.50
15gpt-5.41835.616.8912.202.71
16claude-opus-4-81835.216.6613.163.68
17muse-spark-1.2 *1835.216.4412.983.31
18gpt-5.6-luna1825.816.5811.804.00
19claude-sonnet-4-61804.216.509.904.06
23GLM-5.21752.816.4413.113.94
24gemini-3.8-flash *1749.716.5422.603.12
25Kimi-K2.61721.316.6713.303.77
26Qwen3.8-27B *1668.415.5012.124.19
27Kimi-K2-Instruct1662.716.4015.513.40
32GLM-5.11589.216.2623.563.76
33grok-4.51576.016.2517.733.52
35grok-4.20-beta1570.714.5115.854.50
36DeepSeek-V4-Flash1555.716.2920.924.30
37DeepSeek-V4-Pro1552.116.4519.663.21
39DeepSeek-V3.21511.216.2823.194.06
40DeepSeek-R1(基线)1500.015.6831.214.62
48DeepSeek-V4-Flash-07311438.415.9824.595.45
53gemini-2.5-pro-preview-06-051418.916.1628.734.90

不在榜上的(重要):qwen3.8-max 本体、Qwen3-Max、grok-4.6、grok-4.3 均未参加本榜评测

关键读数:GLM-5.3(2064)比 GLM-5.2(1752)整整高了 311 个 Elo——同底座纯靠后训练拉开的差距,智谱这代后训练是真下本了。Kimi K3(2070)是前 10 里唯一的非美系模型。DeepSeek V4 全系文风分都不高(1550 档),印证了"行文过密"的社区批评——EQ-Bench 雷达图里 V4-Pro 最弱的一项正是"Avoids Purple Prose(避免堆砌辞藻)",最强项是"Creativity"。

2.2 LMArena 创意写作分类(人类盲投,2026-09-11)

前 12 名被 Claude 和 Gemini 霸榜:1. claude-fable-5 · 2. claude-opus-4-6-high · 3-4. gemini-3.7/3.8-flash-high · 5. claude-opus-4-7-high · 6. claude-fable-5.1-max · 7. gemini-3-pro · …国产最高:glm-5.3-max #17、qwen3.8-max #18、kimi-k3-max #25

注意 Arena 和 EQ-Bench 的分歧:Gemini Flash 高思考档在 Arena 短平快盲投里很吃香,但在 EQ-Bench 的精评里 slop 高达 22.6——短聊讨喜 ≠ 长篇耐看。

2.3 中文"AI 味"专项(社区实测共识)

四个独立中文来源交叉验证的结论:

  • AI 味最轻:豆包(口语/网感)、Claude(文学性)
  • 深度最强:DeepSeek、Kimi
  • 没有任何模型中文裸输出能免润色——差别只在基础 AI 味的轻重

维度三:长上下文召回(权重 25%)

写长篇连载,模型必须记得住你 50 章前埋的伏笔。

3.1 MRCR v2 多针召回(OpenAI 出品,最接近"交叉引用故事圣经"的场景)

场景模型成绩
八针 @128KClaude Opus 4.693.0%(领先)
八针 @128KClaude Sonnet 4.6 / Gemini 3.1 Pro84.9%
八针 @128KGPT-5.574.0%
八针 @1MClaude Opus 4.676-78%
八针 @1MGemini 3 Pro26.3%(128K→1M 掉 50 分,悬崖)
四针 @256KGPT-5.298%(该规模首个接近满分)
八针 @256KQwen3.8-Max92.9%(官方数据)
八针 @256KQwen3.7-Max86.7%
MRCR 1MDeepSeek-V4-Pro-Max83.5%(官方)

3.2 Fiction.LiveBench(120K token 小说阅读理解,最对口"记住前 100 章")

2026-05 快照(早于 2026 下半年新旗舰,仅供参考格局):

名次模型分数
1o3100.0
2GPT-5.296.9
2Grok 496.9
4Gemini 2.5 Pro90.6
5Qwen3 235B68.8
10MiniMax M259.4
13Claude 3.7 Sonnet53.1
16Kimi K2 Instruct40.6
19Claude Opus 4.537.5
21DeepSeek R133.3

⚠️ 注意:这个榜上 Claude 系成绩异常低(疑似推理模型方法论占优所致),与 MRCR 的结论相反——两个榜交叉看的结论是:OpenAI/xAI 在"小说文本定位回忆"强,Claude 在"多线索交叉召回"强。另外该榜官网目前已无法访问,2026 下半年旗舰均未上榜。

3.3 LongBench v2(8K-2M 字长文理解)

名次模型分数
1Qwen3.8-Max66.3(官方+第三方一致)
2Claude Opus 4.564.4
3Qwen3.5-397B-A17B63.2
DeepSeek-V4-Pro(官方自报)51.5
DeepSeek-V4.1-Flash(官方自报)45.2

3.4 各厂标称 vs 实际可靠上下文(2026 年实测共识)

模型标称实测可靠区间
Claude Opus 5 / Fable1M~200-400K
GPT-6 Astra1.05M单针到 1M 达 96%
Gemini 3.1 Pro1M(3 Pro 宣称 10M)≤128K 优秀,256K 后悬崖
DeepSeek V4 全系1M单针 @1M 有竞争力,下游任务打折
Grok 4 Fast2M独立测试少
Kimi K31M社区实测超长续写口碑独一档

行业共识:标称上下文的 50-70% 才是可靠区间。 写 10 万字以内的章节+故事圣经,头部模型都够;超 30 万字总上下文时,Claude(多针)和 GPT/Grok(单针定位)最稳。


维度四:故事逻辑与一致性(权重 25%)

这个维度没有任何公开的第三方量化榜——网上所有"百万字不崩"“角色一致性"的说法都来自写作平台的营销文(某平台自称"30 万字设定矛盾率 1.3 处 vs ChatGPT 4.7 处”,无第三方复算,不可信)。可靠证据来自中文社区的同题实测:

中文社区同题实测(2026-09,繁中博主 12 模型同一份网文细纲)

模型实测结论
Claude Opus 4.8 Max / 4.7伏笔编织与整章布局最强,4.7 文字最自然
DeepSeek V4伏笔一个不漏,但"像浓缩咖啡,缺呼吸感"
豆包章节命名最有中文双关审美,思考仅 16 秒,但 3 万字后剧情易漂移
GPT-5.5 Pro研究档思考 7 分钟,反而过度解读指令
Gemini 3.x世界观设定细腻、自带构思解析
Grok 4.x文+图一次到位唯一跑通,但中文文字平庸

网文作者圈分工共识(塔猴平台 2026-09 实测 10 款)

Claude 管文笔润色与情感戏、DeepSeek 管逻辑推演与设定查错、Kimi 管超长前文喂入续写、豆包管碎片灵感。

官方写作数据(DeepSeek V4 技术报告 §5.4.1,arXiv 2606.19348)

这是厂商里唯一把"中文写作"当核心场景发官方数据的:

对比指令遵循胜率写作质量胜率
DS V4-Pro vs Gemini-3.1-Pro(创意写作)60.0%77.5%
DS V4-Pro vs Claude Opus 4.5(复杂指令多轮写作)45.9% vs 52.0%

DeepSeek 官方自己都承认:最难的约束性写作上 Claude Opus 仍然领先。这和榜单数据、社区口碑三方互证了。


维度五:通用推理(权重 5%)

对小说几乎无区分度,简表带过:

榜单第一值得注意
GPQA DiamondGPT-6 Astra 96.0已饱和,24 个模型 ≥90%
AIME 2026GLM-5.2 系 0.992注意:26 个模型全部是厂商自报,0 个独立验证
MathArena 竞赛综合GPT-6 Astra 90.7% 断层Claude Opus 5 第二 72.1%
HLEClaude Fable 5.1 0.650DeepSeek-V4-Pro-0813 0.600(开源第一)
Artificial Analysis 智能指数Fable 5.1 = GPT-6 Astra = 53GLM-5.3 45、Kimi K3 44、Qwen3.8-Max 40
LMArena 总榜 EloFable 5.1 = GPT-6 Astra ≈ 1520Kimi K3 1506、Qwen3.8-Max 1506、GLM-5.3 1505、DeepSeek-V4.1-Flash 1503

重点型号澄清:三个你大概率会搞混的版本号

❌ “DeepSeek-V4-0831” 不存在

0831 这个日期属于 DeepSeek-V4-Flash-Vision-Exp(多模态实验版)——它 8 月 21 日宣布,但 HuggingFace 权重仓库 8 月 31 日才建,“0831"是仓库创建时间戳,不是文本模型快照。DeepSeek 官方更新日志里 8 月只有 08-13(V4-Pro GA)和 08-21(Vision-Exp)两个版本。

✅ DeepSeek V4 全系真实版本线

版本发布日期定位
V4 / V4-Pro / V4-Flash(预览)2026-04-24初代预览
V4-Flash-07312026-07-31Flash 正式版
V4-Pro-08132026-08-13Pro 正式版(HLE 0.600 开源第一那个)
V4-Flash-Vision-Exp2026-08-21 宣布多模态实验
V4.1-Flash2026-09-10(昨天)新架构 Flash,GPQA 90.9 / 官方称全面超越 V4 Pro

⚠️ 重要时效:V4 Pro 将于 9 月 14 日降级

DeepSeek 官方定价页公告:2026-09-14 12:00(北京时间)起,deepseek-v4-pro 的 API 请求将被路由到 V4.1-Flash 并按 Flash 价格计费,理由是 V4.1-Flash 已全面超越 V4 Pro。V4.1 Pro 尚未发布。如果你现在用着 v4-pro,三天后注意输出行为变化。

❌ “qwen3.8-max-0902” 不存在

阿里云官方文档里带日期的快照只到 qwen3.7-max-2026-05-20 / qwen3.7-max-2026-06-08qwen3.8-max 是不带日期的滚动别名。它的开源对应版本就是 Qwen3.8-2.4T-A95B(HF 官方原话:“Qwen3.8-Max is the official version based on Qwen3.8-2.4T-A95B”)。网上任何引用"0902"分数的都是不可验证的。

Qwen3.8 / GLM-5.x 版本线

型号发布上下文输出上限备注
qwen3.8-max2026-081M(原生 262K)推理 262K / 正文 131K(推荐值)= 2.4T-A95B 官方闭源版 + 视觉 + 非思考模式
Qwen3.8-2.4T-A95B2026-08-12262K 原生可扩 1M同上开源权重,2.4T 总参/95B 激活 MoE
Qwen3.8-27B2026-08-14262K 可扩 1M同上27B 稠密小钢炮,原生多模态
GLM-5.22026-06-161M128K744B-A40B MoE,MIT 开源
GLM-5.32026-08-251M128K与 5.2 同底座,纯后训练提升
GLM-5.3-Flash2026-08 底1M128K新底座 320B/18B,首个原生多模态 GLM-5,价格约 5.3 的 1/10

(注:glm-5.2-fast-preview 在智谱官方文档里查不到,疑为中转渠道的临时别名,无法在官方口径验证。)


最终选型建议

单选冠军:Claude Opus 5

长篇第 1、文风前 3、多针召回最强、中文社区口碑天花板——五维权重下没有短板。预算允许就用它写关键章节。

按场景的多模型分工(中文长篇连载实操)

环节推荐模型理由
大纲/世界观脑洞Gemini 3.1 Pro / GLM-5.3设定细腻、自带构思解析
关键章节正文Claude Opus 5长篇 86.3 分 + slop 最低
量产章节正文Kimi K3 / GLM-5.3EQ 2070/2064,成本远低于 Claude
一口气超长单章DeepSeek V4 Pro / V4.1-Flash384K 输出上限
设定审计/伏笔检查DeepSeek V4 Pro伏笔密度口碑第一,行文密正好干审计
超长前文续写Kimi K3200 万字前文喂入口碑独一档
润色降 AI 味Claude Opus 5 / Kimi K3AI 味最轻梯队

三条避坑提醒

  1. “百万字不崩"没有可信第三方数据。唯一来源是写作平台营销文。实操靠"故事圣经 + 每 N 章 DeepSeek 审计"的流程兜底,别指望模型裸记。
  2. 带 * 的榜单成绩会漂移(GPT-6 Astra、GLM-5.3、ox-alpha 都是暂定样本),建议每月复核一次 EQ-Bench。
  3. 9 月 14 日 DeepSeek V4 Pro 降级为 V4.1-Flash——如果你的流水线写死了 v4-pro,提前测试 V4.1-Flash 的文风差异(它的技术报告里没有任何写作专项数据,是个未知数)。

数据来源:eqbench.com(creative_writing.js v1.0.91 / longform v1.0.9,2026-09-07 快照)、lmarena.ai、llm-stats.com、artificialanalysis.ai、matharena.ai、writingbench.hf.space、neosignal.io(Fiction.LiveBench 镜像)、api-docs.deepseek.com、huggingface.co/deepseek-ai | Qwen | zai-org、arXiv 2606.19348 / 2408.07055 / 2506.18841、maplefeather.com、tahou.com。所有标注"官方自报"的数字均为厂商声称、未经独立验证;查无实据的版本号已明确标注不存在。