一句话看点
DeepSeek在2025年9月29日发布实验模型DeepSeek-V3.2-Exp,并将其上线至App、Web和API,同时宣布API价格立即下调50%以上。
这次更新的核心并不是单纯更换模型名称,而是引入DeepSeek Sparse Attention,简称DSA。注意力机制是大语言模型在生成文本时判断不同词元之间关系的关键模块;当上下文变长,传统注意力计算成本会快速上升。DSA的目标是在长上下文场景中以更细粒度的稀疏计算减少训练与推理开销,也就是让模型不必对所有位置都进行同等强度的计算,从而提升效率。
模型从V3.1-Terminus演进而来
据DeepSeek介绍,V3.2-Exp建立在V3.1-Terminus基础上。V3.1-Terminus此前强调改善语言一致性、减少中英文混杂,并提升Code Agent与Search Agent表现;此次实验版本则把重点放在长上下文效率上。
官方称,DSA在尽量减少输出质量影响的前提下实现细粒度稀疏注意力,提升长上下文性能并降低计算成本。页面同时提到,基准测试显示V3.2-Exp的表现与V3.1-Terminus相当。这里的“相当”意味着DeepSeek希望在保持原有能力水平的同时,通过底层计算路径优化换取更低成本,而不是宣称在所有任务上取得明显领先。
关键信息可概括为:
- 发布时间:2025年9月29日;
- 模型定位:实验模型DeepSeek-V3.2-Exp;
- 技术变化:首次引入DeepSeek Sparse Attention;
- 上线渠道:App、Web、API;
- 价格调整:DeepSeek API价格立即下降50%以上;
- 对照测试:V3.1-Terminus临时API保留至2025年10月15日15:59(UTC)。
API降价与对照测试安排
对开发者而言,API价格下调可能是这次发布最直接的变化。DeepSeek称“更低成本、相同访问”,并表示降价即时生效。源材料未披露不同调用类型的具体新旧单价,因此不能判断各类任务的实际账单变化幅度;但“50%以上”的整体表述,已经足以说明其希望把效率提升传导到使用成本上。
同时,DeepSeek为对比测试保留了V3.1-Terminus临时API,截止时间为2025年10月15日15:59(UTC)。这对企业和开发者很重要:模型切换往往不仅看跑分,还要观察稳定性、风格一致性、长文本处理、代码生成以及工具调用链路中的表现。保留旧模型短期入口,有助于用户用同一提示词和业务数据比较两代模型差异,降低迁移不确定性。
开源发布与内核工具
DeepSeek还同步提供开源资源:V3.2-Exp模型发布在Hugging Face,V3.2技术报告发布在GitHub,并公开了TileLang与CUDA实现的关键GPU kernels。GPU kernel可以理解为直接运行在显卡上的底层计算程序,它决定了模型部分算子的执行效率。TileLang则被官方提示可用于快速研究原型开发,CUDA是英伟达GPU生态中常用的并行计算平台。
这些资源对研究社区和工程团队的意义不同。研究者可以关注DSA如何在稀疏计算与输出质量之间做权衡;工程团队则更关心相关内核能否被用于复现实验、评估部署成本,或为自有推理框架提供参考。不过,源材料没有给出模型规模、上下文长度上限、具体评测集分数或硬件环境,因此外部用户仍需要通过技术报告和实际测试补齐判断。
行业观察:长上下文竞争转向成本效率
大模型竞争正在从“能不能处理更长文本”转向“能否以可承受成本处理更长文本”。长上下文可用于代码仓库分析、法律和金融文档阅读、多轮对话记忆等场景,但计算开销一直是落地瓶颈。DeepSeek-V3.2-Exp把稀疏注意力、API降价和开源内核放在同一次发布中,释放的信号很明确:长上下文能力需要与推理成本、开发者可获得性一起推进。
不过,实验模型仍意味着它更适合被持续评估,而非默认替换所有生产系统。接下来值得关注的是,DSA在真实业务长文本中的稳定性、与V3.1-Terminus相比的风格变化,以及降价后API服务承载能力。若DeepSeek能在保持质量的同时持续降低长上下文成本,开源模型阵营在开发者市场中的吸引力将进一步增强。




