Featured image of post DeepSeek发布V4.1-Flash:552B MoE架构,KV缓存压缩至1/4 HBM与1/8 SSD

DeepSeek发布V4.1-Flash:552B MoE架构,KV缓存压缩至1/4 HBM与1/8 SSD

DeepSeek推出新一代轻量级MoE模型V4.1-Flash,采用 asymmetric 编码器-解码器架构,性能超越V4-Pro。

深度资讯:DeepSeek发布V4.1-Flash,重新定义高效推理新标准

深度资讯:DeepSeek发布V4.1-Flash,重新定义高效推理新标准
深度资讯:DeepSeek发布V4.1-Flash,重新定义高效推理新标准|新闻截图

2026年9月10日,DeepSeek正式推出其新一代轻量级大语言模型DeepSeek-V4.1-Flash。作为全新架构家族中最小的成员,该模型具备原生多模态理解能力,主打更高性能、更快速度、更强效率三大核心优势。

  • 发布时间:2026年9月10日(UTC+8)
  • 新版本:DeepSeek-V4.1-Flash
  • 价格调整:新定价于9月10日04:00 UTC生效;V4-Pro将于9月14日04:00 UTC起全部路由至V4.1-Flash
  • 可用性:即日起上线DeepSeek API,支持多模态输入
  • 模型权重:暂未明确提及是否开放权重,但表示将与开源社区合作推进推理支持

模型参数方面,V4.1-Flash为5520亿参数的Mixture-of-Experts(MoE)架构——MoE指模型在推理时仅激活部分参数子集,从而在保持高容量的同时控制计算开销。

架构创新:非对称设计实现效率跃升

架构创新:非对称设计实现效率跃升
架构创新:非对称设计实现效率跃升|新闻截图

此次V4.1-Flash最引人注目的设计是其非对称编码器-解码器架构。具体而言:

  • 输入端仅激活80亿参数
  • 输出端激活160亿参数
  • 全模型总参数达5520亿

这一设计意味着:尽管模型容量庞大,但实际计算路径非常精简,显著降低延迟与推理成本。更反直觉的是,多轮测试结果显示V4.1-Flash在性能、成本、速度与总运行时四项指标上均优于此前的旗舰V4-Pro模型,这在行业实践中较为罕见——通常更大的旗舰模型才能提供更高性能。

KV缓存压缩是另一关键突破。KV缓存指模型在生成文本时存储键值对中间状态的数据结构,占GPU显存与存储成本的相当比例。V4.1-Flash将其需求压缩为:

  • HBM(高频内存)仅需上一代的1/4
  • SSD存储仅需上一代的1/8

缓存成本常构成代理应用(total runtime cost)的大头,压缩后能大幅降低端到端服务费用。

关键配置对比

关键配置对比
关键配置对比|新闻截图

项目DeepSeek-V4.1-FlashDeepSeek-V4-Pro(旧旗舰)DeepSeek-V4-Flash(旧版)
状态2026年9月10日上线即将退役已停用(退网)
参数结构552B MoE(8B输入/16B输出激活)未公开具体数字已 retired
多模态能力原生支持未说明原生支持(Exp版)
路由策略当前主推模型9月14日起全部转接至V4.1-Flash暂时路由至V4.1-Flash
API名deepseek-flashdeepseek-v4-prodeepseek-v4-flashdeepseek-v4-flash-vision-exp

注:为确保向后兼容,旧版API名称暂时路由至新模型,但计费按V4.1-Flash费率执行。

实用建议:谁该立即上车?

实用建议:谁该立即上车?
实用建议:谁该立即上车?|新闻截图

  • 适合立即使用:对成本敏感的代理类应用、需高吞吐量的批处理任务、要求低延迟响应的实时交互场景。API定价下降叠加性能提升,V4.1-Flash尤其适合日常推理 workload。
  • 建议再观望:若模型需极高权威性或复杂长链推理(如科研级数学证明),可等待即将推出的V4.1-Pro(官方已预告其路线图)。目前V4.1-Flash虽在基准测试领先,但旗舰级复杂任务能力仍待生态验证。

此外,V4.1-Flash支持峰值/非峰值分时定价:非峰值时段价格为峰值的50%。建议将非紧急任务安排在低峰期运行,可再降一半服务成本。

写在最后

DeepSeek通过V4.1-Flash再次验证了‘小激活路径+大模型容量’的可行性路径,为行业提供了一种兼顾推理质量与经济性的新解法。当模型生日益庞大,如何让少数参数在关键路径上高效工作,正成为新一代架构设计的核心逻辑。这一趋势或倒逼更多厂商重新审视‘参数规模≠推理能力’的旧范式。