Featured image of post DeepSeek V4.1 Flash发布:552B参数MoE模型性能反超旗舰,KV缓存压缩至1/8

DeepSeek V4.1 Flash发布:552B参数MoE模型性能反超旗舰,KV缓存压缩至1/8

DeepSeek发布最小尺寸MoE模型,性能全面超越V4 Pro,KV缓存效率大幅提升。

DeepSeek推出全新MoE模型,弱势端反超强势端

DeepSeek推出全新MoE模型,弱势端反超强势端
DeepSeek推出全新MoE模型,弱势端反超强势端|新闻截图

2026年9月10日,DeepSeek正式发布DeepSeek V4.1 Flash,一款552B参数的Mixture-of-Experts(MoE)模型。作为DeepSeek全新架构系列中尺寸最小的成员,该模型在多项基准测试中全面超越了此前的旗舰模型DeepSeek V4 Pro

核心硬信息如下:

  • 发布时间:2026年9月10日12:00(新价格即时生效)
  • 新版本:DeepSeek V4.1 Flash(552B参数MoE)
  • 接入方式:API调用模型名改为deepseek-flash
  • 开源状态:HuggingFace全量开源(链接
  • 架构特性:原生多模态视觉理解能力;CSA2压缩稀疏注意力2;FP4全局KV缓存精度

架构创新:三重协同实现缓存效率质变

架构创新:三重协同实现缓存效率质变
架构创新:三重协同实现缓存效率质变|新闻截图

V4.1 Flash的KV Cache缓存效率相比前代实现大幅跃升:与DeepSeek V4 Flash相比,HBM(高性能显存)需求降至1/4,SSD(固态硬盘)持久化缓存需求降至1/8;对比初代V1模型,缓存需求更是压缩至1/437

这一突破源于架构、精度与部署策略的三方协同改进:

  1. 架构层:CSA2压缩稀疏注意力机制——全局KV缓存和Top-K索引跨层复用,每层仅保留查询向量与局部注意力缓存,消除重复存储
  2. 精度层:FP4训练时存储——全局KV缓存在训练阶段即采用4位浮点格式存储,官方称性能损失可忽略
  3. 部署层:SWA有界重放机制——仅需重放最近n个token即可重建滑动窗口注意力状态,SWA缓存无需再写入SSD

这种设计使上下文长度从4K拓展至1M,单token解码FLOPs仅增加约25%,解决长上下文推理成本随长度激增的行业难题。

价格与性能:更小尺寸,更高能力

模型参数规模激活参数缓存效率(相较V4 Flash)上下文长度定价策略(闲时/高峰)
V4.1 Flash552B MoE输入8B/输出16BHBM 1/4,SSD 1/81M输入(命中)0.02/0.04元,输出4.0/8.0元
V4 Flash未披露未披露基准未披露已下线

在Agent benchmarks测试中,这款“小模型”实现了对V4 Pro、GLM5.3、Kimi-K3等主流旗舰的全方位超越。官方指出新架构设计目标为:能力上限更高、推理速度更快、吞吐更大,且支持扩展至更大参数规模。

业务影响与落地建议

业务影响与落地建议
业务影响与落地建议|新闻截图

对高频Agent用户而言,缓存压缩与价格降低产生叠加效应。在缓存命中的场景中,费用占总成本比例显著下降,同样预算可执行更多任务

适合直接接入的场景:

  • 需要长上下文(>32K tokens)的文档分析与多轮对话Agent
  • 成本敏感型业务流程自动化,需频繁中断-恢复任务的工作流
  • 本地化部署轻量级多模态能力(视觉理解原生支持)

建议再观察的场景:

  • 对推理延迟极度敏感的实时系统(新模型未披露端到端延迟数据)
  • 依赖DeepSeek V4 Pro特有能力的工作负载(V4 Pro将于9月14日12:00完全下线,请求将自动路由至V4.1 Flash)

生态协同与开源支持

生态协同与开源支持
生态协同与开源支持|新闻截图

DeepSeek同步更新了Harness v0.1.5,支持在保留KV Cache前提下更新系统提示词,降低动态调整成本。腾讯旗下的WorkBuddy、CodeBuddy及OpenCode已全量接入V4.1 Flash,其中OpenCode Go套餐提供4倍使用额度;腾讯云TokenHub、ima、Marvis同步适配。

同期开源的DeepSeek Harness与轻量级xPU内核JIT编译库DeepJIT(支持NVIDIA CUDA与昇腾NPU),为大规模部署提供基础设施支持。

写在最后

从参数规模与实际性能的背离,到缓存效率的指数级下降,DeepSeek的最小模型反超旗舰的策略揭示了MoE架构与缓存优化的协同潜力。当推理成本曲线被硬件特性重新定义,AI应用的经济模型正在发生结构性迁移。