DeepSeek推出全新MoE模型,弱势端反超强势端

2026年9月10日,DeepSeek正式发布DeepSeek V4.1 Flash,一款552B参数的Mixture-of-Experts(MoE)模型。作为DeepSeek全新架构系列中尺寸最小的成员,该模型在多项基准测试中全面超越了此前的旗舰模型DeepSeek V4 Pro。
核心硬信息如下:
- 发布时间:2026年9月10日12:00(新价格即时生效)
- 新版本:DeepSeek V4.1 Flash(552B参数MoE)
- 接入方式:API调用模型名改为
deepseek-flash - 开源状态:HuggingFace全量开源(链接)
- 架构特性:原生多模态视觉理解能力;CSA2压缩稀疏注意力2;FP4全局KV缓存精度
架构创新:三重协同实现缓存效率质变
V4.1 Flash的KV Cache缓存效率相比前代实现大幅跃升:与DeepSeek V4 Flash相比,HBM(高性能显存)需求降至1/4,SSD(固态硬盘)持久化缓存需求降至1/8;对比初代V1模型,缓存需求更是压缩至1/437。
这一突破源于架构、精度与部署策略的三方协同改进:
- 架构层:CSA2压缩稀疏注意力机制——全局KV缓存和Top-K索引跨层复用,每层仅保留查询向量与局部注意力缓存,消除重复存储
- 精度层:FP4训练时存储——全局KV缓存在训练阶段即采用4位浮点格式存储,官方称性能损失可忽略
- 部署层:SWA有界重放机制——仅需重放最近n个token即可重建滑动窗口注意力状态,SWA缓存无需再写入SSD
这种设计使上下文长度从4K拓展至1M,单token解码FLOPs仅增加约25%,解决长上下文推理成本随长度激增的行业难题。
价格与性能:更小尺寸,更高能力
| 模型 | 参数规模 | 激活参数 | 缓存效率(相较V4 Flash) | 上下文长度 | 定价策略(闲时/高峰) |
|---|---|---|---|---|---|
| V4.1 Flash | 552B MoE | 输入8B/输出16B | HBM 1/4,SSD 1/8 | 1M | 输入(命中)0.02/0.04元,输出4.0/8.0元 |
| V4 Flash | 未披露 | 未披露 | 基准 | 未披露 | 已下线 |
在Agent benchmarks测试中,这款“小模型”实现了对V4 Pro、GLM5.3、Kimi-K3等主流旗舰的全方位超越。官方指出新架构设计目标为:能力上限更高、推理速度更快、吞吐更大,且支持扩展至更大参数规模。
业务影响与落地建议
对高频Agent用户而言,缓存压缩与价格降低产生叠加效应。在缓存命中的场景中,费用占总成本比例显著下降,同样预算可执行更多任务。
适合直接接入的场景:
- 需要长上下文(>32K tokens)的文档分析与多轮对话Agent
- 成本敏感型业务流程自动化,需频繁中断-恢复任务的工作流
- 本地化部署轻量级多模态能力(视觉理解原生支持)
建议再观察的场景:
- 对推理延迟极度敏感的实时系统(新模型未披露端到端延迟数据)
- 依赖DeepSeek V4 Pro特有能力的工作负载(V4 Pro将于9月14日12:00完全下线,请求将自动路由至V4.1 Flash)
生态协同与开源支持
DeepSeek同步更新了Harness v0.1.5,支持在保留KV Cache前提下更新系统提示词,降低动态调整成本。腾讯旗下的WorkBuddy、CodeBuddy及OpenCode已全量接入V4.1 Flash,其中OpenCode Go套餐提供4倍使用额度;腾讯云TokenHub、ima、Marvis同步适配。
同期开源的DeepSeek Harness与轻量级xPU内核JIT编译库DeepJIT(支持NVIDIA CUDA与昇腾NPU),为大规模部署提供基础设施支持。
写在最后
从参数规模与实际性能的背离,到缓存效率的指数级下降,DeepSeek的最小模型反超旗舰的策略揭示了MoE架构与缓存优化的协同潜力。当推理成本曲线被硬件特性重新定义,AI应用的经济模型正在发生结构性迁移。



