DeepSeek V4.1 Flash 正式发布,多模态能力升级
9 月 10 日,深度求索(DeepSeek)正式发布 DeepSeek V4.1 Flash 模型。该模型是其全新模型结构系列中尺寸最小的成员,具备原生多模态视觉理解能力,并已同步上线 DeepSeek API。用户将模型名称切换为 deepseek-flash,即可调用最新的 V4.1 Flash。
核心信息如下:
- 模型类型:552B 参数的 MoE(Mixture of Experts,专家混合)模型
- 激活参数:输入激活 8B,输出激活 16B
- 结构设计:采用 Causal-Encoder-Decoder 非对称结构
- 能力表现:经过新的预训练和更大规模的强化学习后训练,在基准测试中超过包括 DeepSeek V4 Pro 在内的多款旗舰模型
- 存储需求:相较上一代模型,HBM 需求降至 1/4,SSD 需求降至 1/8
- 兼容安排:V4 Flash 与 V4 Flash Vision Exp 已下线,原模型名将暂时路由至 V4.1 Flash
结构与性能:着眼成本和吞吐效率
V4.1 Flash 的 Causal-Encoder-Decoder 结构,目标是提高能力上限、推理速度和吞吐量,并可扩展至更大参数规模的模型。其输入和输出采用非对称设计:输入仅激活 8B 参数,输出激活 16B 参数,旨在降低同等规模模型的推理成本。
另一个重点是 KV Cache 压缩。根据 DeepSeek 公布的信息,与上一代模型相比,V4.1 Flash 对 HBM 的需求降至 1/4,对 SSD 的需求降至 1/8;相较初代模型,KV Cache 为原来的 1/437。
对于 Agent 类任务而言,上下文缓存命中的费用通常是使用成本的重要组成部分。更小的 KV Cache 有望降低长链路工具调用、持续上下文处理等工作负载的资源开销,并减少部署端的存储压力。
已披露的模型信息
| 项目 | DeepSeek V4.1 Flash |
|---|---|
| 总参数量 | 552B MoE |
| 输入激活参数 | 8B |
| 输出激活参数 | 16B |
| 多模态能力 | 原生多模态视觉理解 |
| 模型结构 | Causal-Encoder-Decoder 非对称结构 |
| API 调用名 | deepseek-flash |
| 旧模型兼容 | deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 暂时路由至新模型 |
适用场景与用户建议
可能适合优先评估的用户:
- 需要处理图文输入等多模态任务的开发者与企业;
- 对推理和上下文缓存成本敏感、运行 Agent 长流程任务的团队;
- 希望通过 API 测试新模型结构与多模态能力的研究者。
上线前应重点验证的事项:
- 在自身业务数据、工具调用链和长上下文任务上的实际准确率与稳定性;
- 从旧模型名迁移或兼容路由后,对现有服务行为和成本的影响;
- 多模态输入在具体业务场景中的识别质量与安全边界。
写在最后
V4.1 Flash 展示了大模型竞争中另一条重要路径:除扩大参数规模外,模型结构、激活效率和上下文缓存优化同样会直接影响实际使用成本。对于需要频繁调用模型、处理长上下文或运行 Agent 工作流的用户而言,这类工程优化的价值可能与基准分数的提升同样重要。
