Featured image of post DeepSeek V4.1-Flash 发布:CED+CSA2 架构重构长上下文推理,KV 缓存压缩 437 倍

DeepSeek V4.1-Flash 发布:CED+CSA2 架构重构长上下文推理,KV 缓存压缩 437 倍

DeepSeek 采用新型因果编码器-解码器与第二代压缩稀疏注意力,大幅降低长上下文推理成本

核心事件与硬信息概览

核心事件与硬信息概览
核心事件与硬信息概览|新闻截图

DeepSeek V4.1-Flash 于 2026 年 9 月正式上线,作为针对长上下文场景的架构重写版本,其关键信息如下:

  • 发布时间:2026 年 9 月
  • 模型版本:DeepSeek V4.1-Flash
  • 参数量:主干 552B,外挂 196B Engram 记忆模块
  • 激活规模:预填充阶段仅激活 8B 参数,解码生成阶段仅激活 16B 参数
  • 适用场景:百万 Token 级超长上下文推理与 Agent 任务
  • 权重开放:技术报告与模型代码已在 Hugging Face 公开

与上一代 V4-Flash 和旗舰 V4-Pro 相比,V4.1-Flash 采用全新架构,在显著降低计算与存储成本的同时,在多项公开基准测试中实现性能反超,打破“高参数量=高能力”的传统认知。

架构革新:CED 与 CSA2 双引擎压缩

架构革新:CED 与 CSA2 双引擎压缩
架构革新:CED 与 CSA2 双引擎压缩|新闻截图

V4.1-Flash 的核心突破来自两大架构组件——因果编码器-解码器(CED)与第二代压缩稀疏注意力(CSA2)。

CED 架构将 40 层网络分为两部分:前 20 层构成因果编码器,通读全部上下文后输出高度浓缩的隐状态摘要;后 20 层作为解码器,不重复扫读全部内容,而是通过投影矩阵直接从摘要生成所需的全局 KV 缓存。这一设计将预填充阶段的计算量直接减半。为兼顾局部精准性,系统引入滑动窗口注意力(SWA)与“有限回放”机制——仅选取极少数关键 Token 进行高精度重建,在成本可控前提下保留细节处理能力。

CSA2 则专攻存储优化,彻底重构上一代 CSA+HCA 混合架构。旧方案在每层独立保存完整 KV 缓存副本,40 层即产生 40 份重复存储;CSA2 实现跨层 KV 复用与跨层 Top-K 索引复用,使全部层级共享同一份缓存副本。其内部进一步设计三种运行模式:Full(全量处理与索引生成)、Reindex(复用 Full 输出并重新筛选重点)、Reuse(直接调用结果跳过计算)。通过分层策略,仅极少数层运行 Full 模式,其余大幅简化计算流程。

此外,CSA2 搭配 FP4 量化方案:长期核心记忆(主 KV 缓存)压缩至 FP4 精度,短期局部细节(SWA-KV 缓存)保留 FP8 高精度,并辅以量化感知训练(QAT)确保实际推理精度损失微乎其微。

关键性能与成本数据对比

关键性能与成本数据对比
关键性能与成本数据对比|新闻截图

指标DeepSeek V4-FlashDeepSeek V4.1-Flash压缩比
全局单 Token KV 体积基准1/44x
落盘持久 KV 缓存基准1/88x
预填充计算量基准1/22x
上下文扩展(4K→百万 Token)解码计算增长约 25%趋于平缓

最显著的反差在于:若将局部细节记忆(SWA-KV)的可弃特性计入——短期记忆用完即丢贡献 50% 收益,长期记忆架构与量化压缩贡献另 50% ——整体 KV 缓存压缩达 437 倍(原文提法,指端到端端效率提升综合值,非单一 KV 体积比)。这意味着百万 Token 级任务的服务器存取与计算开销实现断崖式下降。

落地建议:谁该优先尝试

落地建议:谁该优先尝试
落地建议:谁该优先尝试|新闻截图

  • 适合即刻上车:AI 应用开发商与企业 Agent 开发者——尤其需高频调用 API 处理长文本任务(如代码分析、法律文档审查、安全运维自动化)者。10 元/次的旧成本descending 至 1~2 元区间,直接释放工业级生产力。
  • 建议再等等:对绝对局部精度零容忍的应用场景(如高敏感医疗文书逐字校对),若 SWA+有限回放机制覆盖不足,可等待后续版本验证细节保真度;或当前阶段仅用于粗筛与摘要生成,人工复核关键结论。

写在最后

V4.1-Flash 证明:通过底层架构重写而非单纯参数扩充,也能实现大模型性能跃迁。CED+C SA2 的组合为行业提供新范式——稀疏机制、跨层复用与可控近似可成为下一代长上下文模型的核心拼图,而非稠密 Transformer 的简单放大版。