Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

GLM-5.3-Flash采用混合注意力架构,融合Kimi的KDA线性注意力与DeepSeek的稀疏注意力,反映行业从单一技术路线转向组合创新。

混合注意力架构成为新主流:GLM-5.3-Flash配置公开

混合注意力架构成为新主流:GLM-5.3-Flash配置公开
混合注意力架构成为新主流:GLM-5.3-Flash配置公开|新闻截图

智谱AI于近期公开GLM-5.3-Flash项目配置文件,揭示其45层模型架构采用混合注意力设计:34层采用Kimi路线的KDA线性注意力,11层采用DeepSeek路线的KPool-DSA稀疏注意力。这一配置标志着大模型架构正从早期追求单一高效注意力机制,转向多机制协同分工的组合路线。

与GLM-5.3-Flash同期,Qwen3.8-Flash-Next同样延续类似思路——四层结构中三层为Gated DeltaNet,一层采用Qwen Sparse Attention。MiniMax则在M3版本中转向自研的MiniMax Sparse Attention(MSA),将上下文处理计算量压缩至前代的1/20(100万token场景下)。这些更新共同指向一个趋势:过去被视为兜底方案的全局注意力,正逐渐被更精细分工的混合机制替代。

技术路线从竞争走向协同

技术路线从竞争走向协同
技术路线从竞争走向协同|新闻截图

注意力机制主要分三类:全局注意力(Full/Global Attention)保留完整token历史但成本高;线性注意力(Linear Attention)通过压缩历史降低计算成本;稀疏注意力(Sparse Attention)保留token级历史但仅选择性参与计算。过去几年,三者常被理解为竞争关系:MiniMax曾全面押注Linear Attention(M1),后因多跳推理能力损失风险,在M2重新切换回Full Attention;M3则因Agent任务导致长上下文成本飙升,转向MSA稀疏方案。

关键反差点在于:Kimi与DeepSeek的技术原本分属不同技术阵营,如今却被同一系列模型采用。开源社区FLA maintainer杨松琳2024年维护FLA时,已提出Linear与Sparse结合的构想;KDA与DSA的共存正是这一判断的实践印证——前者负责维持长历史整体状态,后者负责精确检索具体内容,二者在职能上形成互补而非替代。

技术扩散加速推动架构重组

技术扩散加速推动架构重组
技术扩散加速推动架构重组|新闻截图

开源社区、代码共享与研究人员流动正在缩短技术迭代周期。FLA开源社区不仅开放算法,还统一接口、kernel与实现,为Kimi推进KDA提供了基础设施支持。当技术不再仅依附于论文传播,而可通过可复用代码跨越公司边界时,所谓"技术路线"的定义随之改变:

  • MiniMax曾代表Linear路线,现转向Sparse
  • DeepSeek以稀疏注意力著称
  • Kimi主导KDA线性方案

但真正拉开差距的,已非"是否拥有某项技术",而是何时采用、如何组合,以及在能力、成本与工程风险间的权衡能力。M2时期MiniMax曾为能力确定性接受Full Attention的高成本;M3时Agent场景让该"保险"价格过高,促使团队再次转向稀疏方案。技术无优劣,约束条件变化才驱动架构更迭。

模型注意力架构特征核心参数/能力表现核心变更动因
GLM-5.3-Flash34层KDA + 11层KPool-DSA45层混合架构职能分工:整体记忆 vs 精确检索
Qwen3.8-Flash-Next3层GDN + 1层QSA继承前三层结构,替换Attention为稀疏方案全局注意力功能迁移至高效机制
MiniMax M3MiniMax Sparse Attention上下文处理计算量约为上一代的1/20Agent长工作历史导致成本不可持续

读者落地建议

读者落地建议
读者落地建议|新闻截图

适合采用混合注意力架构的新模型开发者:若需在长上下文处理与计算成本间平衡,且任务包含多跳推理或精确检索混合需求,可参考KDA+DSA组合范式,将流程拆分为"状态维持-热点检索"两阶段。建议再观望的技术团队:若当前应用限于中短上下文(<10万token),全局注意力或轻量级线性注意力仍具成本优势;混合设计的复杂性可能抵消其理论收益。

写在最后

注意力机制正从"寻找最优解"转向"定义最优组合",技术扩散与组合创新已成为大模型演进的核心引擎。真正难以复刻的,是团队对下一阶段约束条件的前瞻性判断能力。