Featured image of post 长上下文、多模态与 Agent:AICon 深圳聚焦大模型效率工程

长上下文、多模态与 Agent:AICon 深圳聚焦大模型效率工程

大会将讨论多模态推理中的效率瓶颈。

AICon 全球人工智能开发与应用大会将于 8 月 21 日至 22 日在深圳举办,浙江大学研究员庄博涵将在会上分享面向多模态推理的高效长上下文建模方法。

从模型能力到系统效率

从模型能力到系统效率
从模型能力到系统效率|新闻截图

随着大模型能力持续演进,产业关注点正在从单纯追求模型效果,转向如何把 AI 做成可靠、可持续运行的系统。尤其在 Agent、视频理解、世界模型等场景中,模型不再只是回答问题,而要在更长上下文中处理多轮信息、视觉内容与外部工具调用。

本届 AICon 深圳站日程已上线,议题覆盖 Agent 工程化、大模型基础设施、AI Native 研发、具身智能等方向。大会设置 10 个专题论坛、1 个动手实验室、近 60 场议题,并邀请来自高校与企业的一线技术专家参与,包括阿里、腾讯、华为、快手、Google Cloud 团队等。

庄博涵的演讲被安排在“大模型效率工程与 Agent 系统实践”专题,题为《面向多模态推理的高效长上下文建模》。其核心问题是:当上下文越来越长、生成成本越来越高,多模态大模型如何在理解与生成中保持效率。

三条主线:注意力、记忆与解码

演讲将围绕“算法—系统协同设计”展开。这里的协同设计,指算法结构与底层推理系统一起优化,而不是只在模型或硬件单侧做改进。

第一是高效注意力。 注意力机制用于让模型判断序列中不同位置之间的关联,但传统注意力计算量会随序列长度呈二次增长,长文本、长视频会迅速放大成本。分享将涉及稀疏注意力、线性注意力等方法,用于支撑长上下文理解与长视频生成。

第二是高效记忆。 KV-cache 是推理时保存历史键值向量的缓存,可减少重复计算,但长序列会带来显存压力。庄博涵团队将介绍 KV-cache 压缩与缓存管理,目标是在尽量保持效果的前提下降低显存占用。

第三是高效解码。 解码是模型逐步生成输出的过程。并行解码策略试图提升推理吞吐、降低生成时延,对需要快速反馈的 Agent 与交互式应用尤为关键。

多模态 Agent 与世界模型实践

在多模态大模型方向,分享将把效率技术与理解、生成两类能力串联起来。理解侧重点包括在有限算力下处理长视频,并支持空间推理与决策;生成侧重点包括以更低成本实现世界模型生成,涉及 3D 世界生成重建、长视频生成等场景。

世界模型可理解为让 AI 生成或预测环境状态的模型,在游戏、具身智能等仿真场景中,它不仅要生成高质量视频,还要支持低延迟的实时交互。原文披露了庄博涵团队的几项进展:

  • FPSAttention 针对视频 DiT 的三维注意力改进,在 NVIDIA H20 上运行 Wan2.1-14B、生成 720p 视频时,注意力算子最高加速 7.09×,端到端视频生成最高加速 4.96×
  • FlashBlock 在 block diffusion 范式中探索缓存机制,在长文本和视频生成实验中实现最高 1.44× token 吞吐提升、1.6× 注意力耗时降低;
  • Mirage 将视频模型的空间记忆保存在潜空间中,使三维缓存显存占用最高降低 55 倍,端到端最高加速 10×,并在 WorldScore 上取得最佳结果。

这些系统与算法研究正在整合到 Inferix 框架中。按介绍,Inferix 面向 World Model 提供 Block Diffusion 推理引擎,支持 KV-cache 管理、流式视频生成和交互式 world rollout。

Agent loop 的长上下文压力

Agent loop 指智能体在“观察、思考、行动、再观察”之间循环执行任务的过程。原文提到,在 Claude Code、Codex、OpenClaw 等 Agent 框架中,上下文长度会不断累积,首轮 prefill 时间和 KV-cache 显存占用随之上升。prefill 是模型首次读取上下文并建立缓存的阶段,长上下文会让这一步变慢。

针对这一问题,团队提出了 TriAttention。在 AIME25 的 32K token 生成实验中,该方法在保持与完整注意力相当推理准确率的情况下,实现 2.5× 吞吐提升或 10.7× KV-cache 显存压缩。

算法层面,团队还探索大小模型协同。R-Stitch 根据熵切换大小模型,在不同尺寸模型的推理任务上分别实现 3-4 倍加速,并保持接近完整大模型解码的准确率。Agent-as-a-Router 则把模型选择设计成 Agent Loop,在 2900 个编码任务上测试,带 router 的框架平均任务得分高于 opus,成本不到 opus 的一半。

效率工程将成为落地分水岭

从大会议题看,大模型竞争正在进入工程化深水区。多模态、长上下文、Agent 与具身智能都要求模型处理更多信息、维持更长状态,并在可接受成本下快速响应。单点模型能力仍重要,但能否管理显存、降低延迟、提高吞吐,正在决定系统能否规模化部署。

不过,效率优化并非无代价。原文也指出,稀疏/线性注意力、KV-cache 压缩等方法通常存在效率与质量权衡,质量损失可控但并非为零,且最佳配置会随任务、模态和序列长度变化。未来一段时间,高效基础模型的关键不只是提出更快的算子或压缩方法,而是形成可诊断、可调优、可迁移的工程框架,让 Agentic loop 和世界模型真正进入复杂业务与交互场景。