高通骁龙峰会发布端侧大模型突破性进展
夏威夷时间9月22日(北京时间9月23日3点),高通在2026骁龙峰会上正式宣布:基于第六代骁龙8超级至尊版移动平台,已与阶跃、无量火及江波龙完成端侧AI模型适配与推理优化。核心成果是阶跃StepEdge-Omni 30B-MoE模型在智能手机上的稳定运行,预填充吞吐性能超过每秒330个Token,解码吞吐性能超过每秒28个Token。
该模型拥有300亿参数,采用混合专家(Mixture of Experts, MoE)架构——仅根据任务需求激活部分专家模块,从而在保障能力的同时控制计算开销。
技术突破:内存占用下降超50%,本地化成真
端侧部署300亿参数模型面临三大挑战:推理算力、内存带宽与存储效率。合作方通过三大维度优化实现突破:
- 推理引擎优化:针对MoE架构定制稀疏激活路径,减少无效计算
- 异构调度策略:协同CPU、GPU、NPU资源动态分配任务负载
- 存储方案重构:降低内存带宽压力,提升数据吞吐效率
关键指标显示,模型运行内存需求较行业常规方案降低超过50%,使得在智能手机上实现本地推理成为可能。高通强调,该方案无需调用云端服务,即可完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等智能体任务。
Token吞吐数据背后的意外反差
行业常默认大参数模型必然导致高延迟,但本次测试数据呈现明显反差:
- 预填充吞吐:>330 Token/s(衡量处理长提示词与批量请求能力)
- 解码吞吐:>28 Token/s(影响交互流畅度的核心指标)
预填充吞吐超330 Token/s意味着用户输入 lengthy prompt 时几乎无感知等待,而解码吞吐28 Token/s已达到多数实际应用场景的可用门槛(通常15-20 Token/s即具备基础交互流畅度)。
适配建议:谁该率先尝试?
- 适合立即尝试:高端旗舰手机用户(搭载第六代骁龙8超级至尊版)、重视隐私保护需本地处理敏感数据的商务场景
- 建议再观望:现有中端机型用户(性能约束下难以发挥完整效果)、对响应延迟极度敏感的实时语音交互应用
- 开发者参考:应用层可通过轻量化prompt设计适配端侧推理特性,避免长上下文拖累预填充效率
写在最后
大参数MoE模型在手机端的可行性验证,为低时延与隐私保护型智能体应用打开新路径。规模化落地仍取决于终端成本、功耗、模型可靠性及用户接受度,但端侧大模型从概念走向实用已迈出关键一步。

