Featured image of post 智谱开源GLM-5.3 Flash:320B参数国产多模态模型,实测能力媲美Claude Opus 4.8

智谱开源GLM-5.3 Flash:320B参数国产多模态模型,实测能力媲美Claude Opus 4.8

智谱发布首个原生多模态开源模型GLM-5.3 Flash,320B参数 filepath 18B激活,支持国产芯片部署。

神秘“牛来”模型实为智谱GLM-5.3 Flash

智谱于2026年8月下旬正式发布并开源GLM-5.3 Flash模型,该模型此前以匿名测试名“Ox Alpha”(牛来)在海外社区引发轰动。核心信息点如下:

  • 发布时间:2026年8月下旬,已同步开源
  • 新版本:GLM-5系列首个原生多模态模型(Flash版),参数量320B,激活参数18B
  • 价格策略:定价为GLM-5.3的1/10,限时折扣为CLaude Opus 4.8的1/40、GLM-5.2的1/20
  • 可用性:已接入ZCode开放平台、开放API,Hugging Face权重完全开放
  • 硬件支持:基于国产芯片部署,支持1M上下文长任务

海外爆火的“牛来”模型真身曝光

海外爆火的“牛来”模型真身曝光
海外爆火的“牛来”模型真身曝光|新闻截图

在智谱正式认领前, anonymously 测试版“Ox Alpha”已悄然走红海外:

  • OpenRouter平台首日冲上榜首,刷新单日tokens用量历史纪录
  • OpenCode平台终结DeepSeek连续56天霸榜纪录
  • 全球开发者用其完成多项高难度任务,包括3D发动机建模、视频字幕生成与电影原片解说

智谱实测显示,320B的GLM-5.3 Flash在能力上全面超越753B的上代旗舰GLM-5.2;在最新AA榜单中以57分与Claude Opus 4.8持平。这一反差凸显其架构效率优势——模型瘦身后单次任务能力不降反升

指标GLM-5.3 FlashGLM-5.2CLaude Opus 4.8
总参数320B753B未公开
AA得分57未公开57
定价(相对)1~10x~40x
多模态原生支持不支持原生支持
国产芯片支持未说明

架构革新:线性+稀疏注意力驱动高效推理

架构革新:线性+稀疏注意力驱动高效推理
架构革新:线性+稀疏注意力驱动高效推理|新闻截图

GLM-5.3 Flash的瘦身后劲来自三方面技术突破:

  1. 混合注意力机制:线性注意力抓局部信息,稀疏注意力通过轻量索引器召回全局上下文,将注意力计算量降低3.01倍,KV Cache缩小4.44倍
  2. 推理架构分离:Encode-Prefill-Decode三层解耦,支持独立扩缩容,适配国产芯片的资源调度特性
  3. 视觉反馈闭环:专为Visual Coding构建数据合成流水线,使模型在执行UI还原、3D建模等任务时能“边写边看边改”

配合30T Token多模态预训练语料与-native多模态编码优化,模型在国产芯片上实现端到端服务性能提升3倍,单token成本与主流英伟达GPU相当。

落地场景建议

落地场景建议
落地场景建议|新闻截图

推荐立即尝试者

  • 中小模型厂商与独立开发者:开源权重降低部署门槛,适合用于多模态内容生成、智能客服、教育视频处理等高频轻任务场景
  • 期待国产替代方案的团队:在国产芯片生态(如昇腾、寒武纪)中需兼顾性能与成本的场景

建议再观望者

  • 需要成熟Agent工作流的企业级用户:当前版本侧重单次任务完成能力,复杂多步骤Agent调度尚未体现明显优势
  • 极端长上下文(>1M)依赖型应用:虽支持1M上下文,但实际长程推理稳定性有待公开长期压力测试

写在最后

写在最后
写在最后|新闻截图

GLM-5.3 Flash的发布标志着国产大模型从“参数竞赛”转向“全栈效率优化”的新阶段:用更低的资源消耗,在国产芯片上跑出全球前沿性能。当前沿模型价格从“奢侈品”步向“日用品”,真正强大的模型将不再由算力规模定义,而是由单位成本下的有效任务完成率决定。