Featured image of post 智谱 GLM-5.3-FlashX 模型上线:200 tokens/s 极速推理,企业级算力全面升级

智谱 GLM-5.3-FlashX 模型上线:200 tokens/s 极速推理,企业级算力全面升级

智谱AI推出GLM-5.3-FlashX模型,最高推理速度达200 tokens/s,已在开放平台上线。

智谱GLM-5.3-FlashX模型正式上线,推理速度再提速

智谱AI于2026年9月18日正式推出GLM-5.3-FlashX模型,面向企业与开发者提供最高200 tokens/s的极速推理服务。以下是本次更新的关键信息:

  • 发布时间:2026年9月18日
  • 新版本:GLM-5.3-FlashX(Model Key:glm-5.3-flashx)
  • 价格:未在公告中披露具体定价, API已上线开放调用
  • 何时可用:即日起可通过官方API开放平台调用
  • 权重是否开放:仅通过API调用,未提及开源权重

技术升级:从Ox Alpha到FlashX的演进路径

GLM-5.3-FlashX此前以“Ox Alpha”为名向全球开发者开放测试,并收获了广泛关注与认可,其调用量持续攀升。面对快速增长的用户体验需求,智谱在10万张国产芯片提供的推理算力基础上,进一步加大对基础设施侧的投入与推理优化。

值得留意的是,本次提速并未弱化模型智能水平——GLM-5.3-Flash系列长期保持同尺寸最强智能水平,此次speed提升使其在智能、价格、速度三方面形成更全面的竞争力。这是一个关键反差点:多数厂商在提升推理速度时会牺牲部分准确率或推理质量,而GLM-5.3-FlashX却实现了智能与速度同步增强。

API调用接口为标准OpenAI兼容格式,支持纯文本对话与工具调用(tool_calling),模型默认返回完整响应(非流式),也可通过stream参数启用SSE流式输出模式。

接口参数与Model Key映射关系

GLM-5.3系列目前提供多个版本供选择,官方文档明确列出了Model Key映射规则:

模型版本Model Key最大输出长度推理特点
GLM-5.3glm-5.3128K tokens旗舰系列,复杂推理、超长上下文
GLM-5.3-Flashglm-5.3-flash128K tokens同尺寸最强智能+提速
GLM-5.3-FlashXglm-5.3-flashx128K tokens最高200 tokens/s
GLM-5.2glm-5.2128K tokens支持thinking模式(none/minimal/low/medium/high/max/xhigh)
GLM-5.1glm-5.1128K tokens温度默认值1.0
GLM-5glm-5128K tokens温度默认值1.0

注:表格数据仅依据源材料中提及的Model Key与参数整理,未包含未公开的版本。GLM-4系列因未在参数描述中提及FlashX相关升级,暂未纳入同一对比维度。

适配建议与落地场景

适合立即使用的场景:

  • 对响应速度敏感的实时交互应用(如客服对话、游戏NPC、高并发API服务)
  • 需要批量处理短文本且对成本敏感的场景(流式与非流式自由切换)
  • 已集成OpenAI风格API的现有系统(兼容性高,改动成本低)

建议再观望的场景:

  • 对模型除速度外的特定能力(如多模态、音频生成)有强依赖的项目,当前资料未提及FlashX在视觉/音频模态上的升级
  • 需要本地部署或私有化部署的政企客户,本次仅明确API上线,未提及其他交付形式

写在最后

在国产推理芯片加速落地的背景下,智谱此次将10万张国产芯片算力与模型优化深度结合,体现了从model-to-inference的全链路优化趋势。当推理速度突破200 tokens/s,用户体验的延迟焦虑或将进入新一阶段的定义。