核心事件
Z.ai发布GLM-5.3,称其沿用GLM-5.2的同一基座模型,全部提升来自后训练扩展,并将在发布两周后、完成安全评估与加固后开放权重。
所谓后训练,通常指在基础模型预训练之后,通过监督微调、强化学习和任务环境交互等方式,让模型更适合特定能力场景。Z.ai表示,GLM-5.2阶段已经搭建了IndexShare、SAO和slime等训练栈:前者用于高效长上下文处理,SAO面向长周期任务强化学习,slime支持大规模异步训练。过去一个月,团队主要增加环境、任务多样性和训练算力,而非更换基座。
代码能力:从题目走向真实工程

GLM-5.3的重点是复杂编码和长周期任务。Z.ai称,其内部Z.ai Code Bench上相对GLM-5.2提升50%,该私有基准强调真实用户场景:模型被放入复杂本地开发环境,按不同努力等级评估端到端完成率和细粒度清单准确率,以降低公开测试集污染风险。
公开基准上,GLM-5.3的进步集中在需要多步规划、工具调用和持续验证的任务:
- Terminal Bench 3.0:从GLM-5.2的4.6升至28.3;
- DeepSWE v1.1:从46.2升至66.9;
- Agents’ Last Exam ALE-CLI:从23.8升至28.5;
- AutomationBench v1.0.6:从26.2升至48.2。
Z.ai特别强调,训练环境不再只是“编程练习”,而更接近工程师或研究员的实际工作单元。例如在机器学习基础设施任务中,模型可能需要访问计算集群、存储系统、内部文档、代码库和实验结果,诊断训练栈瓶颈,实施优化并验证端到端加速,同时保持正确性。这类任务迫使模型承担从分析到交付的完整流程,而不是等待用户拆解每一步。
环境生成成为扩展瓶颈
随着智能体能力提升,难点从“模型会不会做”转向“有没有足够可执行、可验证、接近真实工作的训练环境”。Z.ai称其构建了端到端合成环境的流水线,部分任务还会合成强化学习奖励信号。研究智能体从真实工作中提取任务模式,转化为带多步依赖和隐藏状态的可运行环境;评审智能体尝试解题,确认任务可解;验证器不接触参考答案,并通过oracle、空操作和未解状态检查,以降低奖励漏洞。
在内部Code Bench中,GLM-5.3还显示出更高token效率:Max effort下,GLM-5.3以约7.5万输出token达到34.5%,而GLM-5.2以9.6万token达到23.4%;High effort下,GLM-5.3以约5万token达到31.4%,超过Claude Opus 4.8在12万token下的29.5%。不过其仍落后于Claude Fable 5,后者Max effort达到39.5%。
网络安全能力的意外跃迁
Z.ai称,在后训练中加入了漏洞发现数据和环境,本意是增强漏洞识别与推理,但模型能力扩展速度超出预期。GLM-5.3不只是更会找单点缺陷,还开始跨利用链多个阶段形成连贯计划。
安全相关基准显示出明显分层:CyberGym侧重从白盒源码中识别并验证漏洞,GLM-5.3得分84.5%,高于GLM-5.2的77.2%;ExploitBench要求围绕真实漏洞做更深入利用推理,GLM-5.3达54.4%,超过GLM-5.2的24.4%;ExploitGym按时间归一化预算统计完成的利用任务数,GLM-5.3在2小时/6小时内完成105/130个,GLM-5.2为29/39个。
不过,越接近完整利用链,GLM-5.3相对前代提升越大,与封闭前沿模型差距也越明显。例如ExploitBench上,表中Fable 5和GPT-5.6 Sol分别为78.0%和76.5%;ExploitGym上二者完成数也显著更高。
行业点评:开源代码智能体进入安全敏感区
GLM-5.3传递出的信号是,开源权重模型的竞争不再只看参数规模或通用问答,而是转向长周期任务环境、可验证奖励和真实工作流迁移。对开发者而言,更强的编码智能体可能提高重构、调试、基础设施优化等复杂任务的自动化程度;对企业而言,私有基准与本地环境能力也更接近实际采用需求。
但网络安全能力的同步增长会让发布策略更受关注。Z.ai选择延后两周开放权重,并以安全评估和加固作为前提,说明前沿开源模型正进入“能力释放”和“滥用防范”必须同时设计的阶段。接下来,模型厂商的差异化很可能不只来自模型本身,还来自谁能持续构建高质量长周期环境,并给出可信的安全边界。



