大模型

智谱Z.ai发布GLM-5.3:后训练撬动编程与安全双跃迁,Terminal-Bench 3.0登顶开源第一

发布时间:2026年08月16日 10:00:00

8月16日,智谱Z.ai正式发布GLM-5.3,沿用743B MoE基座但通过深度后训练将编程能力较5.2提升约50%,Terminal-Bench 3.0登顶开源第一,CyberGym安全基准达84.5%超越Claude与GPT-5.6。模型已协助在269个真实项目发现超2400个漏洞。因网络安全审查暂缓全量开源权重,改为先上线ZCode等平台、两周内放权重,标志开源大模型竞争从拼参数转向后训练+安全审计双轴。


事件概况

8月16日,智谱Z.ai正式推出GLM-5.3大模型。模型沿用GLM-5.2的743B MoE基座,但通过深度后训练实现了编程和安全能力的双重跃升。这是开源大模型竞争从"拼参数"转向"后训练+安全审计"的标志性事件。

核心性能

编程能力跃升

指标GLM-5.2GLM-5.3提升
编程能力综合基准较5.2提升约50%+50%
Terminal-Bench 3.0开源前列开源第一登顶

安全能力突破

指标GLM-5.3对比
CyberGym安全基准84.5%超越Claude和GPT-5.6
真实项目漏洞发现2400+269个真实项目

技术路线

基座不变,后训练驱动

GLM-5.3的关键策略是"基座不变,后训练驱动":

  • 基座:沿用GLM-5.2的743B MoE架构
  • 后训练:通过深度后训练提升能力
  • 意义:证明后训练可以大幅提升模型能力,而不需要重新训练基座

后训练的威力

方面传统做法GLM-5.3做法
能力提升重新训练更大模型后训练优化现有模型
成本极高(需要大量算力)较低(后训练成本远低于预训练)
周期数月数周
灵活性低(一旦训练难以调整)高(可持续优化)

安全审计成果

漏洞发现

  • 在269个真实项目中发现超过2400个漏洞
  • 涵盖多种编程语言和项目类型
  • 漏洞类型包括:安全漏洞、逻辑错误、性能问题等

安全审查暂缓全量开源

  • 因GLM-5.3的安全能力可能被滥用
  • 暂缓全量开源权重
  • 改为先上线ZCode等平台
  • 两周内放出权重

这是首个因安全审查而暂缓开源的案例,标志着AI公司开始认真对待模型安全的双刃剑问题。

开源策略调整

分阶段开源

阶段内容时间
第一阶段ZCode平台上线发布日
第二阶段API和平台服务发布日
第三阶段开源权重两周内

安全审计流程

  1. 模型开发完成
  2. 内部安全审计
  3. 外部安全评估
  4. 审查通过后开源权重
  5. 持续监控和安全更新

行业意义

开源竞争新阶段

阶段竞争焦点代表
1.0拼参数量GPT-3 (175B)
2.0拼训练数据LLaMA、Qwen
3.0拼后训练GLM-5.3、DeepSeek V4
4.0拼安全审计GLM-5.3首创

后训练+安全审计双轴

GLM-5.3标志着开源大模型竞争的两个新维度:

  1. 后训练深度:不是参数越大越好,而是后训练越精越好
  2. 安全审计严格度:安全能力强的模型需要更严格的开源审查

对开发者的影响

  • 获得编程和安全双重能力强大的开源模型
  • 安全审查暂缓开源可能影响部分开发者
  • ZCode平台提供先期使用渠道
  • 两周内开源权重的承诺提供时间预期

竞品对比

模型参数量后训练重点安全能力开源状态
GLM-5.3743B MoE编程+安全CyberGym 84.5%两周内开源
Qwen3.8-27B27B多模态未公布Apache 2.0
Qwen3.8-Max2.4T旗舰级未公布Apache 2.0
Muse Glimmer30BAgent能力未公布Apache 2.0
DeepSeek V4 Pro未公布Agent能力未公布部分开源

后续观察

GLM-5.3两周后开源权重的实际表现、安全审查对开源的影响、以及后训练策略是否被其他公司效仿,将是关键观察点。