大模型
智谱Z.ai发布GLM-5.3:后训练撬动编程与安全双跃迁,Terminal-Bench 3.0登顶开源第一
发布时间:2026年08月16日 10:00:008月16日,智谱Z.ai正式发布GLM-5.3,沿用743B MoE基座但通过深度后训练将编程能力较5.2提升约50%,Terminal-Bench 3.0登顶开源第一,CyberGym安全基准达84.5%超越Claude与GPT-5.6。模型已协助在269个真实项目发现超2400个漏洞。因网络安全审查暂缓全量开源权重,改为先上线ZCode等平台、两周内放权重,标志开源大模型竞争从拼参数转向后训练+安全审计双轴。
事件概况
8月16日,智谱Z.ai正式推出GLM-5.3大模型。模型沿用GLM-5.2的743B MoE基座,但通过深度后训练实现了编程和安全能力的双重跃升。这是开源大模型竞争从"拼参数"转向"后训练+安全审计"的标志性事件。
核心性能
编程能力跃升
| 指标 | GLM-5.2 | GLM-5.3 | 提升 |
|---|---|---|---|
| 编程能力综合 | 基准 | 较5.2提升约50% | +50% |
| Terminal-Bench 3.0 | 开源前列 | 开源第一 | 登顶 |
安全能力突破
| 指标 | GLM-5.3 | 对比 |
|---|---|---|
| CyberGym安全基准 | 84.5% | 超越Claude和GPT-5.6 |
| 真实项目漏洞发现 | 2400+ | 269个真实项目 |
技术路线
基座不变,后训练驱动
GLM-5.3的关键策略是"基座不变,后训练驱动":
- 基座:沿用GLM-5.2的743B MoE架构
- 后训练:通过深度后训练提升能力
- 意义:证明后训练可以大幅提升模型能力,而不需要重新训练基座
后训练的威力
| 方面 | 传统做法 | GLM-5.3做法 |
|---|---|---|
| 能力提升 | 重新训练更大模型 | 后训练优化现有模型 |
| 成本 | 极高(需要大量算力) | 较低(后训练成本远低于预训练) |
| 周期 | 数月 | 数周 |
| 灵活性 | 低(一旦训练难以调整) | 高(可持续优化) |
安全审计成果
漏洞发现
- 在269个真实项目中发现超过2400个漏洞
- 涵盖多种编程语言和项目类型
- 漏洞类型包括:安全漏洞、逻辑错误、性能问题等
安全审查暂缓全量开源
- 因GLM-5.3的安全能力可能被滥用
- 暂缓全量开源权重
- 改为先上线ZCode等平台
- 两周内放出权重
这是首个因安全审查而暂缓开源的案例,标志着AI公司开始认真对待模型安全的双刃剑问题。
开源策略调整
分阶段开源
| 阶段 | 内容 | 时间 |
|---|---|---|
| 第一阶段 | ZCode平台上线 | 发布日 |
| 第二阶段 | API和平台服务 | 发布日 |
| 第三阶段 | 开源权重 | 两周内 |
安全审计流程
- 模型开发完成
- 内部安全审计
- 外部安全评估
- 审查通过后开源权重
- 持续监控和安全更新
行业意义
开源竞争新阶段
| 阶段 | 竞争焦点 | 代表 |
|---|---|---|
| 1.0 | 拼参数量 | GPT-3 (175B) |
| 2.0 | 拼训练数据 | LLaMA、Qwen |
| 3.0 | 拼后训练 | GLM-5.3、DeepSeek V4 |
| 4.0 | 拼安全审计 | GLM-5.3首创 |
后训练+安全审计双轴
GLM-5.3标志着开源大模型竞争的两个新维度:
- 后训练深度:不是参数越大越好,而是后训练越精越好
- 安全审计严格度:安全能力强的模型需要更严格的开源审查
对开发者的影响
- 获得编程和安全双重能力强大的开源模型
- 安全审查暂缓开源可能影响部分开发者
- ZCode平台提供先期使用渠道
- 两周内开源权重的承诺提供时间预期
竞品对比
| 模型 | 参数量 | 后训练重点 | 安全能力 | 开源状态 |
|---|---|---|---|---|
| GLM-5.3 | 743B MoE | 编程+安全 | CyberGym 84.5% | 两周内开源 |
| Qwen3.8-27B | 27B | 多模态 | 未公布 | Apache 2.0 |
| Qwen3.8-Max | 2.4T | 旗舰级 | 未公布 | Apache 2.0 |
| Muse Glimmer | 30B | Agent能力 | 未公布 | Apache 2.0 |
| DeepSeek V4 Pro | 未公布 | Agent能力 | 未公布 | 部分开源 |
后续观察
GLM-5.3两周后开源权重的实际表现、安全审查对开源的影响、以及后训练策略是否被其他公司效仿,将是关键观察点。