💡

文章摘要

2026 年 8 月 14 日智谱发布 GLM-5.3,官方技术报告开篇第一句话是「Scaling post-training is all we did for GLM-5.3」——它与 GLM-5.2 共用同一个基座模型,全部能力提升来自后训练(post-training):更多的任务环境、更多样的任务、更大的训练算力。结果是 Terminal-Bench 3.0 从 4.6 跳到 28.3、漏洞利用基准 ExploitBench 翻倍以上,同时每任务输出 token 反而更少。这标志着前沿模型的迭代范式正在从「更大的基座」转向「更强的后训练管线」。本文拆解 GLM-5.3 的三条能力来源——环境合成管线、SAO 长程强化学习、slime 训练基础设施——并给出工程团队的迁移要点与判断边界。

一、一个参数没动的版本,凭什么算「新一代」

2026 年 8 月 14 日,智谱发布 GLM-5.3。官方技术报告(z.ai/blog/glm-5.3)的开篇没有任何参数规模的宣传,而是一句话:「Scaling post-training is all we did for GLM-5.3.」(我们为 GLM-5.3 所做的全部事情就是扩展后训练。) 报告随后明确:GLM-5.3 与 GLM-5.2 使用同一个基座模型(base model,即预训练完成后冻结的网络权重),所有能力提升都来自后训练——在冻结的基座之上,用更多的任务环境、更多样的任务和更大的算力继续训练。

先解释两个概念,后文会反复用到。 预训练pre-training)是让模型「读完互联网」获得通用能力的阶段,成本极高,通常以月计;后训练(post-training)是在预训练好的模型上做进一步调优,常见手段包括监督微调SFT)和强化学习(RL),目的是把通用能力塑造成特定场景的专长。过去两年,行业默认的升级路径是「更大的基座 + 更多预训练数据」;而 GLM-5.3 给出了另一条路径的证据:基座不动,只把后训练做到极致。

基座不动意味着什么? GLM-5.2 的基座是 744B 总参数、40B 激活参数的 MoE(混合专家)架构(智谱 GLM-5.2 发布资料口径;GLM-5.3 发布页未重述参数,仅声明同基座)。也就是说,GLM-5.3 的推理成本结构与 GLM-5.2 基本一致——同样的显存需求、同样的部署拓扑——但能力分布完全不同。对部署方来说,这是「免费的能力升级」;对研究者来说,这是一个罕见的对照实验:变量只有后训练,能力差异可以干净地归因。

这个对照实验的结果有多惊人,看官方基准表就知道。 GLM-5.3 相对 GLM-5.2 的提升集中在「长程任务」——需要模型连续工作数小时、跨多步依赖的复杂任务:

基准 GLM-5.2 GLM-5.3 提升幅度 说明
Terminal-Bench 3.0 4.6 28.3 约 6.2 倍 终端智能体长程任务,官方 harness avg@3
DeepSWE v1.1 46.2 66.9 +20.7 真实仓库软件工程任务(6h 时限)
Agents' Last Exam 23.8 28.5 +4.7 开源最强(官方口径)
AutomationBench v1.0.6 26.2 48.2 +22.0 工作流自动化任务
CyberGym 77.2 84.5 +7.3 白盒源码漏洞发现,全榜第一
ExploitBench 24.4 54.4 约 2.2 倍 真实漏洞利用链推理
ExploitGym(2h/6h) 29/39 105/130 约 3.4/3.3 倍 时间预算归一化的漏洞利用任务

但要诚实地读这张表。 在部分基准上,GLM-5.3 并不是全场第一:Terminal-Bench 3.0 上 GPT-5.6 Sol(34.6)与 Claude Fable 5(33.7)仍然领先;DeepSWE 上 Kimi K3(67.5)与 GPT-5.6 Sol(72.7)更高;漏洞利用链越往深处,与闭源前沿的差距越大(Mythos 5 在 ExploitGym 上完成 181/247 个任务,GPT-5.6 Sol 为 216/293)。GLM-5.3 真正的信号不在「全面登顶」,而在于:一个参数量不变的开源权重模型,仅靠一个月的后训练扩展,就在编码与网络安全两条线上逼近甚至在个别基准超过闭源前沿。 能力增长最快的位置,恰恰是此前落后最多的位置——官方报告自己也承认了这一点。

更值得注意的是效率的另一面:token 消耗。 在智谱内部的 Z.ai Code Bench 上,GLM-5.3 在 Max effort 档以约 75K 输出 token 达到 34.5% 的任务完成率,而 GLM-5.2 用 96K token 只有 23.4%;在 High effort 档,GLM-5.3 以约 50K token 达到 31.4%,超过 Claude Opus 4.8 的 29.5%(后者消耗 120K token)。能力提升的同时输出更短——这意味着后训练不仅改变了模型「会什么」,还改变了模型「怎么工作」:更少试错、更直接的执行路径。

图表加载中…

二、能力从哪来:当训练对象从「题目」变成「工作环境」

理解了「基座不动」这个前提,下一个问题是:后训练到底训练了什么? GLM-5.3 的答案是:训练对象不再是传统的题目和标准答案,而是「可执行、可验证、贴近真实专业工作」的任务环境——而且需要成千上万个这样的环境,不能靠人工一个个搭建。

官方报告给了一个具体例子,可以作为贯穿全文的场景。 假设有一个 ML 基础设施优化任务:模型拿到的不是题目描述,而是与真实工程师完全相同的工作环境——计算集群的访问权限、存储系统、内部文档、代码库、历史实验结果。它的任务是诊断训练栈各层的瓶颈、实现优化、运行实验,并在保证正确性的的前提下交付一个可测量的端到端加速。这类任务对一名经验丰富的工程师意味着数天的工作量。在这种环境里训练出来的模型,学到的是「端到端负责一块完整工作」,而不是「回答被切碎的子问题」。

这就引出了 GLM-5.3 后训练范式的核心判断:随着智能体能力提升,扩展后训练的难度正从模型侧转移到环境侧。 报告原文的说法是:一个有用的任务环境必须是可执行的(能真正跑起来)、可验证的(能判断成败)、贴近真实专业工作的——而且要很多,不能只有少数手工搭建的精品。

为了规模化生产这种环境,智谱搭建了一条端到端的环境合成管线,这是 GLM-5.3 最值得拆解的技术机制:

第一步,研究智能体(research agent)从真实工作中收集任务模式,把它们转化为可运行的长程环境。 这些环境带有真实工作的两个特征:多步依赖(后面的步骤依赖前面步骤的结果)和隐藏状态(环境里有模型看不到的内部状态,必须通过交互去探索)。

第二步,裁判智能体(judge agent)亲自尝试每个任务,验证它是真的可解的。 这一步防止合成出一堆无解或自相矛盾的环境污染训练。

第三步,合成验证器(verifier)。关键约束是:验证器在合成时看不到参考解答。 如果验证器知道标准答案,它就退化成「模式匹配」,模型可以学会绕开真实工作、直接猜验证器的判定逻辑——这就是强化学习里最危险的「奖励作弊」(reward hacking)。

第四步,用求解轨迹(solver trajectories)主动发现并封堵奖励捷径。 让一批模型去尝试作弊,发现验证器的漏洞后修补,直到验证器通过三项检查:oracle 检查(用参考解答跑,必须判对)、no-op 检查(什么都不做的空操作,必须判错)、unsolved 检查(未完成状态,必须判错)。通过三项检查的验证器才能产生「足够可靠、可以直接用于训练」的二值奖励信号。

这条管线的产出,配合从 GLM-5.2 继承的 SAO 强化学习策略(带上下文压缩机制,使长程任务的收益不会随轨迹变长而衰减),最终体现为:长程基准的大幅提升不仅没有以牺牲短任务为代价,反而同步发生。 官方也承认这条管线仍需要相当比例的人工介入(human-in-the-loop),让环境生成与验证更自主是下一步工作——这个诚实的免责声明值得记住,它是评估所有「环境规模化」叙事的校准点。

图表加载中…

三、slime:让「只改后训练」成为可能的底座

如果环境管线解决的是「训练什么」,那么下一层问题是「怎么训得起」。 长程强化学习的训练成本极高:一条轨迹可能跨越数小时、上千次工具调用,模型需要在真实环境(代码沙箱、终端、集群)里反复试错。GLM-5.3 的全部后训练跑在智谱开源的 slime 框架(github.com/THUDM/slime)上——训练侧用 Megatron,rollout 侧(让模型与环境交互产生训练数据的一侧)用 SGLang

slime 的设计核心是一句话:训练、rollout、数据缓冲在同一条数据流上。 数学题、代码任务、沙箱环境、验证器、长程智能体环境——所有这些东西都作为「数据生成」接入这条数据流,而不是修改训练循环本身。官方报告点明了这个设计的价值:正是它让智谱能在 GLM-5.2GLM-5.3 之间不断添加新环境,而不需要每次重建训练栈。 这是「基座冻结、后训练扩展」范式能够按月迭代的工程前提——如果每加一类任务都要重写训练系统,一个月的迭代周期根本不存在。

GLM-5.3 周期里,slime 在两个方向继续扩建,这两个方向对做 RL 基础设施的团队都有参考价值:

算法侧:训练与推理的一致性。 强化学习有一个经典陷阱:训练时的模型和生成轨迹的模型如果在数值上不一致(不同的推理引擎、不同的采样实现),训练信号就会失真。slime 加入了 top-p mask、top-k 与全词表 OPD(on-policy distillation,在策略蒸馏),以及让训练路径与 rollout 路径完全数值对齐的配置。官方给出的数字是:训练与 rollout 的对数概率(logprob)平均差异控制在 1e-7 量级,比此前的设置降低了 99.99% 以上。这个指标听起来枯燥,但它决定了你能不能在长轨迹上做可靠的信用分配——轨迹越长,数值不一致的误差累积越致命。

系统侧:把 RL 训练吞吐提上去。 三个具体手段:其一,用本地存储作为额外缓存层,分层存放模型状态和数据,原本这些只能占用主机内存;这一点对多教师 OPD 尤其重要——动态切换教师模型加预取,多个教师不需要各自常驻一个推理服务。其二,改进 router 与 slime 之间的联合调度与负载均衡,让长度和完成时间差异巨大的 rollout 请求更充分地利用推理资源。其三,加入负载感知启发式:根据每个 rollout 环境的特征,自动推导面向吞吐的配置——prefill/decode 资源比例、并发度等。官方口径:这些系统级优化让长程编码 RL 任务的端到端训练吞吐提升了 2.3 倍以上。

把这三层拼起来,GLM-5.3 的「纯后训练」叙事才完整:环境管线提供训练对象,SAO 提供训练算法,slime 提供训练吞吐。 三者中任何一个跟不上,「一个月、不碰基座、能力跃升」都不成立。这也解释了为什么这条路径难以被简单复制——它不是某个单点技巧,而是一整套已经跑通两个版本的基础设施积累(GLM-5.2 周期建立的 IndexShare 长上下文处理、SAO 长程 RL、slime 异步训练,在 5.3 周期全部复用并扩展)。

组件在 GLM-5.3 中的作用可复用的工程经验

训练对象

环境合成管线

批量生产可执行、可验证的长程任务环境

验证器不看参考解答 + 三项检查封堵奖励作弊

训练算法

SAO + 上下文压缩

长程任务的强化学习策略,收益不随轨迹变长衰减

长轨迹场景优先验证「短任务是否同步受益」

训练基础设施

slime(Megatron + SGLang)

环境作为数据生成接入,不改训练循环

训练-rollout 数值对齐(logprob 差 1e-7)

系统优化

负载感知调度 + 本地缓存层

长程编码 RL 端到端吞吐提升 2.3 倍以上

按 rollout 环境特征推导 prefill/decode 比例

继承资产

IndexShare(arXiv:2603.12201)

1M 长上下文的高效处理

基座周期的基础设施投资在后训练周期复利

四、意料之外的收获:漏洞利用能力沿攻击链涌现

GLM-5.3 发布中最出乎官方意料的部分,是网络安全能力。 报告的原话是:他们在后训练数据里加入了漏洞发现的数据和环境,预期是模型「更擅长发现和推理漏洞」;意外的是,随着训练规模扩大,这种能力的发展速度超出预期——GLM-5.3 不再只是识别孤立的缺陷,而是开始在漏洞利用的多个阶段之间推理,为完整的利用链(exploitation chain)形成连贯的计划。

三个基准覆盖了漏洞分析的不同阶段,放在一起看能看出清晰的模式:

CyberGym(漏洞发现):GLM-5.3 得 84.5%,从 GLM-5.2 的 77.2% 提升,是全榜第一——领先 Mythos 5(83.8%)和 GPT-5.6 Sol(83.6%)。这个基准从白盒源码出发,要求模型不仅找到漏洞,还要通过触发故障来验证漏洞真实存在。

ExploitBench(利用链推理):GLM-5.3 得 54.4%,是 GLM-5.2(24.4%)的两倍多。 但在这个更深的基准上,Mythos 5(78.0%)和 GPT-5.6 Sol(76.5%)仍大幅领先。

ExploitGym(限时利用任务):按各模型的推理速度归一化时间预算后,GLM-5.3 在 2 小时预算内完成 105 个任务、6 小时内完成 130 个,而 GLM-5.2 只有 29 和 39。 同样,Mythos 5(181/247)和 GPT-5.6 Sol(216/293)保持领先。

官方总结的模式值得逐字读:基准所处的利用链位置越靠后,GLM-5.2GLM-5.3 的增益越大——同时与闭源前沿的剩余差距也越大。「能力增长最快的地方,恰恰是我们落后最多的地方。」 这句话既是技术观察,也是风险信号:攻击链后段(从单点漏洞到完整入侵)的能力正在加速扩散,而防御方对这段能力的理解最不充分。

比基准更有信息量的是真实世界的验证。GLM-5.2 以来,智谱与国内多个安全团队合作,让模型对抗真实代码库。经人工评审、筛查和去重后,模型共识别出 2,436 个漏洞,分布在 269 个项目中,其中 1,097 个为中高严重级别——覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web 应用和网络协议。许多漏洞存在了数年甚至数十年,最老的一个可追溯约 40 年(1981 年引入)。

这些发现已经制度化为一个持续运作的披露流程。 智谱建立了公开的 Z.ai Security Disclosure Ledger(cvd.z.ai):截至发布,账本追踪 2,436 个发现,其中 53 个已公开披露、2,383 个处于披露禁运期;对已披露的问题记录受影响项目、严重级别、CVE 编号(如有)以及该漏洞在代码库中潜伏的时长。账本数据显示,被发现的漏洞平均存活 26.6 年才被发现。这是目前公开可见的、规模最大的「LLM 系统性挖洞」实证之一,也是评估开源模型安全影响时绕不开的参照。

图表加载中…

五、工程团队的行动点:一个破坏性迁移和一个效率红利

对已经在用 GLM 系列 API 的团队,GLM-5.3 带来一个必须立即处理的破坏性变更和一个可以直接拿走的效率红利。

破坏性变更:不再支持关闭 thinking。 GLM-5.3 只支持三档推理强度——low(轻度)、high(增强)、max(深度,官方建议编码任务使用),默认 maxthinking.type: "disabled" 不再被接受。如果你的现有代码里写着 thinking.type: "disabled",直接把 model ID 换成 glm-5.3 会让请求失败。 官方给出的迁移顺序很明确:先把 thinking.type 改为 enabled 并设置 reasoning_effort: "low",验证通过后再切换 model ID。注意这个顺序的含义——先用最低推理强度对齐行为,再换模型,避免两个变量同时变化导致难以归因的质量波动。

迁移请求体示例:

图表加载中…

效率红利:同样的任务更少的 token 如果你的计费按输出 token 计算(GLM Coding Plan 已改为积分制,输入、缓存输入、输出分别计费;工作日 14:00–18:00 北京时间之外的时段消耗 50% 积分),GLM-5.3 的 token 效率提升意味着实际账单可能不升反降——官方数据是 Max effort 下 75K token 对旧版 96K,同时完成率高出 11 个百分点。对跑长程编码智能体的团队,「完成率上升 + 单任务 token 下降」是双重成本改善,值得在自己的真实任务集上复测确认,而不是只信官方基准。

权重状态是自部署团队的硬约束。 官方承诺发布后两周内公开权重(需先完成安全评估与加固),在此之前 GLM-5.3 只能通过 API 与订阅渠道使用。如果合规要求私有化部署,当前的选项仍是等待权重或退回 GLM-5.2/其他已开放权重的模型。

迁移决策可以按下面的流程走:

json
glm-5.3-migration.json
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

六、判断与边界:这个范式能走多远

GLM-5.3 给出的最强信号不是某个基准分数,而是一个范式事实:前沿能力的下一段增长,可以来自后训练管线的深度,而不必来自基座的宽度。 这对不同角色意味着不同的事。

对模型厂商: 「基座冻结 + 后训练扩展」把迭代周期从「季度级」压到「月度级」——GLM-5.2GLM-5.3 的核心增量只用了约一个月。但这条路径的瓶颈也随之转移:从算力预训练的主要约束)转移到环境供给(可执行、可验证、贴近真实工作的任务环境的数量与质量)。智谱自己承认环境管线仍需要大量人工介入——谁先把环境生成做得更自主,谁就握住下一段加速度。

对应用团队: 两个实操结论。其一,模型升级的行为变化可能比能力变化更值得关注——GLM-5.3 强制开启 thinking、改变 token 消耗结构,这类「工作方式」的变化会直接冲击现有的 prompt、超时设置和成本模型,迁移必须按变量隔离的方式做。其二,「开源权重 + API 先行」正在成为中国厂商的标准发布形态:能力先到 API,权重滞后两周以上且附带安全评估——自部署规划要把这个时滞算进去。

对安全领域: 这是首个由模型厂商系统化公开披露的「LLM 挖洞」规模数据(2,436 个漏洞、269 个项目、最老约 40 年)。它同时是两个信号:防御方第一次有了可规模化的存量漏洞清查工具;攻击链后段的能力扩散速度也在加快,且增长最快的正是防御理解最薄弱的区段。公开的披露账本(cvd.z.ai)是罕见的负责任实践,但 2,383 个禁运中的漏洞也提醒我们:这批能力的净安全效应取决于披露节奏能否持续跑赢能力扩散。

最后是这个叙事的边界,读任何「后训练奇迹」时都该带着:

  • 基座相同不等于成本相同。 GLM-5.3 的后训练消耗了多大的环境生产与 RL 算力,官方没有披露;「没有重新预训练」不等于「便宜的升级」。
  • 官方基准的 harness 效应。 Terminal-Bench 3.0 用 Claude Code 2.1.207 harness、avg@3、每任务 600 轮上限;不同 harness 下分数不可直接横比,官方脚注也逐项列出了各基准的评测配置差异。
  • 私有基准的校准价值与利益相关性。 Z.ai Code Bench 是内部基准,官方说它的优势是减少公开测试集污染——这个论点成立,但它同样是厂商自报的数字。
  • 「环境规模化」的可复制性未经验证。 环境合成管线的细节披露是定性的;第三方能否复现同等质量的环境供给,目前没有任何公开证据。

一句话总结 GLM-5.3 的位置:它不是「最强的模型」,而是「后训练范式」迄今最完整的一次公开论证——论证了能力可以从哪来、基础设施要怎么配、以及能力涌现会先在哪里失控。

参考资料

🎯 相关面试题

结合本篇技术观点,备战 AI 岗位面试。