GLM 5.3:直观解读后训练扩展
GLM-5.3 不重新预训练,仅靠扩展后训练计算、精心设计环境与高效基础设施,在相同基础模型上实现超 50% 性能提升,证明 RL 是迭代基础模型的有效途径。

萨顿的苦涩教训指出,那些随计算规模扩展而胜出的通用方法终将获胜。GLM-5.3正是这一法则在强化学习中的完美应用,它意味着一个模型无需重新预训练即可超越其前代:一个完全相同的基础模型(GLM-5.2)通过扩展的后训练计算、精心设计的环境以及高效的基础设施工程,实现了超过50%的性能提升。
在这篇文章中,我们将探讨环境设计如何催生了GLM-5.3。接着,我们会看看GLM 5.2背后的架构如何延续下来,以支持高效的训练和推理。最后,我们将介绍RL算法和基础设施,特别是SAO和slime,它们如何将这些廉价的rollout转化为稳定、大规模的后训练过程。
环境设计
GLM 5.3后训练工作的核心在于逼真的环境设计: 创建那些反映专家工作而非leetcode式问题的任务。例如,ML基础设施问题模仿人类工程师会解决的难题。模型被赋予与人类工程师相同的资源,包括计算集群、存储和文档的访问权限。问题在于识别训练栈中的瓶颈,然后通过运行实验、迭代优化加速效果,同时保持正确性来优化它们。
环境生成也是智能体优先的。 研究智能体将真实工作流程中的任务模式转化为可运行的、长时程环境(即智能体必须通过多步骤完成的任务设置)。随后,一个评判智能体会检查每个环境是否可解,以确保不会引入不良的训练信号。此外,每个环境都会自动生成一个验证器,而该验证器无法访问参考解决方案。

为了防止奖励黑客行为(在强化学习中很常见),团队还利用求解器轨迹来堵住奖励捷径和琐碎解法的漏洞。每个验证器在使用前都要经过测试,必须通过三项检查:面对已知正确解法时,它给予奖励(即“神谕检查”);面对智能体未采取任何行动的运行过程时,它不给奖励;面对任务未完成的运行过程时,它也不给奖励。只有奖励正确且完整解决方案的验证器,才能让训练信号值得信赖。简而言之,这一流程以高数量和高品质生成合成环境,这对后训练的成功至关重要。
解析 GLM 5.2 与 5.3 的架构

GLM-5.3 的架构完全沿袭自 GLM 5.2,后者采用了混合专家(MoE)架构:总参数量达 7440 亿,但每个 token 仅激活约 400 亿参数。每个 MoE 层包含 256 个专家,每个 token 只路由到 8 个专家,因此你既能获得庞大模型的推理能力,又能以较低的计算成本运行。
多头潜在注意力:缩减 KV 缓存
什么是 KV(键值)缓存? “键”帮助模型确定应关注哪些词,而“值”则根据上下文决定哪些信息被添加到词义中。它们被统称为“KV 缓存”,这样模型就不必为每个新词元重新计算它们。在标准的多头注意力机制中,每个头都为每个词元保留其独特的 KV 对。
多头潜在注意力(MLA) 将每个词元的键和值压缩成一个小的共享潜在向量(每个词元、每层一个),并且只有这个潜在向量被存储在 KV 缓存中。在计算注意力时,轻量级的投影矩阵从潜在向量中重建(上投影)每个头的键和值。这缩小了 KV 缓存,随着上下文增长保持低内存使用,并支持更长的上下文窗口而不牺牲质量。
DeepSeek 稀疏注意力:提升注意力效率
DeepSeek 稀疏注意力(DSA)有两个主要组成部分。首先,一个微小的闪电索引器对所有过去的词元进行评分,以确定它们与当前查询词元的相关性。然后,一个词元选择器挑选出前 k 个过去的词元供 MLA 处理。索引器和选择器都是经过学习的。它们共同创建了一个注意力掩码,过滤掉不太相关的词元。
运行大型语言模型的最大瓶颈之一是,多头注意力是一种二次方操作,即 O(N^2)。然而,由于闪电索引器使用 FP8 且头数较少,其名义上的二次方成本远低于因不对整个上下文执行完整 MLA 而节省的开销。在预填充阶段,每个词元的端到端成本在 128k 上下几乎持平,而在解码阶段仅随 k 线性增长,约为 O(N*k),其中 k<<N。这使得长推理链变得经济实惠。我们在去年 DSV3.2 发布 中解释过这一架构。
多令牌预测:高接受率的推测解码
MTP是推测解码的一种形式。推测解码是一种通过使用较小、更快的草稿模型并行预测多个令牌来加速LLM推理的技术,随后由更大、更准确的LLM进行验证。如果目标模型自行生成这些令牌,则必须逐个顺序生成。
GLM 5.2采用MTP的不同方法。它不依赖单独的草稿模型,而是在主模型之上增加了一个轻量级的MTP层。该MTP层是一个变压器块,其权重在每次草稿步骤(每个草稿令牌对应一步)中重复使用。在推理时,该层接收主模型的最终隐藏状态(编码了完整上下文)以及刚采样令牌的嵌入。但由于MTP层是变压器块,其注意力机制仍需回顾整个上下文(仅一个摘要向量是不够的)。
它不自行计算上下文的键和值,而是复用主模型的KV缓存和稀疏注意力索引。GLM 5.3的MTP相比EAGLE等其他方法,能实现更高的草稿接受率。它顺序草拟最多5个后续令牌,主模型在一次并行前向传递中验证这些令牌,平均每次传递接受约4.5个令牌。这优于使用单独草稿模型的经典推测解码,因为MTP利用了目标模型的表示,且草拟成本仅为一个额外的小层,而非整个第二模型。
IndexShare:基于DSA的构建
IndexShare修复了DSA闪电索引器的一个缺陷。闪电索引器为每个查询挑选前k个令牌进行关注,因为只有一小部分过去的令牌是重要的。然而,为了选择最相关的令牌,索引器必须扫描每一层的每个令牌,这在200k上下文时消耗了约81%的预填充时间。尽管注意力计算已变得更便宜,但扫描时间呈二次方增长,这在长序列长度下成为问题。
然而,在相邻层之间,索引器选择的令牌有70-100%重叠,导致重复工作。IndexShare缓存这些计算,并创建共享层和完整层。在每组四个稀疏注意力层中,该组的第一层运行闪电索引器并挑选要关注的前k个令牌索引。第2至4层复用这些相同的索引,而不是重新计算。在1M上下文时,索引器主导计算,因此从每四层中移除三层可将每令牌的FLOPs减少2.9倍。因此,与DSA相比,1.82倍的预填充加速和1.48倍解码加速使每次滚动*更便宜,这直接转化为在固定计算预算下生成更多滚动。
滚动:模型在强化学习期间生成的一个完整样本输出。
强化学习算法与基础设施
带压缩的SAO
SAO(单次采样异步优化)可视为解决异步强化学习中不稳定问题的一种方法,这也是GRPO变体普遍面临的难题。智能体任务具有可变的采样长度,若等待一批样本全部完成后再进行更新,将导致计算资源的浪费。然而,异步更新通常会引起策略滞后、离策略轨迹以及崩溃等问题。SAO的设计(单次采样、实用的价值模型训练以及令牌级裁剪)解决了这些难题,从而实现了稳定的长时程强化学习训练。
但稳定的训练只有在轨迹能够变长的情况下才有意义,而轨迹通常受限于上下文窗口。压缩机制消除了这一上限:当轨迹超出窗口时,历史内容会被总结,模型从总结处继续生成。两者结合,SAO保证了训练的稳定性,而压缩则支持了长时程的强化学习。
slime
slime 是GLM模型背后的强化学习后训练框架,它将SGLang用于快速生成采样,并与NVIDIA的Megatron高效结合进行训练。
SGLang(用于生成)
在强化学习过程中,模型需要生成数百万条样本输出(即采样),以便对其进行评分和学习。生成采样属于推理过程,而SGLang正是为优化推理而设计的:它通过连续批处理(GPU同时处理所有活跃请求)、高效的KV缓存管理(在共享提示前缀间复用计算)以及优化的解码内核(定制的GPU操作,使每个令牌生成步骤更快)来最大化每秒令牌数。
Megatron(用于训练)
一旦 rollout 完成评分,你需要计算梯度并更新模型权重。对于拥有数千亿参数的模型,单个 GPU 无法容纳整个模型,长序列的激活值也无法容纳。Megatron 通过将模型和输入序列拆分到多个 GPU 上来解决这一问题:
- 张量并行:单个层被切分到多个 GPU 上
- 流水线并行:不同层分布在不同的 GPU 上
- 专家并行:对于 MoE 模型,不同的专家分布在不同的 GPU 上
- 上下文并行(CP):长序列被切分成多个块,分布在多个 GPU 上
SGLang 和 Megatron 在训练与推理场景下,以完全不同的布局存储模型权重。
slime 的核心职责是协调两者之间的循环:
- SGLang 使用当前模型生成一批 rollout
- 对 rollout 进行评分(奖励)
- Megatron 基于这些数据进行训练,并生成更新后的权重
- slime 将这些新权重转换并传输回 SGLang
- 循环重复进行,此时生成过程使用改进后的模型
slime 在 GLM 5.3 中的新特性
多教师在线策略蒸馏(OPD)
OPD(在线策略蒸馏): 学生模型生成答案,而更强的教师模型逐 token 进行评分。这就像教师在说:“这是我为你写的每个 token 分配的概率。”学生被训练以匹配教师的逐 token 概率分布。之所以称为“在线策略”,是因为训练数据来自学生自身的输出。
多教师: 不是使用单一教师,而是使用多个,因为没有任何单一模型在所有方面都是最佳教师。一个编码模型评估学生的代码,一个数学模型评估其数学,一个推理模型评估其推理。每个教师在其最强领域提供信号。
动态教师切换与预取
通常,在 OPD 中,每个教师都需要独立的 GPU 部署。由于 OPD 训练一次只需一个教师,因此大多数 GPU 在任意时刻都可能处于空闲状态。相反,只有当前活跃的教师被加载到 GPU 上;其余教师则保存在本地存储中,而不是占用主机内存。下一个教师的权重会在后台提前加载,从而将切换教师的延迟降至最低。
路由器与 slime 之间的联合调度与负载均衡
不同长度/完成时间的 rollout 请求会被分配到各个 GPU 上,以避免 GPU 闲置。例如,如果你将一批 rollout 分配给多个 GPU,且它们在不同时间结束,那么释放出的容量就会闲置。但通过路由器与 slime 的联合调度,一旦容量释放,调度器会立即将其路由到队列中的新请求。
要点总结
GLM 5.3 的性能提升源于扩展后训练阶段,我们直观地解释了每个部分的工作原理。IndexShare 让每次生成更经济高效。SAO 使强化学习能够教授长周期行为。slime 的多教师 OPD 升级优化了 GPU 使用率,从每个 GPU 小时中提取更多训练信号。强化学习现已被证明是在不进行新预训练的情况下迭代前代基础模型的有效途径,而像这样的开源模型发布恰好展示了具体实现方式。
合著者:@chloey3k