文章摘要
同一个开源基础模型(如 Llama 3 70B),不改架构、不加参数,有的团队靠后训练做到了接近前沿的编码和 Agent 能力,有的团队却始终停留在「能用但不好用」的水平。差距不在模型本身,而在后训练的系统性扩展方法。本文拆解后训练扩展的核心方法论:如何在 SFT、偏好对齐、强化学习、测试时计算四个维度做资源分配,环境合成管线如何突破数据瓶颈,以及如何判断每一阶段的扩展是否已经到达收益递减点。
1同一个基础模型,为什么后训练能拉开十倍差距?
想象一个真实场景:你的团队拿到了 Llama 3 70B 的开源权重,想在特定领域(比如企业级代码生成或网络安全分析)做到接近 GPT-4 级别的水平。预算有限,不可能重新预训练。你能做的只有后训练——在已有基础模型上,通过微调、对齐和强化学习来提升能力。
两年前的答案可能是「做不到」。但 2025-2026 年的实践彻底改变了这个判断。DeepSeek 用 V3 基础模型通过 840B tokens 的持续预训练加系统性后训练,在 Agent 能力上实现了代际跃迁(据 DeepSeek V3.1 发布公告,V3.1 在 SWE-Bench 和 Terminal-Bench 上的表现相比 V3 有显著提升)。智谱的 GLM-5.3 同样在不改变基础架构的前提下,通过后训练扩展在编码场景中逼近前沿水平(据 z.ai 官方博客)。
核心洞察是:后训练不是「微调一下就行」的简单步骤,而是一个可以系统性扩展的工程体系。 就像预训练有 Scaling Laws(参见本站 Scaling Laws 全景)来指导算力-数据-参数的最优分配,后训练也有自己的扩展规律——只是这些规律更复杂,因为它涉及多个阶段的资源协调。
MBZUAI 的 Komal Kumar 等人在 2025 年发表的综述论文 "LLM Post-Training: A Deep Dive into Reasoning Large Language Models" 系统梳理了后训练方法的全景,指出后训练的核心挑战包括灾难性遗忘(catastrophic forgetting,新训练覆盖了预训练知识)、奖励劫持(reward hacking,模型学会欺骗奖励信号而非真正提升能力)以及推理时的计算-效果权衡。这些挑战的应对方法,构成了后训练扩展工程的核心内容。
本文的目标读者是了解 pre-training 和 fine-tuning 基本概念、但不是后训练专家的技术从业者。读完本文你应该能够:评估自己的模型是否值得做后训练扩展;在 SFT、偏好对齐、强化学习和测试时计算四个维度做出资源分配决策;判断环境合成管线的投入产出比;识别每个阶段的收益递减信号。
💡 一句话理解
后训练扩展的核心问题不是「怎么做」,而是「做多少」。每个阶段都有收益递减点,超过这个点继续投入不如把资源转到下一个阶段。
2后训练扩展的四个维度:每个维度在扩展什么?
后训练扩展不是在某个阶段「做更多」,而是在四个维度上分别做系统性投入。每个维度解决不同的问题,有自己的扩展规律和收益递减信号。
维度一:SFT 扩展——扩展的是「能力覆盖面」
SFT(Supervised Fine-Tuning,监督微调)阶段用高质量的「指令-回复」对训练模型。SFT 扩展要回答的问题是:需要多少数据、覆盖多少能力维度,才能让模型在目标领域「什么都会」?
直觉上,数据越多越好。但实践表明,SFT 阶段存在明显的质量门槛和数量天花板。Hugging Face 的 RLHF 教程指出,1000 条高质量、多样化的指令数据往往超过 10000 条低质量数据的效果。扩展的关键不是堆数量,而是扩大能力覆盖面——确保训练数据覆盖了目标领域的所有典型场景。
收益递减信号:当新增数据对应的能力维度已经被现有数据覆盖时,继续添加同类数据几乎不会带来提升。判断方法是监控测试集上各维度的通过率——如果某个维度的通过率已经稳定在 90% 以上,该维度的 SFT 数据已经足够。
维度二:偏好对齐扩展——扩展的是「质量判断力」
SFT 教会模型「如何回答」,偏好对齐教会模型「什么是好回答」。这个阶段使用 DPO(Direct Preference Optimization,直接偏好优化)或 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)来优化模型的输出质量。
偏好对齐扩展的核心挑战是偏好数据的质量和多样性。DPO 的优势在于不需要单独训练奖励模型——它直接从偏好对(chosen vs rejected)优化策略,简化了训练流程。据 Karumi 2025-2026 行业分析,OpenAI、Meta、Google、Anthropic 等前沿实验室已全面采用 DPO 或其变体作为对齐阶段的标准方法。
收益递减信号:当模型在「人类评估盲测」中的胜率不再提升(比如稳定在 70% 左右),或者不同评估者之间的一致性开始低于模型间差异时,偏好对齐的扩展已经接近天花板。
维度三:强化学习扩展——扩展的是「策略优化深度」
如果说偏好对齐是让模型学会「什么是好的」,强化学习(RL)是让模型学会「如何做到好的」。在可验证奖励(Verifiable Rewards)的场景中——比如数学推理和代码生成——RL 可以用确定性验证器直接优化模型的输出策略。
DeepSeek-R1 的成功是这个维度的标志性案例。据 DeepSeek-R1 论文,GRPO(Group Relative Policy Optimization,组内相对策略优化)算法配合规则奖励,在数学推理(AIME 2024 得分 79.8%)和代码生成(LiveCodeBench 得分 65.9%)上达到了 OpenAI o1 水平。GRPO 的关键创新是不需要价值网络(value network),而是在同一 prompt 的多个输出之间做相对比较,大幅降低了训练成本。
收益递减信号:当验证集上的通过率曲线开始变平(比如数学推理从 70% 提升到 75% 需要的训练步数是 50% 到 70% 的三倍),说明 RL 扩展正在接近当前环境和奖励设计的极限。
维度四:测试时计算扩展——扩展的是「推理预算」
TTC(Test-Time Compute,测试时计算)是 2024-2026 年最重要的后训练扩展维度。它的核心思想是:在推理时投入更多计算,让模型「多想一会儿」来提高准确率。
DeepSeek-V3.1 是 TTC 扩展的典型实践。据 DeepSeek V3.1 发布公告,V3.1 引入了混合推理模式(Think & Non-Think),同一个模型可以在「快速回答」和「深度思考」之间切换。在需要复杂推理的场景中,模型会生成内部推理链(chain-of-thought),投入更多 token 来提高准确率。
TTC 扩展的工程挑战不是「让模型想更久」,而是「如何判断什么时候该想更久」。过度思考简单问题浪费算力,不够思考复杂问题损失准确率。这需要一个路由机制来动态分配推理预算。
| 维度 | 扩展什么 | 核心方法 | 收益递减信号 | 典型扩展上限 |
|---|---|---|---|---|
SFT 扩展 | 能力覆盖面 | 高质量指令数据 + 领域覆盖 | 新数据对应维度已覆盖 | 数万条高质量数据 |
偏好对齐扩展 | 质量判断力 | DPO/RLHF 偏好对 | 盲测胜率不再提升 | 数万偏好对 |
RL 扩展 | 策略优化深度 | GRPO/RLVR + 验证器 | 通过率曲线变平 | 取决于环境复杂度 |
TTC 扩展 | 推理预算 | 混合推理 + 动态路由 | 简单问题过度思考 | 推理 token 预算 |
3环境合成管线:后训练扩展的数据引擎
后训练扩展的最大瓶颈不是算法,而是数据。SFT 需要高质量指令数据,偏好对齐需要偏好对,RL 需要可验证的奖励环境。人工标注的成本和速度根本无法满足扩展需求。
环境合成管线(Environment Synthesis Pipeline) 是解决这个瓶颈的工程方案。它的核心思想是:用模型本身来生成训练数据,再用确定性验证器或更强的模型来筛选和验证。
环境合成管线的工作流程分为三步:
第一步:任务空间采样。定义目标领域的所有可能任务类型(比如代码生成中的字符串处理、算法设计、API 调用、调试等),然后系统性地生成覆盖整个任务空间的训练样本。这一步的关键是「覆盖面」——不是随机生成,而是确保每个子领域都有足够的代表。
第二步:输出生成与验证。用当前模型(或更强的模型)对生成的任务做推理,产出候选回复。然后用确定性验证器(代码执行、单元测试、数学答案比对)或更强的评判模型来筛选高质量输出。通过验证的成为 SFT 数据,成对的(好/坏)输出成为 DPO 数据。
第三步:环境构建。对于 RL 阶段,需要构建可交互的训练环境。比如代码生成 RL 需要一个能执行代码并返回测试结果的沙箱;Agent 训练需要一个能模拟用户反馈和环境响应的模拟器。
DeepSeek 的实践是这个方法的规模化验证。据 DeepSeek V3.1 发布公告,V3.1 的后训练在工具调用和多步 Agent 任务上有显著提升——这种提升的背后是大规模的环境合成管线在持续供给训练数据。
环境合成管线的投入产出比取决于三个因素:
- 验证器的确定性程度。代码和数学有完美的验证器(执行结果对/错),环境合成的效率最高。开放式任务(写作、分析)的验证器本身是模型,引入额外噪声。
- 任务空间的结构化程度。越容易定义子领域和难度的领域,采样越高效。
- 当前模型的能力水平。模型太弱时,生成的数据质量不够训练用;模型太强时,生成的数据太简单没有训练价值。环境合成在模型「中等水平」时效率最高。
4资源分配决策:先扩展哪个维度?
四个维度的扩展不是同时进行的——资源有限,必须决定优先级。错误的优先级会导致大量资源浪费在收益递减的阶段。
通用策略:按阶段顺序扩展,每个阶段到达收益递减点后再进入下一个。
这个策略的逻辑是:每个后续阶段都依赖前一个阶段的基础。SFT 建立的能力覆盖面是偏好对齐的前提——如果模型连基本的指令跟随都做不到,偏好对齐无法教它「什么是好回答」。同样,RL 需要偏好对齐建立的「质量判断力」作为起点——没有这个基础,RL 的策略优化会在低质量空间中盲目探索。
具体的资源分配决策树:
情况一:模型连基本指令都跟不上。先做 SFT 扩展。目标是让模型在目标领域的核心任务上达到 80% 以上的基线通过率。这个阶段通常需要数千到数万条高质量指令数据,训练 2-5 个 epoch。
情况二:模型能跟上指令,但输出质量不稳定。做偏好对齐扩展。用 DPO 训练模型区分「好回答」和「差回答」。这个阶段需要数千到数万条偏好对。
情况三:模型输出质量稳定,但在复杂推理上遇到天花板。做 RL 扩展。用 GRPO 或 RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)在可验证任务上深度优化策略。
情况四:模型已经很强,但需要在特定场景做到极致。做 TTC 扩展。投入推理时计算,用混合推理模式和动态路由来提升关键场景的准确率。
一个常见的错误是在 SFT 阶段投入过多。很多团队会花几个月时间收集和标注海量 SFT 数据,但实际上 SFT 的收益递减来得很快。据 MBZUAI 综述论文,SFT 阶段的主要风险是灾难性遗忘——过度 SFT 会覆盖预训练积累的广泛知识。更好的策略是:SFT 做到「够用」就停,把更多资源留给偏好对齐和 RL。
5收益递减的识别与应对:什么时候该停止扩展?
后训练扩展最大的浪费不是「做错了」,而是「做过头了」。每个维度都有收益递减点,超过这个点后继续投入的资源几乎不会产生有价值的提升。
识别收益递减的通用方法:监控「每单位投入的提升量」。
具体来说,记录每个训练阶段的投入(数据量、计算量、时间)和对应的产出(测试集通过率、人类评估胜率、基准分数)。当「产出提升 / 投入增加」的比值开始显著下降时,就接近了收益递减点。
各维度的具体信号:
SFT 维度:新增 1000 条数据带来的测试集提升从 5% 降到 0.5% 以下。或者,某个能力维度的通过率已经稳定在 90% 以上,新增数据只是重复覆盖已有能力。
偏好对齐维度:人类评估盲测胜率连续三轮训练不再提升(比如稳定在 65-70%)。或者,不同评估者之间的一致性(inter-annotator agreement)开始低于模型间的差异——这意味着偏好信号本身的噪声已经超过了模型能学到的信号。
RL 维度:验证集通过率的提升速度显著下降。比如从 50% 到 70% 用了 1000 步,但从 70% 到 75% 需要 5000 步。这通常意味着当前的奖励设计和环境复杂度已经不足以支撑进一步提升。
TTC 维度:简单问题的推理 token 使用量开始增加但准确率不再提升。这意味着路由机制没有正确区分简单和复杂问题,需要优化路由策略而不是增加推理预算。
应对收益递减的方法:
- 转向下一个维度。SFT 收益递减时转向偏好对齐,偏好对齐收益递减时转向 RL。这是最自然的策略。
- 提升数据质量而非数量。收益递减往往意味着数据质量到了天花板。投入更好的验证器、更精细的任务采样,比堆更多数据更有效。
- 重新定义任务空间。如果当前任务空间的扩展已经饱和,可能需要扩大任务空间的范围——比如从纯代码生成扩展到代码审查、调试、重构等更广泛的场景。
62026 年的实践格局:从 DeepSeek 到 GLM 的方法论收敛
2025-2026 年,多个团队的后训练实践正在收敛到相似的方法论框架。这些实践验证了后训练扩展工程的可行性,也揭示了当前的局限。
DeepSeek 的迭代路径是后训练扩展的典型案例。从 V3 到 V3.1 到 V4-Flash,DeepSeek 在不改变基础架构(671B MoE)的前提下,通过持续的后训练扩展实现了能力的代际跃迁。据 DeepSeek V3.1 发布公告,V3.1 在 V3 基础上用 840B tokens 做持续预训练扩展长上下文,然后通过系统性的后训练在工具调用和多步 Agent 任务上取得显著提升。V3.1 引入的混合推理模式(Think & Non-Think)是 TTC 扩展的工程实现——同一个模型可以在快速回答和深度思考之间动态切换。
智谱 GLM 的路径同样体现了后训练扩展的方法论。据 z.ai 官方博客,GLM-5.3 在编码场景中的提升主要来自后训练阶段的系统性扩展,而非基础架构的变化。
方法论收敛的几个关键点:
- DPO 成为偏好对齐的标准方法。多个团队的实践表明,DPO 在效果上接近甚至超过传统 RLHF,同时训练流程更简单、更稳定。
- GRPO 成为推理任务 RL 的首选算法。GRPO 不需要价值网络,在同 prompt 多输出之间做相对比较,大幅降低了训练成本。
- TTC 成为「最后一公里」的标准方案。当模型已经很强但需要在特定场景做到极致时,投入推理时计算是最有效的策略。
- 环境合成管线成为数据供给的基础设施。所有前沿团队都在大规模使用模型生成 + 验证器筛选的数据生产方式。
当前的局限:
7实操检查清单:你的后训练扩展决策是否合理?
最后,给出一份实操检查清单。如果你的团队正在做或计划做后训练扩展,用这些问题检验决策的合理性。
基础判断:
- □ 基础模型是否已经通过预训练获得了足够的领域知识?后训练扩展的是「如何调用知识」,不是「知识本身」。如果基础模型在目标领域几乎没有预训练知识,后训练扩展的效果会很有限。
- □ 是否有明确的评估基准?没有评估就无法判断收益递减点。
SFT 阶段:
- □ 训练数据是否覆盖了目标领域的所有核心能力维度?
- □ 数据质量是否经过人工审核?1000 条高质量数据 > 10000 条低质量数据。
- □ 是否监控了灾难性遗忘?用预训练时期的通用基准测试检查是否丢失了基础能力。
偏好对齐阶段:
RL 阶段:
- □ 是否有确定性的验证器?没有验证器就无法做 RLVR。
- □ 奖励设计是否避免了捷径?模型是否可能通过「欺骗」获得高分而非真正提升能力?
- □ 是否监控了通过率曲线的斜率?斜率显著下降时应该考虑停止。
TTC 阶段:
- □ 是否有动态路由机制?简单问题不应该消耗过多推理 token。
- □ 是否量化了推理成本和准确率提升的比值?
- □ 是否区分了「需要深度思考」和「需要快速回答」的场景?
环境合成管线:
- □ 任务空间是否系统性地定义和覆盖?
- □ 验证器的可靠性是否经过验证?
- □ 合成数据的质量是否定期人工抽检?
🎯 相关面试题
巩固本篇知识点,备战 AI 岗位面试。
- 高级概念高频查看详解 →
RLHF 和 DPO 有什么区别?各自适用什么场景?
RLHF 通过奖励模型 + 强化学习优化偏好;DPO 直接用偏好对优化策略,省去 RM 训练,更稳定易部署。
- 中级概念高频查看详解 →
RLHF 的完整训练流程是怎样的?从 SFT 到 Reward Model 到 PPO 每阶段做了什么?
RLHF 分三阶段:先用人工示范数据做 SFT 得到初始策略,再用人工排序数据训练奖励模型给回答打分,最后用 PPO 强化学习按奖励更新策略并加 KL 惩罚防止偏离 SFT 模型太远。
- 中级概念高频查看详解 →
从预训练到对齐,大模型训练分哪几个阶段?
预训练学语言与世界知识,SFT 学指令格式,RLHF/DPO 对齐人类偏好,三阶段目标依次递进。
- 中级概念查看详解 →
解释为什么 "uncensored" 模型比基础模型更"乐观",这揭示了 RLHF 的什么问题?
2026 年 7 月 arxiv 研究发现去除 RLHF 对齐的 uncensored 模型在自我评估中比 base model 更乐观。这揭示 RLHF 可能只改变了模型的表面行为(学会说"正确"的话),而非真正内化价值观——去除对齐层后,模型反而暴露出更深的过度自信偏差。
