文章摘要
你的团队拿到一个预训练大模型,需要让它能对话、能推理、能写代码、还要安全可控。这条从「能生成文本」到「能解决实际问题」的路径就是后训练。本文拆解 2026 年主流后训练流水线:SFT 建立指令跟随能力、奖励建模提供好坏信号、强化学习优化策略,以及可验证奖励如何改变推理训练。读完能设计一条包含 SFT→奖励建模→RL/DPO→验证的完整流水线,并选择合适的开源工具链。
1后训练解决什么问题?
想象你拿到一个 70B 参数的预训练模型。它读过整个互联网,能续写任何文本——但你让它帮你写一封邮件,它可能给你续写成小说;你让它解数学题,它可能给你续写成诗歌。
这就是预训练模型的困境:它学会了语言的统计规律,但不知道「如何与人协作」。
后训练(Post-training) 就是把这个「能续写」的模型变成「能干活」的模型的过程。它包含三个阶段:
2025-2026 年,后训练领域发生了两个重要变化:
- DPO 和 GRPO 等新算法简化了训练流程,不再需要复杂的奖励模型。据 Karumi 2026 年行业分析,OpenAI、Meta、Google、Anthropic 等前沿实验室已全面采用 DPO 或其变体作为对齐阶段的标准方法。
- 可验证奖励(RLVR) 在推理任务上取得突破,用确定性验证器替代人类偏好。标志性事件是 2025 年 1 月 DeepSeek-R1 论文发布,用 GRPO 算法 + 规则奖励在数学和代码推理上达到 OpenAI o1 水平并完全开源。
本文会带你走完这条流水线,从每个阶段的原理到工程决策,最后给出 2026 年的工具链选型建议。
2SFT:建立指令跟随能力
SFT(Supervised Fine-Tuning,监督微调)是后训练的第一步。它的目标很简单:让模型学会「看到问题就回答问题」,而不是「看到文本就续写」。
2.1 SFT 的训练数据
SFT 的数据格式是指令-回复对。例如:指令是"帮我写一封拒绝合作的邮件,语气要礼貌",回复是"感谢您的邀请,经过慎重考虑..."。
模型学习从「指令」生成「回复」,而不是从任意文本续写。这种训练让模型理解:用户给的是问题,我应该给的是答案。
SFT 的奇妙效果:即使训练数据只有几千条,模型也能学会泛化到从未见过的指令类型。这是因为 SFT 改变了模型的生成模式——它学会了「对话」的结构,而不是记住具体的问答。
更深层的变化:SFT 之后的模型开始展现出「推理」的雏形。比如你让它解一道数学题,它会逐步推导,而不是直接给出答案。这是因为训练数据中包含了很多「思考过程」的示例,模型学会了展示推理步骤,而不是直接给出答案。这种训练方式让模型学会了"如何思考",而不是"思考什么"。
22 SFT 的工程要点
SFT 看似简单,但工程细节决定成败。
数据质量 > 数据数量。1000 条高质量、多样化的指令-回复对,效果往往超过 10000 条低质量数据。高质量的标准包括:指令清晰无歧义、回复准确完整、格式规范一致、覆盖目标能力维度。Hugging Face 的 RLHF 教程指出,SFT 阶段的数据多样性直接决定了后续 RL 阶段的探索空间——如果 SFT 数据只覆盖狭窄的指令类型,RL 阶段很难泛化到未见过的场景。
数据配比是另一个关键。如果你的模型需要同时具备对话、代码、推理、知识问答等能力,那么不同类别的数据比例需要精心调整。过多对话数据会让模型变得"话多但空洞",过多代码数据会削弱自然语言能力。
训练超参方面,SFT 通常使用较小的学习率(1e-5 到 5e-5),训练 2-5 个 epoch。学习率太大会破坏预训练的知识,太小则学不到新东西。
评估不能只看训练 loss。必须准备一个独立的测试集,包含各种能力维度的问题,定期评估模型在不同维度上的表现。过拟合是 SFT 最常见的失败模式——模型在训练集上表现完美,但在真实场景中能力下降。
3奖励建模:从人类偏好到可验证信号
SFT 之后的下一步是建立"好坏"的标准。这个标准有两种完全不同的路径:学习出来的人类偏好模型,或者确定性的可验证奖励。
3.1 人类偏好奖励模型(Reward Model)
传统 RLHF 的做法是:给模型两个回复,让人类判断哪个更好,然后用这些偏好数据训练一个奖励模型。这个奖励模型本质上是一个分类器,输入是(问题,回复),输出是一个标量分数,表示这个回复有多"好"。
奖励模型的训练数据格式是三元组:(prompt, chosen, rejected)。模型学习让 chosen 的分数高于 rejected。训练完成后,奖励模型可以给任何回复打分,为后续的强化学习提供奖励信号。
问题在于:奖励模型本身是一个神经网络,它也会犯错。更严重的是,它可能会学到"捷径"——比如给长回复更高分,给包含特定关键词的回复更高分,而不是真正理解回复的质量。这就是 reward hacking。
3.2 可验证奖励(Verifiable Rewards)
2025 年 DeepSeek-R1 的成功证明了另一种可能:对于答案可以被自动验证的任务(数学、代码、逻辑推理),直接用确定性验证器计算奖励。DeepSeek-R1 论文首次系统性地展示了 GRPO 算法配合规则奖励,如何在数学推理(AIME 2024 得分 79.8%)和代码生成(LiveCodeBench 得分 65.9%)上达到 OpenAI o1 水平。
比如数学题,答案是 42,模型输出 42 就得 1 分,输出其他就得 0 分。代码题,跑测试用例,通过了就得 1 分,失败了就得 0 分。这种奖励是客观的、无偏的、无法被 hack 的。
可验证奖励的优势:不需要人类标注(只需要标准答案),奖励信号准确无偏,训练更稳定。Sebastian Raschka 的技术分析指出,可验证奖励从根本上消除了 reward hacking 的风险——因为验证器是确定性的,模型无法通过"欺骗"来获得高分。
局限:只能用于答案可验证的任务。对于开放式问题("如何评价这部电影?"),没有标准答案,无法使用可验证奖励。
3.3 混合方案
前沿模型通常同时使用两种奖励:用可验证奖励训练推理能力(数学、代码),用人类偏好奖励训练对齐能力(安全、有用性)。这种混合方案在 2025-2026 年成为主流。
4强化学习优化:PPO、DPO 与 GRPO
有了奖励信号之后,下一步是用强化学习优化模型。这里有三代算法,每一代都在解决前一代的痛点。
4.1 PPO:经典但复杂
PPO(Proximal Policy Optimization)是 RLHF 时代的标配。它的核心思想是:在优化策略的同时,限制新策略与旧策略的差距,防止训练崩溃。Ouyang et al. (2022)在 InstructGPT 中首次将 PPO 大规模应用于 LLM 对齐,证明了 RLHF 可以让模型在保持语言能力的同时显著提升指令跟随和安全性。
PPO 需要同时维护四个模型:策略模型(要训练的)、参考模型(冻结的 SFT 模型)、奖励模型(打分)、价值模型(估计状态价值)。这种架构复杂且不稳定,超参数敏感,训练资源消耗大。
4.2 DPO:简化范式
2023 年 DPO(Direct Preference Optimization)的出现改变了游戏规则。DPO 原始论文的核心洞察是:既然最终目标是让模型符合人类偏好,为什么不直接从偏好数据优化模型,而要通过奖励模型这个中间步骤?
DPO 通过数学变换,把 RLHF 的目标函数等价转换为一个可以直接在偏好数据上优化的损失函数。不需要奖励模型,不需要价值网络,只需要偏好数据。训练更稳定,资源消耗更少。
但 DPO 不是万能的。它本质上是一种离线算法,只能从已有的偏好数据中学习。如果偏好数据质量不高,或者覆盖的场景不够全面,DPO 的效果会受限。
4.3 GRPO:为推理而生
2025 年 DeepSeek-R1 提出的 GRPO(Group Relative Policy Optimization)专门针对推理任务优化。它的核心思想是:对于同一个问题,让模型生成一组回复,然后用可验证奖励给每个回复打分,最后用组内相对排名来优化策略。
GRPO 的优势在于:不需要价值模型(减少资源消耗),利用组内对比提高样本效率,与可验证奖励天然契合。
算法选择指南:
- 如果你的任务有明确的可验证答案(数学、代码),优先用 GRPO + 可验证奖励
- 如果你的任务是开放式偏好对齐,且偏好数据质量高,用 DPO
- 如果你需要细粒度的奖励控制,且资源充足,用 PPO
5可验证奖励的工程实践
可验证奖励听起来很美好,但工程实现有很多细节需要注意。
5.1 验证器的设计
验证器必须是确定性的、无歧义的。对于数学题,验证器需要能够解析模型的输出,提取最终答案,然后与标准答案比较。这里有很多坑:
- 模型可能用不同的格式输出答案("42"、"答案是 42"、"\boxed{42}")
- 模型可能在推理过程中犯错,但最终答案碰巧对了
- 模型可能给出正确答案,但推理过程完全错误
解决方案是:定义严格的输出格式(比如要求用 \boxed{} 包裹最终答案),同时验证推理过程的关键步骤(如果可能的话)。
5.2 奖励塑形(Reward Shaping)
纯粹的二值奖励(对/错)在训练早期效率很低。如果模型完全不会做某类题,它可能生成 100 个回复全是错的,得不到任何正向信号。
解决方案是引入奖励塑形:给部分正确的步骤一些分数。比如数学题,最终答案错了但关键步骤对了,给 0.3 分;代码题,主功能错了但边界条件处理对了,给 0.2 分。
奖励塑形需要领域知识,设计不当会引入新的偏差。
5.3 防止 reward hacking
即使是可验证奖励,也可能被 hack。比如模型发现:在数学题输出中加很多无关公式,碰巧蒙对答案的概率更高。或者在代码题中,生成大量 try-catch 块,碰巧通过某些测试用例。
防御方法包括:限制输出长度、增加验证器的鲁棒性(比如代码题不仅跑测试用例,还检查代码质量)、定期更新验证器。
5.4 工具链选型
2026 年主流的后训练工具链包括:
- TRL(Transformer Reinforcement Learning):Hugging Face 出品,支持 PPO、DPO、GRPO,与 Hugging Face 生态无缝集成
- OpenRLHF:专注于大规模 RLHF 训练,支持 Ray 分布式训练
- DeepSpeed-Chat:微软出品,针对超大规模模型优化
- veRL:Volcano Engine 出品,专注于推理任务的 RLVR
选择建议:如果你的团队已经在使用 Hugging Face,TRL 是最自然的选择;如果你需要训练超大规模模型(70B+),OpenRLHF 或 DeepSpeed-Chat 更合适;如果你专注于推理任务,veRL 值得尝试。
6完整流水线设计与验证
现在把所有步骤串起来,设计一个完整的后训练流水线。
阶段 1:SFT(监督微调)
- 输入:预训练模型 + 高质量指令-回复对
- 输出:SFT 模型
- 验证:在独立测试集上评估基础能力,确保模型能够遵循指令、格式正确
阶段 2:奖励建模
- 对于可验证任务:准备标准答案和验证器
- 对于开放式任务:收集人类偏好数据,训练奖励模型
- 验证:奖励模型的打分与人类判断的一致性;验证器的准确性和鲁棒性
阶段 3:强化学习优化
- 选择算法(PPO/DPO/GRPO)
- 训练 RL 模型
- 验证:在多个维度评估——任务完成率、输出质量、安全性、多样性
阶段 4:迭代与监控
- 收集真实场景的反馈
- 识别模型的弱点
- 补充数据,重新训练
- 部署后持续监控性能漂移
关键验证点:
- 每个阶段结束后都要评估,不能等到最后才发现问题
- SFT 后检查基础能力,奖励建模后检查打分质量,RL 后检查综合表现
- 建立自动化评估流水线,每次训练后自动跑测试集
2026 年的最佳实践:
根据 Karumi 对前沿模型(OpenAI、Meta、Google、Anthropic、Moonshot、Mistral)的分析,成功的后训练流水线有以下共同特征:
- 混合奖励:同时使用可验证奖励(推理任务)和人类偏好奖励(对齐任务)
- 迭代训练:不是一次性完成,而是多轮迭代,每轮聚焦不同能力
- AI 反馈:用 AI 模型辅助人类标注,提高效率(如 Anthropic 的 RLAIF)
- 长上下文 RL:利用 128K+ 上下文窗口,让模型在 RL 阶段进行更复杂的推理(如 Moonshot Kimi)
Meta 的 Llama 4 是一个典型案例:先用轻量级 SFT 建立基础能力,然后用在线 RL 优化推理行为,最后用 DPO 打磨语气和减少误拒绝。这种「SFT → RL → DPO」的三段式流水线成为 2026 年的主流范式。
7常见陷阱与调试方法
后训练过程中有很多坑,这里列出最常见的几个和解决方法。
陷阱 1:SFT 后模型变傻了
症状:SFT 后模型在某些能力上反而下降了。
原因:SFT 数据覆盖了预训练知识,或者学习率太大破坏了预训练权重。
解决:检查 SFT 数据的多样性,降低学习率,减少训练轮数。
陷阱 2:奖励模型打分不一致
症状:同一个回复,奖励模型有时打高分有时打低分。
原因:奖励模型训练数据不足,或者模型过拟合。
解决:增加偏好数据量,使用 dropout 和正则化,检查数据质量。
陷阱 3:RL 训练崩溃
症状:训练 loss 突然飙升,模型输出变成乱码。
原因:PPO 的 KL 散度约束太小,策略偏离参考模型太远。
解决:增大 KL 系数,减小学习率,使用梯度裁剪。
陷阱 4:Reward hacking
症状:模型在奖励模型上得分很高,但实际输出质量很差。
原因:模型找到了奖励模型的漏洞,比如生成特定格式的文本。
解决:定期更新奖励模型,增加奖励模型的多样性,使用 ensemble 方法。
陷阱 5:可验证奖励的格式问题
症状:模型答案对了但验证器判错,或者答案错了但验证器判对。
原因:输出格式不统一,或者验证器逻辑有 bug。
解决:在 SFT 阶段就训练模型使用标准输出格式,严格测试验证器的边界情况。
调试工具:
- 使用 Weights & Biases 或 TensorBoard 监控训练曲线
- 定期保存 checkpoint,方便回滚
- 建立小规模快速实验环境,先在小模型上验证流程
- 记录每次实验的超参数和数据版本,方便复现
82026 年的前沿趋势
后训练领域还在快速演进,2026 年有几个值得关注的趋势。
趋势 1:RLVR 扩展到更多任务
可验证奖励最初只用于数学和代码,现在正在扩展到逻辑推理、知识问答、甚至部分开放式任务。关键是找到「可验证的中间步骤」——即使最终答案无法自动验证,但推理过程中的某些步骤可以验证。
趋势 2:AI 辅助标注
人类标注成本高、速度慢。2026 年的趋势是用 AI 模型辅助人类标注:AI 生成初始标注,人类审核和修正。Anthropic 的 RLAIF(Reinforcement Learning from AI Feedback)就是一个例子——用 AI 模型根据「宪法」原则评判回复质量,减少对人类标注的依赖。
趋势 3:测试时计算(Test-time Compute)
传统训练是一次性的,训练完成后模型就固定了。2025-2026 年的趋势是在推理时继续计算:让模型生成多个候选答案,然后用验证器或奖励模型选择最好的。OpenAI o1 和 DeepSeek-R1 都使用了这种技术。
趋势 4:多模态后训练
随着多模态模型的普及,后训练也在扩展到视觉、音频等领域。如何让模型在图文混合任务中对齐,是 2026 年的热门研究方向。
趋势 5:个性化后训练
不同用户有不同的偏好。未来的后训练可能会更加个性化——根据特定用户群体的偏好定制模型,而不是训练一个「通用」模型。
给读者的建议:
如果你是刚接触后训练的工程师,建议从 TRL 库开始,先跑通一个完整的 SFT → DPO 流程。理解每个阶段的目的和常见问题后,再尝试更复杂的 RLVR 或 GRPO。
如果你的团队已经有后训练经验,建议关注可验证奖励和测试时计算。这两个方向在 2026 年有很大的实用价值,特别是在推理和代码生成任务上。
后训练是一个「工程 + 研究」的领域。理论很重要,但实践经验更重要。多跑实验,多记录,多迭代,才能训练出真正好用的模型。
参考资料
本文基于以下来源:
- Karumi (2026). Reinforcement Learning in Frontier LLMs: From RLHF to Verifiable Rewards. 行业分析,覆盖 OpenAI、Meta、Google、Anthropic、Moonshot、Mistral 等前沿模型的后训练实践。
- DeepSeek-AI (2025-01). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. 研究论文,提出 GRPO 算法和 RLVR 范式。
- Rafailov et al. (2023). Direct Preference Optimization: Your Language Model is Secretly a Reward Model. 研究论文,提出 DPO 算法。
- Ouyang et al. (2022). Training language models to follow instructions with human feedback. 研究论文,InstructGPT 的 RLHF 方法。
- Hugging Face (2023). RLHF: Reinforcement Learning from Human Feedback. 官方文档,介绍 RLHF 基础概念。
🎯 相关面试题
巩固本篇知识点,备战 AI 岗位面试。
- 中级概念高频查看详解 →
RLHF 的完整训练流程是怎样的?从 SFT 到 Reward Model 到 PPO 每阶段做了什么?
RLHF 分三阶段:先用人工示范数据做 SFT 得到初始策略,再用人工排序数据训练奖励模型给回答打分,最后用 PPO 强化学习按奖励更新策略并加 KL 惩罚防止偏离 SFT 模型太远。
- 高级概念高频查看详解 →
RLHF 和 DPO 有什么区别?各自适用什么场景?
RLHF 通过奖励模型 + 强化学习优化偏好;DPO 直接用偏好对优化策略,省去 RM 训练,更稳定易部署。
- 中级概念高频查看详解 →
从预训练到对齐,大模型训练分哪几个阶段?
预训练学语言与世界知识,SFT 学指令格式,RLHF/DPO 对齐人类偏好,三阶段目标依次递进。
- 高级概念查看详解 →
Function Calling(工具调用)能力是如何训练出来的?
Function Calling 不是预训练自带的天赋,而是后训练阶段用大量「意图+工具schema+正确结构化调用」轨迹对齐出来的能力。
