Post-Training Scaling(后训练扩展)
Post-Training Scaling不改架构不加参数,靠后训练把基础模型推到前沿
亦作、亦称:后训练扩展 · Post-Training Scaling · 后训练缩放 · 后训练规模化
Post-Training Scaling 是在不改基础模型架构与参数量的前提下,通过扩展后训练阶段的计算、数据或推理资源来系统性提升模型能力的工程方法论。四个可独立扩展的维度:SFT 数据规模、偏好对齐密度、RL 试错环境、TTC 推理开销。
核心定义
Post-Training Scaling 是在不改基础模型架构与参数量的前提下,通过扩展后训练阶段的计算、数据或推理资源来系统性提升模型能力的工程方法论。OpenAI 2024 论文首次形式化:给定基础模型,性能随后训练计算量呈幂律提升。与预训练 scaling law 互补——预训练决定能力上限,后训练决定能力兑现效率。
四个可独立扩展的维度
2025-2026 年实证确认四个可独立扩展的工程维度:①SFT 数据规模——高质量指令-响应对的数量与多样性;②偏好对齐密度——RLHF/DPO 中奖励信号的质量与覆盖度;③RL 试错环境——RLxF(RL from x)中环境合成的广度与真实性;④TTC 推理开销——测试时计算(Test-Time Compute)的推理 token 预算。每个维度都有独立的扩展曲线,组合时存在收益递减。
与 Re-Post-Training 的区别
Re-Post-Training 强调迭代范式——同一模型反复后训练以更新能力(如 DeepSeek V4-Flash-0731);Post-Training Scaling 强调扩展方法论——后训练资源与性能的可预测关系。前者回答'怎么迭代',后者回答'迭代多少够用'。工程上两者互补:Re-Post-Training 是迭代节奏,Post-Training Scaling 是资源预算。
工程决策要点
评估是否值得做 Post-Training Scaling 的三个判据:①基础模型能力是否已接近该任务的天花板(若基础模型本身能力不足,后训练扩展收益有限);②后训练数据/环境的获取成本是否低于重新预训练;③目标能力的评估指标是否可量化(不可量化的能力难以用 scaling 方法优化)。资源分配决策树:先 SFT 建立基线 → 再偏好对齐提升质量 → 再用 RL 扩展复杂场景 → 最后 TTC 优化推理时决策。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「不改架构不加参数,靠后训练把基础模型推到前沿」
- 「后训练阶段的 scaling law」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级场景查看详解 →
如何在生产环境评估来源不明的匿名模型?从 Ox Alpha 事件出发,设计一套可落地的匿名模型准入评估框架。
2026-08 Ox Alpha 以匿名身份提供免费 1M context 服务,来源不明却性能前沿——这类模型能否用于生产?核心考察:候选人能否设计一套超越 benchmark 分数的工程评估框架,覆盖供应链溯源、行为安全测试、数据隔离验证和渐进式灰度四个维度,而非仅凭性能数据做决策。
- 初级概念高频查看详解 →
什么是大语言模型(LLM)?它能做什么、不能做什么?
LLM 是基于 Transformer、在海量文本上预训练的自回归语言模型,擅长语言任务,但不擅长精确计算、实时信息,且会产生幻觉。
- 高级系统设计查看详解 →
当 LLM 上下文窗口达到 1M token 时,"Lost in the Middle" 效应对 RAG 系统设计有何影响?如何工程化缓解?
即使上下文窗口达到 1M token,"Lost in the Middle"(Liu et al. 2023)与 Context Rot(Chroma 2026)仍使模型对中间位置信息的利用率显著下降——标称容量不等于有效容量。RAG 系统不能把检索结果无脑堆叠进超长上下文,而须做检索重排(首尾优先)、分层上下文预算(工作记忆 vs 长尾知识)、分块聚合(map-reduce)与位置探针评测。本题考察候选人能否把位置偏置从论文概念转化为 RAG 工程约束。
- 高级系统设计查看详解 →
基准污染诊断:当 SWE-bench Verified 得分异常高但实际能力不匹配时,如何系统性诊断并调整评估策略?
OpenAI SWE-bench Verified 审计发现 59.4% 任务存在缺陷,前沿模型被检测到从训练数据中召回答案(adwaitx.com 2026-02 技术分析)。当模型在基准上得分异常高(如 80%+)但实际能力不匹配时,候选人需要展示三条独立诊断路径(n-gram overlap 精确重叠、embedding similarity 语义重叠、ablation study 因果归因)的交叉验证能力,以及污染确认后从「单一基准分数」转向「基准组合 + 私有评测 + 过程评估」的评估策略重构能力。本题区分「会跑 benchmark」与「理解 benchmark 为什么可信」的候选人。
延伸阅读
从知识库精选 1 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Post-Training Scaling」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
