Scaling Law
Scaling Law越大越强有公式
神经网络规模法则(Neural Scaling Law)描述了模型性能与参数量、训练数据量、计算量之间呈现稳定幂律关系的实证规律。这一规律让研究者在大规模训练前就能定量预测收益,深刻影响了 GPT-3、Llama 等前沿大模型的研发策略与算力投入决策。
概述
规模法则揭示了「多投入→可预测性能提升」的量化规律,让研究者在大规模训练前就能估算收益。
- 三大关键变量:模型参数量(N)、训练 token 数(D)、计算预算(C,FLOPs),三者之一增大,模型 loss 均以幂次持续下降。
- 双对数线性:在双对数坐标系中,loss 与 N/D 呈近似直线关系,跨越七个数量级以上依然成立。
- 架构中性:网络宽度、深度等超参数对最终性能影响相对有限,远小于 N、D、C 的影响。
- 工程价值:团队可用小规模实验拟合曲线后外推,决定是否值得投入数百万美元算力,从根本上改变了大模型研发范式。
Kaplan 规模法则(2020)
OpenAI 的 Kaplan 等人于 2020 年发表了奠基性论文,系统建立了语言模型的规模法则框架。
- 论文基于数十个不同规模的 Transformer 语言模型实验,实验范围横跨超过七个数量级。
- 核心公式:$L(N, D) = A/N^{\alpha} + B/D^{\beta} + E$,其中 E 为不可约损失(数据本身的信息熵下界)。
- 原始结论:给定固定算力预算,应优先扩大模型参数量;数据相对欠充分的大模型仍优于数据充足的小模型。
- 该研究直接影响了 GPT-3(1750 亿参数)的设计决策,开启了大模型规模化竞争时代。
Chinchilla 修正(2022)
DeepMind 的 Hoffmann 等人通过训练超过 400 个规模各异的语言模型,对 Kaplan 法则的最优配比提出了重要修正。
- 核心发现:先前大模型普遍数据严重不足,未达到计算最优(compute-optimal)状态。
- 等比扩展原则:在固定算力下,模型参数量与训练 token 数应大致等比例增长,最优比约为每参数 20 tokens。
- 实证验证:以 70B 参数、约 1.4 万亿 token 训练的 Chinchilla 模型,在多项基准上全面超越 280B 的 Gopher 和 175B 的 GPT-3。
- 该结论重塑了行业对「数据与参数配比」的认知,推动 Llama 等后续模型大幅增加训练数据量。
延伸与变体
规模法则的研究已从语言模型扩展到多个领域和计算阶段。
- 跨模态扩展:视觉模型(ViT)、多模态模型、代码生成模型均被发现具有类似幂律特性,确认了跨模态普适性。
- 推理时缩放(Test-time Compute Scaling):在推理阶段投入更多计算(思维链、多步搜索)可带来类似训练时扩展的收益,o1、DeepSeek-R1 等模型印证了这一方向。
- 数据质量缩放:当数据量逼近上限时,提升数据质量(过滤、合成数据)可带来额外的类缩放收益,是突破「数据墙」的重要手段。
- MoE 架构的影响:混合专家(MoE)架构改变了激活参数量与总参数量的关系,需单独拟合缩放曲线。
应用场景
规模法则最直接的价值在于训练前的资源规划与决策支持。
- 算力预算规划:用小规模实验拟合幂律曲线,外推预测大规模训练的预期 loss,判断投入是否合理。
- 最优参数/数据配比:参照 Chinchilla 比例(约 20 tokens/参数)确定模型规模与数据量的最优搭配。
- 「算力换性能」依据:算法短期无突破时,扩大规模仍是可靠的改进手段,为持续投入提供理论背书。
- 模型系列规划:GPT、Llama、Mistral 等系列模型在参数规模梯队设计时,均以规模法则预测各尺寸的性能区间。
局限与误区
规模法则是强大的经验规律,但存在若干被频繁误读的局限。
- loss ≠ 任务表现:规模法则度量预训练 loss(next-token 交叉熵),loss 下降不等于推理、数学等能力同步提升,两者映射复杂。
- 涌现能力的例外:部分能力(如算术推理)并非平滑提升,而是在特定参数规模后突然涌现,难以用幂律预测。
- 数据墙:互联网级别高质量数据已接近上限,单纯靠增大 D 的策略面临瓶颈。
- 外推风险:幂律在已观测范围内成立,超出范围的外推需谨慎;边际改善成本持续上升。
- 小团队复现壁垒:拟合精确缩放曲线需要大量算力实验,frontier 级别结论难以独立复现。
发展脉络
从早期对神经网络容量的定性认知,到如今系统量化的规模法则,经历了数年演进。
- 2017 年前:神经网络领域已有「更大模型泛化更好」的直觉,但缺乏系统量化。
- 2020:OpenAI Kaplan 等人发表《Scaling Laws for Neural Language Models》,首次系统量化 N、D、C 三者与 loss 的幂律关系,奠定基础框架。
- 2022:DeepMind Hoffmann 等人发表 Chinchilla 论文(NeurIPS 2022),修正最优算力分配比例,70B Chinchilla 超越 280B Gopher。
- 2022-2023:Llama、Falcon 等开源模型按 Chinchilla 最优比例训练,规模法则进入工程实践主流。
- 2024-2025:推理时缩放成为新热点(o1、DeepSeek-R1),「训练时算力 vs 推理时算力」的权衡成为规模法则研究的新前沿。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「越大越强有公式」
- 「大模型圈高频词」
- 「跟 Scaling Law 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级开放查看详解 →
大模型的「涌现能力」指什么?存在哪些争议?
涌现指能力随规模到达阈值后突然跃升;争议在于这种突变可能只是非连续评测指标造成的假象。
- 中级概念查看详解 →
什么是大模型的 Scaling Law?Chinchilla 给了什么启示?
损失随参数、数据、算力以幂律下降;Chinchilla 指出固定算力下应让参数与训练 token 同比放大,约 20 token/参数为最优。
- 高级概念查看详解 →
为什么「推理时扩展」(Test-Time Scaling)能提升模型能力?
推理时增加采样/搜索/思考步数(best-of-n、MCTS、长 CoT)提升正确率,与训练时 scaling 互补。
- 高级概念查看详解 →
混合专家模型(MoE)的原理和优势是什么?
MoE 用门控网络把每个 token 路由到少数专家 FFN,稀疏激活让总参数巨大而单 token 计算量很低,兼顾容量与效率。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Scaling Law」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
