Scaling Law

Scaling Law

越大越强有公式

神经网络规模法则(Neural Scaling Law)描述了模型性能与参数量、训练数据量、计算量之间呈现稳定幂律关系的实证规律。这一规律让研究者在大规模训练前就能定量预测收益,深刻影响了 GPT-3、Llama 等前沿大模型的研发策略与算力投入决策。

概述

规模法则揭示了「多投入→可预测性能提升」的量化规律,让研究者在大规模训练前就能估算收益。

  • 三大关键变量:模型参数量(N)、训练 token 数(D)、计算预算(C,FLOPs),三者之一增大,模型 loss 均以幂次持续下降。
  • 双对数线性:在双对数坐标系中,loss 与 N/D 呈近似直线关系,跨越七个数量级以上依然成立。
  • 架构中性:网络宽度、深度等超参数对最终性能影响相对有限,远小于 N、D、C 的影响。
  • 工程价值:团队可用小规模实验拟合曲线后外推,决定是否值得投入数百万美元算力,从根本上改变了大模型研发范式。

Kaplan 规模法则(2020)

OpenAI 的 Kaplan 等人于 2020 年发表了奠基性论文,系统建立了语言模型的规模法则框架。

  • 论文基于数十个不同规模的 Transformer 语言模型实验,实验范围横跨超过七个数量级。
  • 核心公式:$L(N, D) = A/N^{\alpha} + B/D^{\beta} + E$,其中 E 为不可约损失(数据本身的信息熵下界)。
  • 原始结论:给定固定算力预算,应优先扩大模型参数量;数据相对欠充分的大模型仍优于数据充足的小模型。
  • 该研究直接影响了 GPT-3(1750 亿参数)的设计决策,开启了大模型规模化竞争时代。

Chinchilla 修正(2022)

DeepMind 的 Hoffmann 等人通过训练超过 400 个规模各异的语言模型,对 Kaplan 法则的最优配比提出了重要修正。

  • 核心发现:先前大模型普遍数据严重不足,未达到计算最优(compute-optimal)状态。
  • 等比扩展原则:在固定算力下,模型参数量与训练 token 数应大致等比例增长,最优比约为每参数 20 tokens。
  • 实证验证:以 70B 参数、约 1.4 万亿 token 训练的 Chinchilla 模型,在多项基准上全面超越 280B 的 Gopher 和 175B 的 GPT-3。
  • 该结论重塑了行业对「数据与参数配比」的认知,推动 Llama 等后续模型大幅增加训练数据量。

延伸与变体

规模法则的研究已从语言模型扩展到多个领域和计算阶段。

  • 跨模态扩展:视觉模型(ViT)、多模态模型、代码生成模型均被发现具有类似幂律特性,确认了跨模态普适性。
  • 推理时缩放(Test-time Compute Scaling):在推理阶段投入更多计算(思维链、多步搜索)可带来类似训练时扩展的收益,o1、DeepSeek-R1 等模型印证了这一方向。
  • 数据质量缩放:当数据量逼近上限时,提升数据质量(过滤、合成数据)可带来额外的类缩放收益,是突破「数据墙」的重要手段。
  • MoE 架构的影响:混合专家(MoE)架构改变了激活参数量与总参数量的关系,需单独拟合缩放曲线。

应用场景

规模法则最直接的价值在于训练前的资源规划与决策支持。

  • 算力预算规划:用小规模实验拟合幂律曲线,外推预测大规模训练的预期 loss,判断投入是否合理。
  • 最优参数/数据配比:参照 Chinchilla 比例(约 20 tokens/参数)确定模型规模与数据量的最优搭配。
  • 「算力换性能」依据:算法短期无突破时,扩大规模仍是可靠的改进手段,为持续投入提供理论背书。
  • 模型系列规划:GPT、Llama、Mistral 等系列模型在参数规模梯队设计时,均以规模法则预测各尺寸的性能区间。

局限与误区

规模法则是强大的经验规律,但存在若干被频繁误读的局限。

  • loss ≠ 任务表现:规模法则度量预训练 loss(next-token 交叉熵),loss 下降不等于推理、数学等能力同步提升,两者映射复杂。
  • 涌现能力的例外:部分能力(如算术推理)并非平滑提升,而是在特定参数规模后突然涌现,难以用幂律预测。
  • 数据墙:互联网级别高质量数据已接近上限,单纯靠增大 D 的策略面临瓶颈。
  • 外推风险:幂律在已观测范围内成立,超出范围的外推需谨慎;边际改善成本持续上升。
  • 小团队复现壁垒:拟合精确缩放曲线需要大量算力实验,frontier 级别结论难以独立复现。

发展脉络

从早期对神经网络容量的定性认知,到如今系统量化的规模法则,经历了数年演进。

  • 2017 年前:神经网络领域已有「更大模型泛化更好」的直觉,但缺乏系统量化。
  • 2020:OpenAI Kaplan 等人发表《Scaling Laws for Neural Language Models》,首次系统量化 N、D、C 三者与 loss 的幂律关系,奠定基础框架。
  • 2022:DeepMind Hoffmann 等人发表 Chinchilla 论文(NeurIPS 2022),修正最优算力分配比例,70B Chinchilla 超越 280B Gopher。
  • 2022-2023:Llama、Falcon 等开源模型按 Chinchilla 最优比例训练,规模法则进入工程实践主流。
  • 2024-2025:推理时缩放成为新热点(o1、DeepSeek-R1),「训练时算力 vs 推理时算力」的权衡成为规模法则研究的新前沿。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「越大越强有公式」
  • 「大模型圈高频词」
  • 「跟 Scaling Law 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    Scaling Laws 缩放定律:从原理到大规模训练的完整技术体系

    深入理解 AI 模型性能如何随模型规模、数据量和计算资源缩放,从 Kaplan 到 Chinchilla 再到后 Chinchilla 时代的完整技术演进

  2. 2

    Mixture of Experts(MoE)(二):大模型的稀疏化架构

    深入解析 Mixture of Experts 架构的设计原理、路由机制、训练挑战,以及 Mixtral、DeepSeek-V3、Kimi K2、Llama 4 等前沿模型中的工程实践

外部参考

维基百科:查看「Scaling Law」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。