Layer Normalization(层归一化)
Layer Normalization稳定训练的归一化
亦作、亦称:层归一化 · LayerNorm · LN
层归一化(Layer Normalization)在神经网络每一层对特征做零均值、单位方差标准化,稳定深层训练并加速收敛。与 Batch Normalization 按 batch 维度归一化不同,Layer Norm 对每个样本独立计算,更适合序列长度变化的 NLP 任务。
工作原理
对单个 token 或样本的特征向量计算均值与方差,再线性变换恢复表达能力。Transformer 通常在注意力子层和前馈子层之后各加一次 Layer Norm(Pre-LN 或 Post-LN 布局)。
与 Batch Norm 对比
Batch Norm 依赖 batch 统计,小 batch 或变长序列时不稳定;Layer Norm 不依赖 batch 大小,成为 GPT、BERT 系模型默认选择。RMSNorm 进一步去掉均值项,被 LLaMA 等采用以降低计算量。
训练影响
Layer Norm 缓解内部协变量偏移,使更大学习率与更深网络可训练。推理阶段使用训练得到的缩放/平移参数,无额外开销。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「稳定训练的归一化」
- 「每层都做归一化」
- 「加速收敛」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
TensorFlow 中的计算图是什么?
TensorFlow 计算图将运算表示为有向无环图中的节点,边表示张量依赖;1.x 需先建图再用 Session 执行,2.x 默认即时执行但可用 tf.function 编译为图。
- 中级概念查看详解 →
TensorFlow Lite 是什么?适用于哪些场景?
TensorFlow Lite 是 TensorFlow 的移动端与嵌入式推理引擎,通过转换与量化压缩模型,在 Android、iOS、树莓派等边缘设备上低延迟运行深度学习模型。
- 中级概念查看详解 →
TensorFlow 中的 Variable 是什么?有何重要性?
TensorFlow 的 tf.Variable 是可训练的可变张量,用于存储模型权重和偏置;优化器通过 apply_gradients 更新 Variable,是训练中被学习的参数载体。
- 中级概念查看详解 →
什么是深度学习?与传统机器学习方法有何区别?
深度学习是机器学习子集,用多层神经网络自动学习层次特征表示;区别于传统 ML 需手工特征,深度学习可端到端从原始数据学习,但依赖更多数据与算力。
延伸阅读
从知识库精选 3 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「Layer Normalization」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
