核心要点

  • 解释内部协变量偏移

  • 训练 vs 推理行为差异

  • LayerNorm 对比

简要回答

BN 对每个 mini-batch 的激活做减均值除方差,再学缩放平移参数;训练用 batch 统计,推理用滑动平均的全局统计。

标准回答

一、先把结论讲清楚

深层网络各层输入分布随前层参数更新而漂移,训练会变慢,也更依赖小心调学习率。BatchNorm 的目标是让每层输入分布更稳定。

二、拆开机制和判断点

BN 在层内对 mini-batch 归一化:μ、σ 由当前 batch 估计,再通过 γ、β 做可学习仿射变换。训练时用 batch 统计,推理时使用训练阶段累积的 running mean/var。

三、补上例子、边界和取舍

可以顺手对比 LayerNorm:BN 依赖 batch 维度,小 batch 时不稳定;LN 在特征维度归一化,更适合 TransformerRNN

面试里不要只停在公式或名词,可以补 Batch Normalization 的作用是什么 对训练稳定性、泛化、收敛速度或显存/算力的影响。再说明一个常见调参或排错场景,面试官会更容易判断你真的用过这些方法。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1小 batch 时 BN 有什么问题?

题库专题:Epoch、Batch 与 Iteration 有什么区别?

batch 统计量噪声大,running mean/var 不稳定,BN 层行为与推理不一致。小 batch 常用 GroupNorm、LayerNorm 或增大有效 batch(梯度累积、SyncBN)。

题库延伸:与本追问相关的专题题 → Epoch、Batch 与 Iteration 有什么区别?

追问 2GroupNorm 适用场景?

batch size 小或 batch 语义无关时(检测、分割、视频单帧);不依赖 batch 维度统计,训练/推理一致。大 batch 图像分类 BN 往往仍足够。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习