核心要点
解释内部协变量偏移
训练 vs 推理行为差异
与 LayerNorm 对比
简要回答
BN 对每个 mini-batch 的激活做减均值除方差,再学缩放平移参数;训练用 batch 统计,推理用滑动平均的全局统计。
标准回答
一、先把结论讲清楚
深层网络各层输入分布随前层参数更新而漂移,训练会变慢,也更依赖小心调学习率。BatchNorm 的目标是让每层输入分布更稳定。
二、拆开机制和判断点
BN 在层内对 mini-batch 归一化:μ、σ 由当前 batch 估计,再通过 γ、β 做可学习仿射变换。训练时用 batch 统计,推理时使用训练阶段累积的 running mean/var。
三、补上例子、边界和取舍
可以顺手对比 LayerNorm:BN 依赖 batch 维度,小 batch 时不稳定;LN 在特征维度归一化,更适合 Transformer 和 RNN。
面试里不要只停在公式或名词,可以补 Batch Normalization 的作用是什么 对训练稳定性、泛化、收敛速度或显存/算力的影响。再说明一个常见调参或排错场景,面试官会更容易判断你真的用过这些方法。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:小 batch 时 BN 有什么问题?
题库专题:Epoch、Batch 与 Iteration 有什么区别?batch 统计量噪声大,running mean/var 不稳定,BN 层行为与推理不一致。小 batch 常用 GroupNorm、LayerNorm 或增大有效 batch(梯度累积、SyncBN)。
题库延伸:与本追问相关的专题题 → Epoch、Batch 与 Iteration 有什么区别?
追问 2:GroupNorm 适用场景?
batch size 小或 batch 语义无关时(检测、分割、视频单帧);不依赖 batch 维度统计,训练/推理一致。大 batch 图像分类 BN 往往仍足够。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
