核心要点

  • 链式法则直觉

  • 前向 vs 反向

  • 计算图概念

简要回答

前向传播算输出和损失,反向传播用链式法则从损失对每层参数求梯度,再梯度下降更新权重。

标准回答

一、先把结论讲清楚

神经网络可看作复合函数 y=f_n(...f_1(x))。前向传播 逐层计算激活值并保存中间结果,最后得到预测值和损失。

二、拆开机制和判断点

反向传播 从损失 L 开始,对每层参数 w 计算 ∂L/∂w:输出层梯度直接求,隐藏层用链式法则把误差信号一层层传回。框架(PyTorch/TF)通过自动微分构建计算图自动完成。

三、补上例子、边界和取舍

回答时可以补一句训练难点:深层网络容易出现梯度消失/爆炸,常用 ReLU、残差连接LayerNorm、合理初始化和梯度裁剪来缓解。

面试里不要只停在公式或名词,可以补 反向传播Backpropagation是如何工作的 对训练稳定性、泛化、收敛速度或显存/算力的影响。再说明一个常见调参或排错场景,面试官会更容易判断你真的用过这些方法。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1什么是计算图?

计算图是有向图:节点是运算(加减乘、激活),边是张量流动。前向传播沿图计算输出;反向传播沿图用链式法则求梯度。PyTorch 动态构图,TensorFlow 2.x 默认 eager 也可 trace 成图。

追问 2梯度消失的原因是什么?

深层网络连乘小于 1 的激活导数(如 sigmoid/tanh),梯度指数衰减;或权重初始化不当。RNN 长序列尤甚。解决:ReLU 族、残差、Norm、LSTM 门控、梯度裁剪。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习