核心要点

  • 链式法则直觉

  • 前向 vs 反向

  • 计算图概念

简要回答

前向传播算输出和损失,反向传播用链式法则从损失对每层参数求梯度,再梯度下降更新权重。

标准回答

神经网络可看作复合函数 y=f_n(...f_1(x))。前向传播 逐层计算激活值并保存中间结果。反向传播 从损失 L 开始,对每层参数 w 计算 ∂L/∂w:输出层梯度直接求,隐藏层用链式法则把误差信号传回。框架(PyTorch/TF)通过自动微分构建计算图自动完成。梯度消失/爆炸是深层网络训练难点,ReLU、残差连接LayerNorm 等可缓解。

常见误区

⚠️ 常见踩坑

只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1什么是计算图?

计算图是有向图:节点是运算(加减乘、激活),边是张量流动。前向传播沿图计算输出;反向传播沿图用链式法则求梯度。PyTorch 动态构图,TensorFlow 2.x 默认 eager 也可 trace 成图。

追问 2梯度消失的原因是什么?

深层网络连乘小于 1 的激活导数(如 sigmoid/tanh),梯度指数衰减;或权重初始化不当。RNN 长序列尤甚。解决:ReLU 族、残差、Norm、LSTM 门控、梯度裁剪。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习