标准回答
一、梯度消失
深层网络 反向传播 时,梯度经多层连乘 ∂σ/∂z · W^T,若因子 < 1 则指数衰减,靠前层参数几乎得不到更新,训练停滞。
二、成因
- 饱和激活(Sigmoid/Tanh 两端梯度≈0)
- 权重初始化不当(过大→爆炸,过小→消失)
- 网络过深 且无跳跃路径
三、缓解策略
| 方法 | 机制 |
|---|---|
| ReLU 族 | 正区间梯度为 1 |
| 残差连接 ResNet | 梯度直达短路 |
| Batch Normalization | 稳定激活分布 |
| LSTM/GRU | 门控线性传递 |
| Xavier/He 初始化 | 保持方差稳定 |
| 梯度裁剪 | 防爆炸(clip norm) |
| 预训练+微调 | 分层解冻 |
| 与梯度爆炸(梯度→∞)相对,后者用裁剪、较小 lr 处理。现代 Transformer 还用 Pre-LN、残差、AdamW 保持稳定。详见 反向传播原理。 |
回答思路
【定义】用一句话说清「什么是梯度消失问题?如何避免」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
术语:梯度、反向传播、Batch Normalization。知识库:反向传播原理、深度学习基础。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:把所有训练失败都归因于梯度消失;在已用 ReLU+ResNet 的架构仍背 Sigmoid 饱和答案;混淆消失与欠拟合/学习率过小。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
