核心要点

  • 残差块 y = F(x) + x 使梯度短路

  • 解决深层网络退化问题

  • ResNet-50 等成为 CV 基线 backbone

  • 理解 bottleneck 结构

简要回答

ResNet 通过残差连接 F(x)+x 让深层网络易于训练,缓解梯度消失与退化问题,使上百层 CNN 成为可能,成为计算机视觉经典 backbone。

标准回答

一、残差网络(ResNet, He et al. 2015)

深度学习 里程碑,解决深层 CNN 难训练问题。

二、核心思想

学习残差 F(x) 而非直接映射 H(x),输出 y = F(x) + x(跳跃连接)。

三、意义

  1. 梯度流动:反向时梯度有恒等路径,缓解 梯度消失
  2. 缓解退化:更深网络测试误差反而上升——残差使层可学「零映射」,不低于浅层
  3. 可扩展深度:ResNet-152 在 ImageNet 夺冠,催生 ResNeXt、DenseNet 等

面试里不要只停在公式或名词,可以补 残差网络ResNet的意义是什么 对训练稳定性、泛化、收敛速度或显存/算力的影响。再说明一个常见调参或排错场景,面试官会更容易判断你真的用过这些方法。

四、Bottleneck 块

(ResNet-50+):1×1 降维 → 3×3 卷积 → 1×1 升维,减参提效。
ResNet 成为检测、分割、预训练 backbone 标准;思想也影响 Transformer(Pre-LN + 残差)。详见 计算机视觉入门

回答思路

  • 【定义】用一句话说清「残差网络(ResNet)的意义」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

术语:CNN梯度。知识库:计算机视觉入门深度学习基础

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只说「加了跳跃连接」却说不清 F(x)+x 公式;忽视 projection shortcut;把 ResNet 仅当「很深 CNN」不提退化问题。

追问

追问 1恒等映射时 F(x) 学什么?

若最优映射接近恒等,F(x)→0 即可,比直接学 H(x)=x 容易(权重→0)。若需变换,F 学残差部分。这是优化层面的归纳偏置。

追问 2ResNet 和 DenseNet 区别?

DenseNet 每层连接前面所有层(特征复用、参数效率高);ResNet 仅相邻块短路。DenseNet 显存占用特征图更大。

追问 3通道数不匹配时跳跃连接怎么办?

用 1×1 卷积 + stride 对 x 做 projection 匹配 shape,再相加。否则无法逐元素相加,残差分支和主分支维度必须一致。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习