微积分
微积分求导训练神经网络
微积分是研究函数变化率(微分)与累积量(积分)的数学分支,是深度学习中梯度计算与参数优化的理论根基。链式法则将微积分从抽象数学转化为可机器执行的学习过程,反向传播算法正是其工程实现。
概述
微积分是研究函数变化率(微分)与累积量(积分)的数学分支,是深度学习中梯度计算与参数优化的理论根基。链式法则将微积分从抽象数学转化为可机器执行的学习过程,反向传播算法正是其工程实现。
核心概念
微积分在 AI 语境中最关键的工具是导数与梯度,积分则主要出现在概率建模中。
- 导数:函数在某点的瞬时变化率,对应「损失函数对参数的敏感程度」
- 偏导数:固定其他变量,只对某一变量求导;神经网络每个权重的梯度本质上是偏导数
- 梯度:所有偏导数构成的向量,指向损失函数上升最快的方向;训练时沿其反方向更新参数
- 链式法则:复合函数导数定律 dz/dx = (dz/dy)·(dy/dx),可递归拆解任意深度的神经网络层
- 积分:在概率密度归一化与期望值计算等场景中仍有应用,但在日常模型训练中出现频率低于导数
反向传播与链式法则
反向传播是将链式法则系统化应用于神经网络的算法,1986 年由 Rumelhart 等人在 Nature 论文中推广后引发深度学习研究热潮。
- 前向传播:输入依次经过各层计算,产生预测值与损失值
- 反向传播:从输出层向输入层逐层应用链式法则,计算每个参数对损失的梯度
- 梯度流动:每层梯度等于该层局部梯度乘以后续层传回的梯度,逐层相乘累积
- 优先级说明:Werbos(1974博士论文)与 Parker(1985)均独立提出类似思想,但 Rumelhart 等人的 1986 年 Nature 论文是使该算法被广泛接受的关键发表
- 关键论文:《Learning Representations by Back-Propagating Errors》,Nature 323,页533-536,1986
自动微分
自动微分(AutoDiff / Autograd)将链式法则以程序方式精确实现,是现代深度学习框架的核心基础设施。
- 前向模式:从输入到输出逐步累积导数,适合输入维度少的场景
- 反向模式:从输出向输入传播梯度,计算效率远优于前向模式,适用于参数量远大于输出维度的神经网络——即反向传播
- 计算图:框架将计算过程记录为有向无环图,自动对每个节点应用链式法则
- 历史起点:反向模式自动微分理论由芬兰学者 Linnainmaa 于1970年代提出
- 主流实现:PyTorch(
autograd)、TensorFlow(GradientTape)、JAX(jax.grad)
梯度消失与梯度爆炸
链式法则在深层网络中连乘多个梯度值,容易引发数值稳定性问题,是深度学习研究的长期核心课题。
- 梯度消失:链式乘积中各因子均小于 1 时,深层梯度趋近于零,浅层参数几乎无法更新;Sigmoid 导数最大仅 0.25,是常见诱因
- 梯度爆炸:链式乘积指数级增大,导致参数更新剧烈甚至训练发散,常见于 RNN 处理长序列
- 残差连接:ResNet 引入的跳跃连接为梯度提供「高速公路」,大幅缓解消失问题
- 梯度裁剪:设置梯度范数上限,防止爆炸;RNN / Transformer 训练中常规使用
- 其他手段:批归一化、合理权重初始化(Xavier、He 初始化)、ReLU 系列激活函数
应用场景
微积分渗透在深度学习的每一个核心环节,远不止反向传播一处。
- 参数优化:SGD、Adam、AdaGrad 等优化器均依赖梯度向量更新模型权重
- 可解释性:Grad-CAM 对卷积层输出求梯度,可视化 CNN 关注的图像区域
- 元学习:MAML 算法需对梯度本身求导(「梯度的梯度」),要求框架支持高阶微分
- 生成模型:扩散模型中的得分匹配(Score Matching)本质上是对数概率密度关于输入的梯度
- 神经架构搜索:可微分 NAS(如 DARTS)将架构选择松弛为连续变量,用梯度优化架构参数
发展脉络
微积分历史远早于 AI,但与深度学习的结合经历了若干关键节点。
- 1665–1675:牛顿与莱布尼茨分别独立建立微积分体系,确立导数与积分基本定理
- 1847:Cauchy 系统化最速下降法,为梯度下降奠定思想基础
- 1970年代:Linnainmaa 提出反向模式自动微分理论框架,链式法则首次被高效机器实现
- 1974:Werbos 在博士论文中将反向传播思想应用于神经网络(未被广泛关注)
- 1986:Rumelhart、Hinton、Williams 在 Nature 发表反向传播论文,引发神经网络研究复兴
- 2012:AlexNet 利用 GPU 加速梯度计算,证明深层网络可大规模训练
- 2017至今:PyTorch、JAX 等框架将自动微分工程化,高阶微分与函数变换成为常规工具
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「求导训练神经网络」
- 「学 AI 躲不过的数学」
- 「跟 微积分 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 中级概念查看详解 →
梯度、Jacobian 与 Hessian 在优化中分别是什么?
梯度是一阶方向,Jacobian 是向量值函数的一阶导矩阵,Hessian 是二阶曲率、判定凸性。
- 高级概念查看详解 →
统计学中总体与样本如何定义与区分?
总体(population)是关心的全部个体及其分布参数;样本(sample)是从总体抽取的子集,用统计量估计未知参数。
- 高级概念查看详解 →
什么是置信区间?在统计学中为何重要?
置信区间是在重复抽样下,有指定比例(如 95%)会覆盖真实参数值的区间范围;比单点估计更能表达不确定性,是推断统计的核心工具。
- 高级概念查看详解 →
离散概率分布与连续概率分布有何区别?
离散分布取可数点值(PMF);连续分布取区间值(PDF,概率用密度积分);二者都可用 CDF 描述 P(X≤x)。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「微积分」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
