概率论
概率论AI 里的不确定性
概率论是研究随机现象规律的数学分支,为机器学习提供处理不确定性的核心语言——从损失函数设计、生成模型训练到强化学习的策略优化,几乎所有 AI 算法都建立在概率推断的基础之上。
概述
概率论是研究随机现象规律的数学分支,为机器学习提供处理不确定性的核心语言——从损失函数设计、生成模型训练到强化学习的策略优化,几乎所有 AI 算法都建立在概率推断的基础之上。
核心概念
概率论提供了一套完整的数学工具,用于描述不确定性和随机性。
- 随机变量:将随机实验结果映射为数值的函数,分为离散型(如分类标签)和连续型(如图像像素值)
- 概率分布:描述随机变量取各值可能性的函数,常用分布包括高斯分布、伯努利分布、多项分布
- 期望与方差:期望(均值)衡量分布中心,方差衡量分布的离散程度,二者是描述分布特征的基本统计量
- 条件概率:P(A|B) 表示已知 B 发生时 A 发生的概率,是贝叶斯推断的数学核心
- 大数定律与中心极限定理:保证了从样本估计总体分布的合理性,为随机梯度下降等算法提供理论支撑
贝叶斯推断
贝叶斯推断以 Thomas Bayes 1763 年遗著为源头,是 AI 中处理不确定性的主流框架。
- 贝叶斯定理:P(θ|X) ∝ P(X|θ)·P(θ),将先验信念与观测似然结合得到后验分布
- 频率派 vs 贝叶斯派:频率派将概率视为长期频率,只做点估计;贝叶斯派将概率视为信念程度,显式引入先验并输出后验分布
- 最大后验估计(MAP):取后验最大值点作为参数估计,是最大似然估计加正则化的概率解释
- 变分推断(VI):当后验难以解析计算时,用简单分布 Q(z) 近似真实后验 P(z|X),通过最小化 KL 散度实现
- 贝叶斯神经网络:对网络权重维持概率分布而非点估计,可输出预测置信度,用于不确定性量化
信息论与损失函数
信息论与概率论紧密交织,直接决定了深度学习中损失函数的设计。
- 熵(Entropy):H(P) = -∑ P(x) log P(x),衡量分布的不确定程度,均匀分布熵最大
- 交叉熵(Cross-Entropy):H(P, Q) = -∑ P(x) log Q(x),分类任务的标准损失函数,衡量预测分布 Q 与真实分布 P 的差距
- KL 散度:由 Kullback 与 Leibler 于 1951 年提出,D_KL(P‖Q) = H(P,Q) - H(P),量化两个分布的「信息距离」;注意其非对称性:KL(P‖Q) ≠ KL(Q‖P)
- 最大似然估计(MLE):寻找使观测数据概率最大的参数,与最小化交叉熵损失在数学上等价
- 互信息:衡量两个随机变量之间的统计依赖程度,用于特征选择和自监督表示学习
生成模型中的应用
概率论是生成模型的数学基础,所有主流生成架构本质上都是在学习数据的概率分布。
- 变分自编码器(VAE):编码器拟合后验 q(z|x),解码器拟合 p(x|z),目标函数为证据下界(ELBO),含重建损失和 KL 正则项
- 扩散模型(Diffusion):将生成过程建模为逐步去噪的马尔可夫链,前向过程施加高斯噪声,反向过程学习概率转移核
- 语言模型:大语言模型本质是对 token 序列的自回归条件概率分布 P(x_t | x_1,...,x_{t-1}) 建模
- 温度采样与 top-p:通过调节 softmax 温度或截断概率分布的尾部来控制采样的多样性与确定性
- 归一化流:通过可逆变换直接学习数据密度,利用换元公式计算精确似然
强化学习的概率基础
强化学习建立在马尔可夫决策过程(MDP)之上,其核心算法均依赖概率推断。
- 状态转移概率:P(s'|s, a) 描述环境动力学,是 MDP 的核心组成
- 策略(Policy):随机策略 π(a|s) 是给定状态下动作的条件概率分布
- 策略梯度:利用对数导数技巧(log-derivative trick)将期望梯度转化为可采样估计,REINFORCE 是其典型代表
- PPO 与 GRPO:现代 RLHF 算法通过比率 π/π_old 的裁剪控制策略更新幅度,防止分布偏移过大
- KL 惩罚:RLHF 训练中常用 KL(π‖π_ref) 约束微调策略不偏离参考策略太远,确保安全对齐
常见误区与辨析
概率论在 AI 应用中存在几类常见误区,需要特别注意。
- softmax 输出≠置信度:神经网络的 softmax 输出虽形如概率,但未经温度缩放等校准时通常过度自信
- KL 散度方向性:KL(P‖Q) ≠ KL(Q‖P),选错方向会导致截然不同的优化行为(均值覆盖 vs 众数覆盖)
- 概率 vs 似然:P(数据|参数) 作为参数的函数称为似然,与作为事件度量的概率数学形式相同但语义不同
- 分布假设失配:许多方法假设高斯或独立同分布,现实数据往往是长尾、多峰或强相关,忽视此点会导致模型失效
- 小样本频率估计不可靠:样本频率近似总体概率需要足够大的样本量,低资源场景须谨慎
发展脉络
概率论历经数百年演进,在 20 世纪与机器学习深度融合。
- 17 世纪:Pascal 与 Fermat 通信讨论赌博问题,奠定古典概率雏形
- 1763 年:Bayes 遗著由 Richard Price 整理发表,成为条件概率与贝叶斯推断的起点;注意 Bayes 本人约 1761 年去世,论文系遗作
- 1933 年:柯尔莫哥洛夫出版《概率论基础》,以测度论公理化概率,确立现代数学标准
- 1951 年:Kullback 与 Leibler 发表论文正式引入 KL 散度,奠定信息论与概率论交叉基础
- 1988 年:Judea Pearl 出版《智能系统中的概率推理》,将贝叶斯网络引入 AI,推动语音识别与 NLP 发展
- 2013 年:Kingma & Welling 发表 VAE,将变分推断引入深度学习,开启深度生成模型时代
- 2020 年:Ho et al. 发表 DDPM,扩散模型将随机过程理论推向图像生成主流
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「AI 里的不确定性」
- 「学 AI 躲不过的数学」
- 「跟 概率论 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「概率论」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
