损失函数
损失函数模型考多少分的标准
损失函数是衡量模型预测值与真实标签之间差距的标量函数,训练过程的核心目标就是通过优化算法最小化这一差距。它既是统计决策理论中的经典概念,也是现代深度学习的基石。
概述
损失函数是衡量模型预测值与真实标签之间差距的标量函数,训练过程的核心目标就是通过优化算法最小化这一差距。它既是统计决策理论中的经典概念,也是现代深度学习的基石。
基本定义
损失函数将预测误差量化为可微的标量,使梯度下降能够系统地调整模型参数。
- 输入:模型预测值 ŷ 与真实标签 y
- 输出:非负实数,越小表示预测越准
- 可微性:大多数常用损失函数对参数可微,从而支持反向传播
- 与代价函数的关系:「代价函数」通常指对整个数据集的平均损失,「损失函数」一般指单样本损失
- 与评估指标的区别:损失函数需可微以服务于梯度优化,评估指标(如准确率、F1)可以不可微,是对业务目标的直接度量
分类任务常用损失
分类任务需要将离散标签与概率分布对齐,以下损失函数最为常见。
- 交叉熵损失(Cross-Entropy Loss):衡量预测概率分布与真实分布的 KL 散度,是多分类任务的标准选择,也是大语言模型预训练(next-token prediction)的基础目标
- 二元交叉熵(Binary CE):适用于二分类或多标签分类场景
- Focal Loss:Lin et al.(2017)在 RetinaNet 论文中提出,对高置信度简单样本降低权重,使训练聚焦于难样本,缓解类别不平衡
- Hinge Loss:支持向量机(SVM)的核心损失,最大化决策边界间隔
回归任务常用损失
回归任务需要衡量连续预测值的偏差,不同损失函数对离群点的容忍度不同。
- 均方误差(MSE / L2 Loss):对大误差惩罚更重,对离群点敏感,是最经典的回归损失
- 平均绝对误差(MAE / L1 Loss):对离群点更鲁棒,但在零点不可微
- Huber Loss:结合 L1 与 L2 优点,小误差用 L2、大误差用 L1,兼顾平滑性与鲁棒性
- Log-Cosh Loss:近似 Huber Loss,但处处可微,更适合二阶优化方法
度量学习与对比损失
对比学习和度量学习需要约束样本在嵌入空间中的相对距离,专用损失函数应运而生。
- 对比损失(Contrastive Loss):由 Hadsell et al. 于 2005 年提出,拉近同类样本、推远异类样本,原始应用于降维
- 三元组损失(Triplet Loss):2015 年 Google FaceNet 论文引入,以「锚点-正例-负例」三元组为单位训练,边界比对比损失更明确
- InfoNCE Loss:对比学习主流损失,SimCLR、CLIP 等模型广泛采用,将正样本对与大量负样本对比
- NT-Xent:InfoNCE 的归一化温度缩放版本,SimCLR 的具体实现形式
强化学习与对齐中的损失
强化学习及大语言模型对齐依赖特殊的损失设计,直接影响模型行为的价值取向。
- 策略梯度损失(Policy Gradient):最大化期望累积奖励,等价于最小化负对数概率加权奖励
- PPO Clip 损失:通过概率比裁剪约束策略更新步长,避免训练不稳定,是 RLHF 的主流实现
- DPO 损失(Direct Preference Optimization):将人类偏好数据直接转化为对数概率差的最大化,无需单独奖励模型
- GRPO 损失:基于组内相对奖励归一化,计算效率更高,用于 DeepSeek-R1 等模型的高效 RL 微调
常见误区
损失函数的选择和使用中存在几个高频误区,需要特别注意。
- 损失下降 ≠ 任务完成:训练损失持续下降并不等于模型泛化良好,需同步监控验证集损失和真实评估指标
- MSE 用于分类:分类任务若误用 MSE 会导致梯度饱和,交叉熵在预测错误时梯度更大,收敛更快
- 代理损失与真实目标的偏差:损失函数只是真实目标的可微近似,用交叉熵优化的模型未必在 BLEU 或 ROUGE 上最优,这是 RLHF 等对齐方法兴起的根本动因
- 多任务损失权重:同时优化多个损失项时,各项量级可能相差悬殊,需仔细调整权重或使用自适应多任务损失策略
发展脉络
损失函数的演进与机器学习范式的变革密切相关。
- 1805:Legendre、Gauss 提出最小二乘法,均方误差损失的数学雏形
- 20 世纪中叶:Abraham Wald 在统计决策理论中系统化「损失函数」概念,这也是该术语在现代意义上的正式来源
- 1986:Rumelhart et al. 将反向传播与可微损失结合,确立现代神经网络训练范式
- 2005:Hadsell et al. 提出对比损失,开创度量学习损失研究
- 2015:Schroff et al.(Google)在 FaceNet 中引入三元组损失,推动人脸识别突破
- 2017:Lin et al. 提出 Focal Loss(RetinaNet),解决目标检测中的类别不平衡问题
- 2020:Chen et al. 的 SimCLR 系统化 InfoNCE Loss;CLIP(2021)将对比损失扩展至图文跨模态对齐
- 2023 至今:DPO、GRPO 等新型损失随 LLM 对齐浪潮涌现,损失设计成为对齐研究核心议题
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「模型考多少分的标准」
- 「机器学习基础概念」
- 「跟 损失函数 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「损失函数」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
