损失函数

损失函数

模型考多少分的标准

损失函数是衡量模型预测值与真实标签之间差距的标量函数,训练过程的核心目标就是通过优化算法最小化这一差距。它既是统计决策理论中的经典概念,也是现代深度学习的基石。

概述

损失函数是衡量模型预测值与真实标签之间差距的标量函数,训练过程的核心目标就是通过优化算法最小化这一差距。它既是统计决策理论中的经典概念,也是现代深度学习的基石。

基本定义

损失函数将预测误差量化为可微的标量,使梯度下降能够系统地调整模型参数。

  • 输入:模型预测值 ŷ 与真实标签 y
  • 输出:非负实数,越小表示预测越准
  • 可微性:大多数常用损失函数对参数可微,从而支持反向传播
  • 与代价函数的关系:「代价函数」通常指对整个数据集的平均损失,「损失函数」一般指单样本损失
  • 与评估指标的区别:损失函数需可微以服务于梯度优化,评估指标(如准确率、F1)可以不可微,是对业务目标的直接度量

分类任务常用损失

分类任务需要将离散标签与概率分布对齐,以下损失函数最为常见。

  • 交叉熵损失(Cross-Entropy Loss):衡量预测概率分布与真实分布的 KL 散度,是多分类任务的标准选择,也是大语言模型预训练(next-token prediction)的基础目标
  • 二元交叉熵(Binary CE):适用于二分类或多标签分类场景
  • Focal Loss:Lin et al.(2017)在 RetinaNet 论文中提出,对高置信度简单样本降低权重,使训练聚焦于难样本,缓解类别不平衡
  • Hinge Loss:支持向量机(SVM)的核心损失,最大化决策边界间隔

回归任务常用损失

回归任务需要衡量连续预测值的偏差,不同损失函数对离群点的容忍度不同。

  • 均方误差(MSE / L2 Loss):对大误差惩罚更重,对离群点敏感,是最经典的回归损失
  • 平均绝对误差(MAE / L1 Loss):对离群点更鲁棒,但在零点不可微
  • Huber Loss:结合 L1 与 L2 优点,小误差用 L2、大误差用 L1,兼顾平滑性与鲁棒性
  • Log-Cosh Loss:近似 Huber Loss,但处处可微,更适合二阶优化方法

度量学习与对比损失

对比学习和度量学习需要约束样本在嵌入空间中的相对距离,专用损失函数应运而生。

  • 对比损失(Contrastive Loss):由 Hadsell et al. 于 2005 年提出,拉近同类样本、推远异类样本,原始应用于降维
  • 三元组损失(Triplet Loss):2015 年 Google FaceNet 论文引入,以「锚点-正例-负例」三元组为单位训练,边界比对比损失更明确
  • InfoNCE Loss:对比学习主流损失,SimCLR、CLIP 等模型广泛采用,将正样本对与大量负样本对比
  • NT-Xent:InfoNCE 的归一化温度缩放版本,SimCLR 的具体实现形式

强化学习与对齐中的损失

强化学习及大语言模型对齐依赖特殊的损失设计,直接影响模型行为的价值取向。

  • 策略梯度损失(Policy Gradient):最大化期望累积奖励,等价于最小化负对数概率加权奖励
  • PPO Clip 损失:通过概率比裁剪约束策略更新步长,避免训练不稳定,是 RLHF 的主流实现
  • DPO 损失(Direct Preference Optimization):将人类偏好数据直接转化为对数概率差的最大化,无需单独奖励模型
  • GRPO 损失:基于组内相对奖励归一化,计算效率更高,用于 DeepSeek-R1 等模型的高效 RL 微调

常见误区

损失函数的选择和使用中存在几个高频误区,需要特别注意。

  • 损失下降 ≠ 任务完成:训练损失持续下降并不等于模型泛化良好,需同步监控验证集损失和真实评估指标
  • MSE 用于分类:分类任务若误用 MSE 会导致梯度饱和,交叉熵在预测错误时梯度更大,收敛更快
  • 代理损失与真实目标的偏差:损失函数只是真实目标的可微近似,用交叉熵优化的模型未必在 BLEU 或 ROUGE 上最优,这是 RLHF 等对齐方法兴起的根本动因
  • 多任务损失权重:同时优化多个损失项时,各项量级可能相差悬殊,需仔细调整权重或使用自适应多任务损失策略

发展脉络

损失函数的演进与机器学习范式的变革密切相关。

  • 1805:Legendre、Gauss 提出最小二乘法,均方误差损失的数学雏形
  • 20 世纪中叶:Abraham Wald 在统计决策理论中系统化「损失函数」概念,这也是该术语在现代意义上的正式来源
  • 1986:Rumelhart et al. 将反向传播与可微损失结合,确立现代神经网络训练范式
  • 2005:Hadsell et al. 提出对比损失,开创度量学习损失研究
  • 2015:Schroff et al.(Google)在 FaceNet 中引入三元组损失,推动人脸识别突破
  • 2017:Lin et al. 提出 Focal Loss(RetinaNet),解决目标检测中的类别不平衡问题
  • 2020:Chen et al. 的 SimCLR 系统化 InfoNCE Loss;CLIP(2021)将对比损失扩展至图文跨模态对齐
  • 2023 至今DPOGRPO 等新型损失随 LLM 对齐浪潮涌现,损失设计成为对齐研究核心议题

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「模型考多少分的标准」
  • 「机器学习基础概念」
  • 「跟 损失函数 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    机器学习基础:从线性模型到决策树

    机器学习入门必读。涵盖线性回归、逻辑回归、决策树、KNN、SVM 等核心算法,从数学原理到 Python 实战,配合对比表格和可视化图解,帮你建立完整的 ML 知识框架。

  2. 2

    反向传播:神经网络如何学习

    深入理解反向传播算法的数学原理、计算图实现和训练中的关键问题

外部参考

维基百科:查看「损失函数」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。