强化学习(RL)

强化学习

试错学策略

亦作、亦称:RL

强化学习(Reinforcement Learning,RL)是机器学习的核心范式之一:智能体通过与环境反复交互、接收奖励或惩罚信号,学会最大化长期累积回报的行为策略。它不依赖人工标注数据,而是从「行动→反馈→调整」的闭环经验中自主学习,是 AlphaGo 围棋突破、DQN 游戏超人类表现以及大语言模型 RLHF 对齐等里程碑成果的核心驱动力。

概述

强化学习(Reinforcement Learning,RL)是机器学习的核心范式之一:智能体通过与环境反复交互、接收奖励或惩罚信号,学会最大化长期累积回报的行为策略。它不依赖人工标注数据,而是从「行动→反馈→调整」的闭环经验中自主学习,是 AlphaGo 围棋突破、DQN 游戏超人类表现以及大语言模型 RLHF 对齐等里程碑成果的核心驱动力。

核心要素

强化学习的框架由五个相互作用的核心要素构成,理解它们是掌握整个范式的基础。

  • 智能体(Agent)做出决策的学习主体,观察环境状态并执行动作。
    -
    环境(Environment) 接收智能体动作并返回新状态与奖励信号的外部系统。
    -状态(State)与马尔可夫决策过程(MDP)环境的当前描述,RL 问题通常形式化为 MDP,满足马尔可夫性(当前状态包含决策所需的全部信息)。
    -
    奖励(Reward) 环境对智能体行为的即时反馈,正值鼓励、负值惩罚;奖励函数设计直接决定策略上限。
    -策略(Policy)从状态到动作的映射,是 RL 优化的核心目标; 探索(Exploration)与利用(Exploitation)的权衡贯穿整个训练过程。

主流算法家族

现代 RL 算法沿三条主线演进,核心差异在于「如何估计行动价值并更新策略」。

  • 基于值函数(Value-Based):学习 Q(s,a) 估计长期价值,再贪婪选动作;代表算法 Q-Learning(Watkins,1989)和 DQN(DeepMind,2013),适合离散动作空间。
  • 策略梯度(Policy Gradient):直接对策略参数求梯度并优化期望回报;代表算法 REINFORCE 和 PPO(Proximal Policy Optimization,OpenAI,2017),适合连续动作空间,PPO 是 RLHF 流程的主力算法。
  • 演员-评论家(Actor-Critic):策略网络(Actor)和值函数网络(Critic)协同工作;代表算法 A3C、SAC(Soft Actor-Critic)、TD3,兼顾收敛速度与稳定性。
  • 有模型 vs 无模型:无模型方法直接从交互中学习,实现简单;有模型方法先学环境动力学再规划,样本效率更高,代表工作有 Dreamer 系列。

发展脉络

RL 融合了最优控制、心理学试错理论和深度学习三条脉络,历经数十年演进。

  • 1950 年代:Bellman 提出动态规划与贝尔曼方程,奠定价值估计的数学基础。
  • 1988 年:Sutton 提出时序差分学习(TD Learning),统一动态规划与蒙特卡洛思想。
  • 1989 年:Watkins 提出 Q-Learning,首个完整的无模型 RL 算法,并于 1992 年给出收敛性证明。
  • 1998 年:Sutton & Barto 出版《Reinforcement Learning: An Introduction》,成为领域奠基教材。
  • 2013 年:DeepMind 发表 DQN 论文,首次将深度卷积网络引入 RL,仅凭像素输入在多款 Atari 游戏中超越人类水平,开启深度 RL 时代。
  • 2016 年:DeepMind AlphaGo 击败李世石,RL 加蒙特卡洛树搜索(MCTS)引发全球关注。
  • 2017 年:OpenAI 提出 PPO,成为工业界最广泛使用的策略梯度算法。
  • 2022 年至今RLHF 成为 ChatGPT、Claude 等 LLM 后训练对齐的核心技术;GRPO(DeepSeek-R1)、DPO 等变体持续涌现,RL 全面进入 NLP 主流研究。

与大模型对齐的关系

强化学习已成为训练可控、安全大语言模型不可或缺的一环,催生了一批新范式。

  • RLHF 标准流程:先用监督微调(SFT)训练基础模型,再训练奖励模型评估输出质量,最后用 PPO 优化语言模型策略使奖励最大化。
  • 奖励黑客(Reward Hacking):模型发现「欺骗」奖励模型而非真正满足人类意图的捷径,是对齐研究持续面对的核心难题。
  • 直接偏好优化(DPO):将 RLHF 简化为离线分类损失,无需显式奖励模型与在线采样,降低训练复杂度,但灵活性较低。
  • GRPO:Group Relative Policy Optimization,DeepSeek-R1 采用的高效变体,以组内相对奖励替代评论家网络,显著降低显存占用。

应用场景

RL 的落地范围已从游戏扩展到机器人、科学发现和语言模型对齐。

  • 游戏与博弈:AlphaGo/AlphaZero(围棋)、OpenAI Five(Dota 2,2019 年击败职业选手)、DQN(Atari)是标志性成果。
  • 机器人控制:训练机械臂操作、四足机器人步态(如 ETH Zurich ANYmal)、无人机自主飞行;实际数据采集成本高是主要挑战。
  • 工程与科学优化:Google 用 RL 优化芯片布局设计(2021)、推荐系统实时策略调整、程序合成与自动代码生成。
  • LLM 推理增强:DeepSeek-R1、OpenAI o 系列等推理模型通过 RL 训练提升数学、编程等复杂推理能力。

局限与挑战

尽管成果卓越,RL 在工程落地中仍面临若干根本性难题,需要谨慎对待。

  • 稀疏奖励困境:只有任务完成才给奖励时,随机探索极难触发有效信号;常用奖励塑形(Reward Shaping)、课程学习、内在动机(计数探索、好奇心奖励)缓解。
  • 样本效率低:复杂任务通常需要数百万至数十亿步交互;在真实物理机器人上采集数据代价极高,是产业化的主要瓶颈。
  • 训练不稳定:值函数估计偏差与策略更新步长过大均可导致性能骤降,超参数和随机种子高度敏感,可复现性差是领域公认难题。
  • 泛化能力弱:在训练环境中学到的策略往往难以迁移到轻微变化的新环境(过拟合环境),域随机化(Domain Randomization)是常用缓解手段。

常见误解

日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。

  • 「试错学策略」
  • 「强化学习术语」
  • 「跟 强化学习 是一回事吗」

相关术语

和本术语关联紧密的其他词条,便于串联理解。

🎯 考点练习

含该术语的高频面试题,含标准答案与追问。

延伸阅读

从知识库精选 2 篇文章,帮助深入理解该术语。

  1. 1

    强化学习入门:MDP 与 Bellman 方程

    从马尔可夫决策过程到值迭代,理解强化学习的数学基础

  2. 2

    PPO:近端策略优化

    从裁剪目标到信任区域,掌握最流行的强化学习算法

外部参考

维基百科:查看「强化学习」词条

本页内容为本站原创撰写;维基百科链接仅作延伸参考。