强化学习(RL)
强化学习试错学策略
亦作、亦称:RL
强化学习(Reinforcement Learning,RL)是机器学习的核心范式之一:智能体通过与环境反复交互、接收奖励或惩罚信号,学会最大化长期累积回报的行为策略。它不依赖人工标注数据,而是从「行动→反馈→调整」的闭环经验中自主学习,是 AlphaGo 围棋突破、DQN 游戏超人类表现以及大语言模型 RLHF 对齐等里程碑成果的核心驱动力。
概述
强化学习(Reinforcement Learning,RL)是机器学习的核心范式之一:智能体通过与环境反复交互、接收奖励或惩罚信号,学会最大化长期累积回报的行为策略。它不依赖人工标注数据,而是从「行动→反馈→调整」的闭环经验中自主学习,是 AlphaGo 围棋突破、DQN 游戏超人类表现以及大语言模型 RLHF 对齐等里程碑成果的核心驱动力。
核心要素
强化学习的框架由五个相互作用的核心要素构成,理解它们是掌握整个范式的基础。
- 智能体(Agent):做出决策的学习主体,观察环境状态并执行动作。
- 环境(Environment): 接收智能体动作并返回新状态与奖励信号的外部系统。
-状态(State)与马尔可夫决策过程(MDP):环境的当前描述,RL 问题通常形式化为 MDP,满足马尔可夫性(当前状态包含决策所需的全部信息)。
- 奖励(Reward): 环境对智能体行为的即时反馈,正值鼓励、负值惩罚;奖励函数设计直接决定策略上限。
-策略(Policy):从状态到动作的映射,是 RL 优化的核心目标; 探索(Exploration)与利用(Exploitation)的权衡贯穿整个训练过程。
主流算法家族
现代 RL 算法沿三条主线演进,核心差异在于「如何估计行动价值并更新策略」。
- 基于值函数(Value-Based):学习 Q(s,a) 估计长期价值,再贪婪选动作;代表算法 Q-Learning(Watkins,1989)和 DQN(DeepMind,2013),适合离散动作空间。
- 策略梯度(Policy Gradient):直接对策略参数求梯度并优化期望回报;代表算法 REINFORCE 和 PPO(Proximal Policy Optimization,OpenAI,2017),适合连续动作空间,PPO 是 RLHF 流程的主力算法。
- 演员-评论家(Actor-Critic):策略网络(Actor)和值函数网络(Critic)协同工作;代表算法 A3C、SAC(Soft Actor-Critic)、TD3,兼顾收敛速度与稳定性。
- 有模型 vs 无模型:无模型方法直接从交互中学习,实现简单;有模型方法先学环境动力学再规划,样本效率更高,代表工作有 Dreamer 系列。
发展脉络
RL 融合了最优控制、心理学试错理论和深度学习三条脉络,历经数十年演进。
- 1950 年代:Bellman 提出动态规划与贝尔曼方程,奠定价值估计的数学基础。
- 1988 年:Sutton 提出时序差分学习(TD Learning),统一动态规划与蒙特卡洛思想。
- 1989 年:Watkins 提出 Q-Learning,首个完整的无模型 RL 算法,并于 1992 年给出收敛性证明。
- 1998 年:Sutton & Barto 出版《Reinforcement Learning: An Introduction》,成为领域奠基教材。
- 2013 年:DeepMind 发表 DQN 论文,首次将深度卷积网络引入 RL,仅凭像素输入在多款 Atari 游戏中超越人类水平,开启深度 RL 时代。
- 2016 年:DeepMind AlphaGo 击败李世石,RL 加蒙特卡洛树搜索(MCTS)引发全球关注。
- 2017 年:OpenAI 提出 PPO,成为工业界最广泛使用的策略梯度算法。
- 2022 年至今:RLHF 成为 ChatGPT、Claude 等 LLM 后训练对齐的核心技术;GRPO(DeepSeek-R1)、DPO 等变体持续涌现,RL 全面进入 NLP 主流研究。
与大模型对齐的关系
强化学习已成为训练可控、安全大语言模型不可或缺的一环,催生了一批新范式。
- RLHF 标准流程:先用监督微调(SFT)训练基础模型,再训练奖励模型评估输出质量,最后用 PPO 优化语言模型策略使奖励最大化。
- 奖励黑客(Reward Hacking):模型发现「欺骗」奖励模型而非真正满足人类意图的捷径,是对齐研究持续面对的核心难题。
- 直接偏好优化(DPO):将 RLHF 简化为离线分类损失,无需显式奖励模型与在线采样,降低训练复杂度,但灵活性较低。
- GRPO:Group Relative Policy Optimization,DeepSeek-R1 采用的高效变体,以组内相对奖励替代评论家网络,显著降低显存占用。
应用场景
RL 的落地范围已从游戏扩展到机器人、科学发现和语言模型对齐。
- 游戏与博弈:AlphaGo/AlphaZero(围棋)、OpenAI Five(Dota 2,2019 年击败职业选手)、DQN(Atari)是标志性成果。
- 机器人控制:训练机械臂操作、四足机器人步态(如 ETH Zurich ANYmal)、无人机自主飞行;实际数据采集成本高是主要挑战。
- 工程与科学优化:Google 用 RL 优化芯片布局设计(2021)、推荐系统实时策略调整、程序合成与自动代码生成。
- LLM 推理增强:DeepSeek-R1、OpenAI o 系列等推理模型通过 RL 训练提升数学、编程等复杂推理能力。
局限与挑战
尽管成果卓越,RL 在工程落地中仍面临若干根本性难题,需要谨慎对待。
- 稀疏奖励困境:只有任务完成才给奖励时,随机探索极难触发有效信号;常用奖励塑形(Reward Shaping)、课程学习、内在动机(计数探索、好奇心奖励)缓解。
- 样本效率低:复杂任务通常需要数百万至数十亿步交互;在真实物理机器人上采集数据代价极高,是产业化的主要瓶颈。
- 训练不稳定:值函数估计偏差与策略更新步长过大均可导致性能骤降,超参数和随机种子高度敏感,可复现性差是领域公认难题。
- 泛化能力弱:在训练环境中学到的策略往往难以迁移到轻微变化的新环境(过拟合环境),域随机化(Domain Randomization)是常用缓解手段。
常见误解
日常交流中容易听到的简化说法,未必准确,但能帮助理解误解从何而来。
- 「试错学策略」
- 「强化学习术语」
- 「跟 强化学习 是一回事吗」
相关术语
和本术语关联紧密的其他词条,便于串联理解。
🎯 考点练习
含该术语的高频面试题,含标准答案与追问。
- 高级概念查看详解 →
强化学习中的马尔可夫决策过程(MDP)是什么?
MDP 用状态、动作、转移概率、奖励和折扣因子形式化序贯决策;马尔可夫性假设使 Bellman 递推与动态规划成为可能。
- 中级概念查看详解 →
强化学习中智能体、环境、状态、动作与奖励分别指什么?
[Agent](/glossary/agent) 根据 [策略](/glossary/policy) 选动作作用于环境,环境返回新状态与标量奖励,形成感知-决策-反馈闭环。
- 高级概念查看详解 →
蒙特卡洛方法在强化学习中如何应用?
蒙特卡洛方法用完整 [回合](/glossary/episode) 的实际累积 [回报](/glossary/return) G_t 作为价值估计目标,无偏但方差大,需 episode 结束后才能更新。
- 中级概念查看详解 →
基于模型与无模型强化学习有何区别?
Model-free 直接从交互学价值/策略,不建环境模型(DQN、PPO);model-based 先学模型再规划(MCTS、MPC),样本效率高但受模型误差制约。
延伸阅读
从知识库精选 2 篇文章,帮助深入理解该术语。
外部参考
维基百科:查看「强化学习」词条本页内容为本站原创撰写;维基百科链接仅作延伸参考。
