核心要点

  • 能准确定义五要素及其交互循环

  • 理解状态 vs 观测(部分可观测)

  • 知道奖励设计对学习目标的影响

  • 能画 agent-environment 交互图

简要回答

Agent 根据 策略 选动作作用于环境,环境返回新状态与标量奖励,形成感知-决策-反馈闭环。

标准回答

一、五要素定义

术语 含义
Agent智能体 决策者,含策略 π,选动作
Environment(环境) Agent 外部的一切,含状态转移与奖励规则
State(状态) 对世界某时刻的充分描述 s ∈ S
Action(动作) Agent 可执行的选择 a ∈ A
Reward(奖励) 环境反馈的标量信号 r,定义「好坏」

二、交互循环

(每步 t):

  1. Agent 观测 S_t(或观测 O_t)
  2. 选 A_t ~ π(·|S_t)
  3. 环境执行:S_{t+1} ~ P(·|S_t,A_t),给出 R_{t+1}
  4. Agent 用 (S_t,A_t,R_{t+1},S_{t+1}) 更新

三、注意

奖励是人为设计的优化目标,不等于真实目标;错误奖励导致 reward hacking。详见 强化学习入门

回答思路

  • 【定义】用一句话说清「强化学习中智能体、环境、状态、动作与奖励分别」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:强化学习入门RL 指南。术语:Agent策略Episode

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把环境当成「数据集」;奖励与回报(累积奖励)混淆;忽略 Agent 边界如何划定(多 Agent 系统)。

追问

追问 1状态和观测有何区别?

状态 s 是环境的完整描述(MDP);观测 o 是智能体实际感知,可能不完整(POMDP)。如机器人摄像头像素是观测,真实位姿是状态。

追问 2动作空间有哪些类型?

离散(上下左右)、连续(转向角、油门)、混合、分层(高层选子目标、低层执行)。算法选型依赖动作空间类型。

追问 3稀疏奖励如何处理?

奖励塑形、好奇心探索、模仿学习初始化、HER(目标重标记)、课程学习逐步增加难度。需警惕塑形改变最优策略。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习