核心要点

  • 能写出 Q-Learning 更新公式

  • 理解 off-policy、用 max 过后继动作

  • 说明 model-free 的含义:不需要提前知道状态转移概率 P(next state | state, action)

  • 知道收敛条件(表格、充分探索)

简要回答

Q-Learning 用 TD 误差更新 Q(s,a):Q ← Q + α[r + γ max Q(s',·) - Q(s,a)],无需环境转移模型,直接从交互样本学习最优动作价值。

标准回答

一、先给出结论和背景

  • Q-Learning 更新:(离策略、model-free):
    Q(s,a) ← Q(s,a) + α [ r + γ max_{a'} Q(s',a') - Q(s,a) ]
  • 工作流程:1. 在状态 s 用行为策略(常 ε-greedy)选动作 a
  1. 执行 a,观测 r, s'
  2. 最优后继动作的 Q 值构造 TD 目标(不管实际下一步采取什么动作)
  3. 重复直至收敛

二、拆开关键步骤和判断点

  • 为何 model-free:更新只需样本 (s,a,r,s'),不需要知道转移概率 P(s'|s,a) 或奖励模型 R(s,a)。与动态规划的价值迭代对比,DP 需完整模型。
  • 收敛性:(表格情形):学习率满足 Robbins-Monro 条件且每个 (s,a) 被无限次访问时,Q 收敛到 Q*。

三、补上落地边界和取舍

回答思路

  • 【定义】用一句话说清「Q-Learning 如何工作?为何属于无模型方法」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把 model-free 误解为「不需要数据」;更新公式中 max 与 SARSA 混淆;忽视探索充分性条件。

追问

追问 1Q-Learning 和 SARSA 更新有何不同?

Q-Learning 用 max_{a'} Q(s',a')(off-policy,学最优);SARSA 用实际采取的 a' 的 Q(s',a')(on-policy,学当前行为策略)。悬崖行走中 SARSA 更保守安全。

追问 2为什么叫 off-policy?

行为策略(如 ε-greedy 探索)与目标策略(greedy w.r.t. Q)可以不同;更新目标按最优策略构造,因此学的是 Q* 而非当前行为策略的 Q^π。

追问 3函数近似时 Q-Learning 还会收敛吗?

一般不保证;可能出现发散(deadly triad:函数近似 + bootstrapping + off-policy)。需经验回放、目标网络、Double DQN 等工程技巧稳定训练。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习