核心要点
能写出 Q-Learning 更新公式
理解 off-policy、用 max 过后继动作
说明 model-free 的含义:不需要提前知道状态转移概率 P(next state | state, action)
知道收敛条件(表格、充分探索)
简要回答
Q-Learning 用 TD 误差更新 Q(s,a):Q ← Q + α[r + γ max Q(s',·) - Q(s,a)],无需环境转移模型,直接从交互样本学习最优动作价值。
标准回答
一、先给出结论和背景
- Q-Learning 更新:(离策略、model-free):
Q(s,a) ← Q(s,a) + α [ r + γ max_{a'} Q(s',a') - Q(s,a) ] - 工作流程:1. 在状态 s 用行为策略(常 ε-greedy)选动作 a
- 执行 a,观测 r, s'
- 用最优后继动作的 Q 值构造 TD 目标(不管实际下一步采取什么动作)
- 重复直至收敛
二、拆开关键步骤和判断点
- 为何 model-free:更新只需样本 (s,a,r,s'),不需要知道转移概率 P(s'|s,a) 或奖励模型 R(s,a)。与动态规划的价值迭代对比,DP 需完整模型。
- 收敛性:(表格情形):学习率满足 Robbins-Monro 条件且每个 (s,a) 被无限次访问时,Q 收敛到 Q*。
三、补上落地边界和取舍
回答思路
【定义】用一句话说清「Q-Learning 如何工作?为何属于无模型方法」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:深度 Q 网络、RL 算法概览。术语:Q-Learning、DQN、时序差分学习。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:把 model-free 误解为「不需要数据」;更新公式中 max 与 SARSA 混淆;忽视探索充分性条件。
追问
追问 1:Q-Learning 和 SARSA 更新有何不同?
Q-Learning 用 max_{a'} Q(s',a')(off-policy,学最优);SARSA 用实际采取的 a' 的 Q(s',a')(on-policy,学当前行为策略)。悬崖行走中 SARSA 更保守安全。
追问 2:为什么叫 off-policy?
行为策略(如 ε-greedy 探索)与目标策略(greedy w.r.t. Q)可以不同;更新目标按最优策略构造,因此学的是 Q* 而非当前行为策略的 Q^π。
追问 3:函数近似时 Q-Learning 还会收敛吗?
一般不保证;可能出现发散(deadly triad:函数近似 + bootstrapping + off-policy)。需经验回放、目标网络、Double DQN 等工程技巧稳定训练。
🔗 相似问题
同一考点的不同问法,换着练更稳
延伸学习
按主题分类的相关资源,便于系统复习
