核心要点
Q 函数含义
Bellman 更新
探索 vs 利用
标准回答
一、先把结论讲清楚
Q-Learning 更新:Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)]。Off-policy:行为策略(探索)与学习策略(贪心)可分离。
二、拆开机制和判断点
表格型 只适用于小状态空间;DQN 用神经网络近似 Q 函数 + 经验回放 + 目标网络扩展到高维(如 Atari)。探索:ε-greedy 随机动作;
三、补上例子、边界和取舍
更优用 UCB、Thompson Sampling。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。
追问
追问 1:SARSA 和 Q-Learning 区别?
题库专题:SARSA 等时序差分方法与蒙特卡洛方法有何区别?Q-Learning 是 off-policy,更新用 max Q(s',a');SARSA 是 on-policy,用实际采取的 a' 更新。SARSA 更保守,在悬崖行走等场景更安全。
题库延伸:与本追问相关的专题题 → SARSA 等时序差分方法与蒙特卡洛方法有何区别?
追问 2:什么是 Double DQN?
题库专题:什么是 DQN 中的经验回放?为什么重要?标准 DQN 用同一网络既选动作又估 Q 值,易高估(max 操作带来正偏差)。Double DQN 用在线网络选 a*,用目标网络估 Q(s',a*),解耦选择与评估,显著缓解 Q 值过估计。
题库延伸:与本追问相关的专题题 → 什么是 DQN 中的经验回放?为什么重要?
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
