核心要点

  • Q 函数含义

  • Bellman 更新

  • 探索 vs 利用

简要回答

Q(s,a) 表示在状态 s 做动作 a 的期望累积回报;用 TD 误差更新 Q 表,策略取 argmax_a Q(s,a),需 ε-greedy 探索。

标准回答

一、先把结论讲清楚

Q-Learning 更新:Q(s,a) ← Q(s,a) + α[r + γ max_a' Q(s',a') - Q(s,a)]。Off-policy:行为策略(探索)与学习策略(贪心)可分离。

二、拆开机制和判断点

表格型 只适用于小状态空间;DQN神经网络近似 Q 函数 + 经验回放 + 目标网络扩展到高维(如 Atari)。探索:ε-greedy 随机动作;

三、补上例子、边界和取舍

更优用 UCB、Thompson Sampling。

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背概念不会举例;混淆相似术语;忽略工程落地约束(成本、延迟、数据质量)。

追问

追问 1SARSA 和 Q-Learning 区别?

题库专题:SARSA 等时序差分方法与蒙特卡洛方法有何区别?

Q-Learning 是 off-policy,更新用 max Q(s',a');SARSA 是 on-policy,用实际采取的 a' 更新。SARSA 更保守,在悬崖行走等场景更安全。

题库延伸:与本追问相关的专题题 → SARSA 等时序差分方法与蒙特卡洛方法有何区别?

追问 2什么是 Double DQN?

题库专题:什么是 DQN 中的经验回放?为什么重要?

标准 DQN 用同一网络既选动作又估 Q 值,易高估(max 操作带来正偏差)。Double DQN 用在线网络选 a*,用目标网络估 Q(s',a*),解耦选择与评估,显著缓解 Q 值过估计。

题库延伸:与本追问相关的专题题 → 什么是 DQN 中的经验回放?为什么重要?

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习