核心要点

  • 能说明 Q-Learning 与深度网络结合解决维度灾难

  • 理解经验回放、目标网络、ε-greedy 三大稳定技巧

  • 能对比表格 Q 与函数近似的优劣

  • 知道 DQN 局限(离散动作、高估偏差)及 Double DQN 等改进

简要回答

DQN神经网络近似 Q(s,a),配合经验回放与目标网络,把 Q-Learning 扩展到高维状态空间,是深度强化学习的里程碑算法。

标准回答

一、核心思想

强化学习Q-Learning 维护 Q(s,a) 表;当状态空间高维(如 Atari 像素帧)时表格不可行。DQN(Mnih et al., 2015)用 神经网络 Q_θ(s,a) 做函数近似。

二、拆开机制和判断点

  1. 经验回放(Experience Replay):把转移 (s,a,r,s') 存入缓冲区,随机 mini-batch 采样,打破序列相关性、提高样本效率。
  2. 目标网络:用滞后参数 θ⁻ 计算 TD 目标 y = r + γ max Q(s',·;θ⁻),减少自举带来的震荡。
  3. ε-greedy 探索:以 ε 概率随机动作,平衡探索与利用。

三、损失

L = E[(y - Q(s,a;θ))²],用 SGD/Adam 更新 θ。

四、工程实践

常用 Gymnasium 环境 + PyTorch/TensorFlow 实现;仿真充分验证后再考虑真实部署。详见 深度 Q 网络

回答思路

  • 【定义】用一句话说清「什么是深度 Q 网络(DQN)?它如何结合强化学习与深度神经网络」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:强化学习入门DQN 详解。术语:DQNQ-Learning优先经验回放。工具:Gymnasium

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:只背「神经网络+Q 表」却说不清经验回放与目标网络各自解决什么问题;把 DQN 当成监督学习回归而忽略 bootstrapping 与分布偏移。

追问

追问 1DQN 为什么会出现 Q 值高估?

max 操作同时用于选动作和估值,噪声会被系统性放大。Double DQN 用在线网络选动作、目标网络估值,缓解高估;Dueling DQN 分离状态价值 V(s) 与优势 A(s,a) 进一步稳定学习。

追问 2DQN 能直接处理连续动作空间吗?

标准 DQN 针对离散动作做 argmax。连续控制需 DDPG、TD3、SAC 等 Actor-Critic 方法,或用动作离散化(精度受限)。面试应说明问题域与算法匹配。

追问 3目标网络多久同步一次?

常见做法每 C 步(如 1000~10000)硬拷贝 θ⁻ ← θ,或 Polyak 软更新 θ⁻ ← τθ + (1-τ)θ⁻。C 过小训练不稳,过大学习慢,需按环境调参。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习