核心要点

  • 能清晰对比是否显式学习环境模型

  • 各举 2~3 个代表算法:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

  • 理解样本效率 vs 渐近性能 trade-off

  • 知道实际系统常混合使用:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。

简要回答

Model-free 直接从交互学价值/策略,不建环境模型(DQNPPO);model-based 先学模型再规划(MCTS、MPC),样本效率高但受模型误差制约。

标准回答

一、核心回答

维度 Model-free Model-based
环境模型 不显式学习 P,R 学习 P̂,R̂ 或隐式动力学
决策方式 查 Q / 采样 π 模型内规划、rollout
样本效率 较低 较高
渐近性能 无模型偏差上限 受模型误差限制
代表 Q-Learning, DQN, PPO, SAC Dyna-Q, PETS, MuZero, AlphaZero

二、Model-free

直接从 (s,a,r,s') 更新 Q 或 ∇J(π),简单通用,适合模型难建但交互相对便宜的场景(Atari、LLM RLHF)。

三、Model-based

适合交互昂贵(机器人、工业控制)、可仿真或物理模型近似好的场景。

四、实践趋势

MB-MF 混合——用模型生成合成数据预训练,model-free 在线微调;或 Dreamer 等在潜空间做 model-based 想象训练。
详见 强化学习入门RL 算法概览

回答思路

  • 【定义】用一句话说清「基于模型与无模型强化学习

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 算法概览强化学习入门。术语:世界模型Q-LearningPPO

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:绝对化「model-based 一定更好」;不把 compounding error 和 sim-to-real 作为核心风险提及。

追问

追问 1AlphaZero 算 model-based 吗?

用已知游戏规则作为完美模型 + MCTS 规划,属于 model-based。AlphaGo 早期版本还结合人类棋谱(模仿学习)。

追问 2何时选 model-free 更合适?

环境复杂难建模(高维视觉)、仿真器不可靠、或已有大量离线数据且 off-policy 方法可行时,model-free(DQN/SAC/PPO)更务实。

追问 3Sim-to-real gap 如何影响 model-based?

仿真模型与真实物理不一致,在仿真中优化的策略迁移失败。需域随机化、系统辨识、真实数据微调模型或混合真实交互。

🔗 相似问题

同一考点的不同问法,换着练更稳

没找到想看的面试题?把你想看的告诉我们 →

延伸学习

按主题分类的相关资源,便于系统复习