核心要点

  • 能定义 model-based = 学/用环境模型规划

  • 列举样本效率高、可规划等优势

  • 说明模型误差累积、难建模等劣势

  • 知道 MB-MF 混合与 MuZero 等代表

简要回答

Model-based RL 学习环境动力学模型 ŝ'=f(s,a),用规划(如 MPC)选动作;样本效率高但受模型误差影响,复杂环境建模难。

标准回答

一、Model-based RL(基于模型)

学习转移模型 P̂(s'|s,a) 和/或奖励模型 R̂,用模型做规划(rollout、MPC、MCTS)选动作。

二、说明优势成立的前提

优势 说明
样本效率 可在模型中仿真大量轨迹,减少真实交互
规划能力 MCTS(AlphaGo)、MPC 可深搜多步
可解释 模型可检视、调试
安全 仿真中试错,降低真实风险

三、劣势

劣势 说明
模型误差 错误模型导致错误规划(compounding error)
建模难度 高维连续、接触动力学难精确建模
计算开销 在线规划需实时 rollout
偏差 过度信任模型忽略真实反馈

四、代表

Dyna-Q、PETS、MuZero(学隐式模型)、世界模型 研究。混合方法:model-based 初始化 + model-free 微调。详见 RL 算法概览

回答思路

  • 【定义】用一句话说清「基于模型的强化学习有哪些优缺点」

  • 【原理】讲清关键机制或步骤(2~3 点)

  • 【例子】举一个真实项目、论文或产品中的例子

  • 【对比】与易混淆概念或替代方案比较(如有)

  • 【收尾】总结适用场景 + 一个局限或风险

延伸学习

延伸阅读:RL 算法概览世界模型。术语:强化学习策略。文章:RL 指南

常见误区

⚠️ 常见踩坑

误区一:容易答偏的地方:把 model-based 说成「需要机器学习模型」;忽视 compounding error;不提与 model-free 的适用场景对比。

追问

追问 1Dyna-Q 如何结合 model-based 与 model-free?

真实交互更新 Q 的同时学习模型;额外从模型采样虚拟转移更新 Q,提高样本效率。模型越准收益越大,模型差则引入噪声。

追问 2MPC 在机器人中如何应用?

每步用当前模型预测 H 步 horizon,优化动作序列,执行首步后重新规划(receding horizon)。对模型精度与实时性要求高。

追问 3MuZero 的「隐式模型」指什么?

不直接预测下一观测,而在隐空间预测转移与价值/策略,结合 MCTS 规划。避免像素级建模难,在围棋、Atari 取得 SOTA。

🔗 相似问题

同一考点的不同问法,换着练更稳

延伸学习

按主题分类的相关资源,便于系统复习