核心要点
能清晰对比是否显式学习环境模型
各举 2~3 个代表算法:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
理解样本效率 vs 渐近性能 trade-off
知道实际系统常混合使用:回答时要先解释它的含义,再补一句适用场景或工程例子,避免只背名词。
标准回答
一、核心回答
| 维度 | Model-free | Model-based |
|---|---|---|
| 环境模型 | 不显式学习 P,R | 学习 P̂,R̂ 或隐式动力学 |
| 决策方式 | 查 Q / 采样 π | 模型内规划、rollout |
| 样本效率 | 较低 | 较高 |
| 渐近性能 | 无模型偏差上限 | 受模型误差限制 |
| 代表 | Q-Learning, DQN, PPO, SAC | Dyna-Q, PETS, MuZero, AlphaZero |
二、Model-free
直接从 (s,a,r,s') 更新 Q 或 ∇J(π),简单通用,适合模型难建但交互相对便宜的场景(Atari、LLM RLHF)。
三、Model-based
适合交互昂贵(机器人、工业控制)、可仿真或物理模型近似好的场景。
四、实践趋势
MB-MF 混合——用模型生成合成数据预训练,model-free 在线微调;或 Dreamer 等在潜空间做 model-based 想象训练。
详见 强化学习入门 与 RL 算法概览。
回答思路
【定义】用一句话说清「基于模型与无模型强化学习」
【原理】讲清关键机制或步骤(2~3 点)
【例子】举一个真实项目、论文或产品中的例子
【对比】与易混淆概念或替代方案比较(如有)
【收尾】总结适用场景 + 一个局限或风险
延伸学习
延伸阅读:RL 算法概览、强化学习入门。术语:世界模型、Q-Learning、PPO。
常见误区
⚠️ 常见踩坑
误区一:容易答偏的地方:绝对化「model-based 一定更好」;不把 compounding error 和 sim-to-real 作为核心风险提及。
🔗 相似问题
同一考点的不同问法,换着练更稳
没找到想看的面试题?把你想看的告诉我们 →
延伸学习
按主题分类的相关资源,便于系统复习
