基础理论课程进阶中文4–8 周★ 4.9k20 章可站内阅读
Hands-on RL
伯禹 / 动手学强化学习
boyu-ai· 4,928 stars
伯禹「动手学强化学习」课程仓库,用 notebook 实现从表格方法到 DQN、策略梯度与 Actor-Critic 的主线算法。适合想把 RL 理论落成代码,并与蘑菇书、数学基础书对照的中文学习者。
为什么收录 · 强化学习方向补上动手实现课,和 easy-rl、数学基础书组成「读教材 + 写代码」闭环。
强化学习DQN策略梯度中文教程动手学
这本书强在哪
- 中文 RL 动手课,配合在线站点
- 与 easy-rl、数学基础书互补
- notebook 可跟练
- 补齐 RL 实践代码轨
建议怎么学
- 01先读概念与表格方法
- 02DQN/策略梯度务必自己改环境
- 03理论卡壳时回看 easy-rl 与数学基础书
适合谁 / 前置
- Python
- 概率与基础 ML
- 了解 MDP 更好
学完得到什么
- 掌握强化学习核心算法实现
- 能复现常见控制/博弈实验
- 理解 value-based / policy-based 差异
- 与蘑菇书/数学基础书形成实践闭环
目录
来自站内阅读器镜像;点击章节直接阅读
Notebook20 章
- 01第2章 多臂老虎机问题notebook
- 02第3章 马尔可夫决策过程notebook
- 03第4章 动态规划算法notebook
- 04第5章 时序差分算法notebook
- 05第6章 Dyna Q算法notebook
- 06第7章 DQN算法notebook
- 07第8章 DQN改进算法notebook
- 08第9章 策略梯度算法notebook
- 09第10章 Actor Critic算法notebook
- 10第11章 TRPO算法notebook
- 11第12章 PPO算法notebook
- 12第13章 DDPG算法notebook
- 13第14章 SAC算法notebook
- 14第15章 模仿学习notebook
- 15第16章 模型预测控制notebook
- 16第17章 基于模型的策略优化notebook
- 17第18章 离线强化学习notebook
- 18第19章 目标导向的强化学习notebook
- 19第20章 多智能体强化学习入门notebook
- 20第21章 多智能体强化学习进阶notebook
策展亮点章节
基础概念表格型方法DQN策略梯度Actor-Critic进阶主题
仓库数据
Stars4,928
Forks828
主要语言Jupyter Notebook
创建2021/8/8
更新2026/8/11
4a151a4b(main)· 许可证 Apache License 2.0 (Apache-2.0)。 上游更新后可通过同步脚本刷新。