基础理论课程进阶中文6–10 周★ 15k34 章可站内阅读
Easy RL
强化学习中文教程
Datawhale · 14,532 stars
Datawhale 中文强化学习系统教程。从 MDP、值函数到策略梯度、Actor-Critic 与深度 RL,理论与代码并重。适合作为 RL 书架的第一本,也为后续对齐、控制与 Agent 决策问题打底。
为什么收录 · 中文 RL 入门的高共识选择:覆盖面与可读性平衡好,学完可平滑接到数学基础书或对齐方向。
强化学习MDP策略梯度Actor-Critic深度 RLDatawhale中文教程
这本书强在哪
- 中文 RL 入门事实标准读物之一,理论与代码平衡好
- Datawhale 维护,文档与社区讨论可跟
- 覆盖到深度 RL,足够支撑后续对齐/控制方向
- 与数学基础书形成「实践 → 理论」进阶
建议怎么学
- 01先把 MDP 与贝尔曼方程直觉搞透,再进算法章
- 02每个算法:伪代码 → 实现 → 一个最小环境实验
- 03深度 RL 章注意复现随机性,记录种子与曲线
- 04若要理论加深,接 Mathematical Foundations of RL
适合谁 / 前置
- Python 熟练
- 概率与最优化基础
- 深度学习基础(会训一个神经网络)
学完得到什么
- 掌握 MDP、值函数、策略梯度、Actor-Critic 等经典内容
- 能跑通教程代码并解释算法直觉
- 为 RLHF / Agent RL 等对齐与决策场景打基础
- 知道实践算法的适用假设与常见坑
目录
来自站内阅读器镜像;点击章节直接阅读
docs34 章
- 01docsmarkdown
- 02第一章 强化学习基础markdown
- 03第1章 强化学习基础markdown
- 04第二章 马尔可夫决策过程(MDP)markdown
- 05第 2 章 马尔可夫决策过程markdown
- 06第三章 表格型方法markdown
- 07第 3 章 表格型方法markdown
- 08使用Q-learning解决悬崖寻路问题markdown
- 09第四章 策略梯度markdown
- 10第 4 章 策略梯度markdown
- 11第五章 近端策略优化 (PPO) 算法markdown
- 12第5章 PPO 算法markdown
- 13第六章 DQN (基本概念)markdown
- 14第6章 深度Q网络markdown
- 15第七章 DQN (进阶技巧)markdown
- 16第7章 深度Q网络进阶技巧markdown
- 17使用DQN实现CartPole-v0markdown
- 18第八章 DQN (连续动作)markdown
- 19第8章 针对连续动作的深度Q网络markdown
- 20第九章 演员-评论员算法markdown
- 21第9章演员-评论员算法markdown
- 22第十章 稀疏奖励markdown
- 23第10章 稀疏奖励markdown
- 24第十一章 模仿学习markdown
- 25第11章 模仿学习markdown
- 26第十二章 深度确定性策略梯度 (DDPG) 算法markdown
- 27第12章 深度确定性策略梯度markdown
- 28使用Policy-Based方法实现Pendulum-v0markdown
- 29第13章 AlphaStar 论文解读markdown
- 30ICLR 2025 Oral | 单卡3090纯视觉玩 MineCraft:LS-Imagine 在开放世界中基于长短期想象进行强化学习markdown
- 31chapter15markdown
- 32世界模型的本质markdown
- 33纸质版勘误修订表markdown
- 34蘑菇书EasyRLmarkdown
策展亮点章节
马尔可夫决策过程值函数方法策略梯度Actor-Critic深度强化学习实践项目
仓库数据
Stars14,532
Forks2,264
主要语言Jupyter Notebook
创建2020/1/1
更新2026/8/7
6b7df845(master)· 许可证 需人工确认 (NOASSERTION)。 上游更新后可通过同步脚本刷新。