基础理论开源书高阶英文8–16 周★ 17k↑+739 章可站内阅读
Mathematical Foundations of RL
强化学习的数学基础
Shiyu Zhao · 17,396 stars · 8/8 04:44 → 8/8 14:57(10 小时)
强化学习数学基础开源书,强调 MDP、动态规划、蒙特卡洛、TD、函数近似与策略优化的推导与假设。适合已经会跑 RL 算法、想补理论深度的读者;与 Easy RL 形成实践→理论互补。
为什么收录 · 书架上少见的「真数学」RL 书,强调推导与假设;防止强化学习学习停在调参与复现排行榜。
强化学习理论MDP动态规划TD函数近似策略优化数学推导
这本书强在哪
- 偏理论开源书,强调推导与算法保证
- 与 Easy RL 实践教程互补:先会跑,再懂为什么
- PDF 章节清晰,适合精读与做笔记
- 适合准备理论研究或深挖对齐/控制理论的读者
建议怎么学
- 01建议先有 Easy RL 或同等实践基础再打开
- 02每章手推关键公式,并对照一个算法实现
- 03函数近似与策略优化章可与论文精读并行
- 04不要与大量工程项目并行,留给推导时间
适合谁 / 前置
- 概率论、线性代数、最优化
- 已具备 RL 基础概念(建议先完成 Easy RL)
- 能读英文数学推导
学完得到什么
- 夯实 RL 核心数学推导与假设
- 能更顺畅地阅读理论论文
- 理解常见算法的保证、条件与局限
- 避免只停留在「调参层」理解强化学习
目录
来自站内阅读器镜像;点击章节直接阅读
PDF39 章
- 011 Table of contentspdf
- 022 Overview of this bookpdf
- 032 Prefacepdf
- 043 Chapter 1 Basic Conceptspdf
- 053 Chapter 10 Actor Critic Methodspdf
- 063 Chapter 2 State Values and Bellman Equationpdf
- 073 Chapter 3 Optimal State Values and Bellman Optimality Equationpdf
- 083 Chapter 4 Value Iteration and Policy Iterationpdf
- 093 Chapter 5 Monte Carlo Methodspdf
- 103 Chapter 6 Stochastic Approximationpdf
- 113 Chapter 7 Temporal Difference Methodspdf
- 123 Chapter 8 Value Function Methodspdf
- 133 Chapter 9 Policy Gradient Methodspdf
- 144 Appendixpdf
- 155 Errata for the Springer versionpdf
- 16Book all in onepdf
- 17policy offline Q learningpdf
- 18trajectory Bellman Equationpdf
- 19trajectory Q learningpdf
- 20L1 Basic conceptspdf
- 21L10 Actor Criticpdf
- 22L2 Bellman equationpdf
- 23L3 Bellman optimality equationpdf
- 24L4 Value iteration and policy iterationpdf
- 25L5 Monte Carlo methodspdf
- 26L6 Stochastic approximationpdf
- 27L7 Temporal Difference Learningpdf
- 28L8 Value function methods.pdfpdf
- 29L9 Policy gradient methodspdf
- 30L1 basic conceptspdf
- 31L10 Actor Criticpdf
- 32L2 Bellman equationpdf
- 33L3 Bellman optimality equationpdf
- 34L4 Value iteration and policy iterationpdf
- 35L5 MCpdf
- 36L6 Stochastic approximation and stochastic gradient descentpdf
- 37L7 Temporal difference learningpdf
- 38L8 Value function approximationpdf
- 39L9 Policy gradientpdf
策展亮点章节
MDP 数学框架动态规划蒙特卡洛方法时序差分函数近似策略优化
仓库数据
Stars17,396
Forks1,657
主要语言MATLAB
更新2026/8/8
0e348961(main)· 许可证 需人工确认 (NOASSERTION)。 上游更新后可通过同步脚本刷新。