书籍 · 资源记录
Reinforcement Learning: An Introduction, Second Edition
系统介绍多臂赌博机、Markov 决策过程、价值估计、控制、函数逼近与策略梯度。
为什么重要
用于核对 A10 的定义、Bellman 推导、经典算法与收敛条件;高级离线与多智能体内容另标研究边界。
阅读前提
教材中的引用位置
- A10 · 第 1 章 Markov 决策过程与 Bellman 方程
支持的主张:Sutton 与 Barto 第二版用于核对 MDP 五元组、回报、价值函数以及 Bellman 期望/最优方程;Stanford CS229 材料用于核对概率模型、函数逼近和策略评价所需的统计学习背景。本章据此把 Markov 性明确限定为给定状态表示下的条件独立,而不是对真实环境的无条件断言。
- A10 · 第 2 章 动态规划、Monte Carlo 与时序差分
支持的主张:Sutton 与 Barto 第二版用于核对 Bellman 期望方程、策略评估、TD 误差和自举更新的标准定义与收敛条件;Stanford CS229 材料用于核对函数逼近、随机梯度和有限样本评价的统计学习接口。本章的 TD 递推直接遵循前者,后者只用于解释近似器训练与验证,不能替代强化学习中的采样分布条件。
- A10 · 第 3 章 Q-learning、探索与函数逼近
支持的主张:Sutton 与 Barto 第二版用于核对 Q-learning 的时序差分目标、离策略更新、探索条件和表格情形收敛边界;Stanford CS229 材料用于核对回归式函数逼近与随机梯度训练。本章因此把表格算法的经典保证与神经近似下的经验稳定性严格分开。
- A10 · 第 4 章 策略梯度、actor–critic 与优势估计
支持的主张:Sutton 与 Barto 第二版用于核对策略梯度定理、REINFORCE、baseline 与 actor–critic 更新;Stanford CS229 材料用于核对似然梯度、随机优化和验证协议。本章的无偏估计与方差降低结论按前者条件陈述,后者只支持优化和统计评价部分。
- A10 · 第 5 章 基于模型、离线与多智能体强化学习
支持的主张:Sutton 与 Barto第二版用于核对基于模型的规划、离策略学习、重要性采样和函数逼近的基础定义;Stanford CS229 材料用于核对监督拟合、分布偏移与验证误差的统计接口。本章据此解释离线数据支持之外的动作值为何可能失真,并未从经典在线 RL 结论推导无条件的离线安全保证。
- A10 · 第 6 章 稳定性、评估与强化学习综合复习
支持的主张:Sutton 与 Barto 第二版用于核对从 MDP、动态规划、TD、控制到策略梯度的统一记号和算法条件;Stanford CS229 材料用于核对函数逼近、优化、数据划分与误差评价。本章的强化学习主线以前者为依据,后者只补充近似学习器的统计与工程检查。