“用整条轨迹回报替代未知 $q \pi$,得到REINFORCE的无偏蒙特卡洛估计;用学习到的价值函数和 TD 误差替代优势,得到actor–critic 方法。两者区别在价值信号的偏差—方差…”
形式陈述 ​
设轨迹目标为
并定义从
REINFORCE 因而在一个或一批完整回合后,以
更新
这正是策略梯度定理的蒙特卡洛实现:
推导从轨迹密度开始。环境动力学不含
把它乘上总折扣回报并取期望得到似然比梯度。对时刻
直觉
算法把一次随机行动的“责任”写成它的 log-probability 梯度,再用后来实际得到的回报决定奖励还是惩罚。回报高的轨迹会提高其中动作的概率,回报低的轨迹会压低它们。因为等到结局才结账,信号无须自举模型,却可能非常嘈杂。
基线像按状态设定的及格线:只奖励高于该状态通常水平的动作。所有动作都减去同一个数不会改变平均梯度方向,因为动作概率总和恒为一;但它能去掉与动作选择无关的共同回报波动。
例子与边界
一回合只有一个状态和一次动作。动作 1 奖励
直接计算
REINFORCE 的主要边界是方差和样本效率。长回合中,早期动作乘上许多与它无关的随机奖励;稀有高回报事件会制造重尾估计。截断未结束回合会产生偏差,除非加入正确续值或随机截断校正。离策略轨迹还需重要性权重,乘积权重可能进一步放大方差。
推论与应用
reward-to-go 已利用因果性去掉动作发生前的奖励,比整条轨迹总回报方差更低。把基线训练成
实践中通常对多条轨迹求平均、标准化优势并加入熵奖励。轨迹平均保持目标不变;批内标准化和熵项会改变有限样本估计或优化目标,应在理论陈述中单独标明,而不是统称为“方差降低且无偏”。
参考资料
- Ronald J. Williams, “Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning,” Machine Learning 8, 1992, pp. 229–256.
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Sec. 13.3.
- Peter W. Glynn, “Likelihood Ratio Gradient Estimation for Stochastic Systems,” Communications of the ACM 33(10), 1990, pp. 75–84.