形式陈述
令可微随机策略为 π θ ( a ∣ s ) ,初始分布为 μ ,目标
J ( θ ) = E S 0 ∼ μ [ v π θ ( S 0 ) ] . 本页固定使用归一化折扣占用分布
d μ π θ ( s ) = ( 1 − γ ) ∑ t = 0 ∞ γ t Pr μ , π θ ( S t = s ) , 其对 s 求和为一。动作值函数 公理库 状态值与动作值函数 State-value and action-value functions · V-function and Q-function · 价值函数与动作价值函数 以状态或状态—动作为条件,对未来折扣回报取期望,从而把轨迹目标变成可比较的局部函数。 记为 q π θ 。策略梯度定理给出
∇ θ J ( θ ) = 1 1 − γ E S ∼ d μ π θ A ∼ π θ ( ⋅ ∣ S ) [ ∇ θ log π θ ( A ∣ S ) q π θ ( S , A ) ] . 若改用未归一化占用测度 ρ = ∑ t γ t Pr ( S t = ⋅ ) ,前面的 1 / ( 1 − γ ) 应删除;混用两种约定会把梯度整体缩放错。
有限 MDP、奖励有界、γ < 1 且每个动作概率在考虑的参数邻域可微并保持固定支持时,上式可直接成立。一般空间还需可测性与可积支配,才能把梯度 公理库 梯度 Gradient 标量函数微分在内积下对应的向量。 移入无穷求和和积分。环境转移与奖励核必须不依赖 θ ;若物理模型也由同一参数改变,还会出现模型导数项。
对任意只依赖状态的基线 b ( s ) ,
E A ∼ π θ ( ⋅ ∣ s ) [ ∇ θ log π θ ( A ∣ s ) b ( s ) ] = 0 , 故可把 q π 换成 q π − b 。取 b = v π 得优势函数,期望梯度不变而方差常更小。
直觉
轨迹分布会随策略改变,看似必须对所有未来状态概率求导。定理把这些隐藏导数望远镜式地吸收到占用分布中:只需在实际访问的状态上,增加带来高长期价值动作的对数概率,降低带来低价值动作的对数概率。
score ∇ log π 衡量一次动作对参数变化有多敏感,q π 衡量这次动作的长期后果。二者乘积才同时具备“该往哪调”和“调这一下有多重要”。基线只是把同一状态的共同价值扣除,不偏向任何动作。
例子与边界
考虑单状态、每步返回原状态的 MDP。动作 1 奖励 2 ,动作 0 奖励 0 ;令 p = π θ ( 1 ) = σ ( θ ) 。归一化占用分布在该状态上的质量为一,
J ( θ ) = 2 p 1 − γ , d J d θ = 2 p ( 1 − p ) 1 − γ . 两动作的长期值具有共同续项,故 q ( 1 ) − q ( 0 ) = 2 。score 分别为 1 − p 与 − p ,定理右侧的括号期望为
p ( 1 − p ) q ( 1 ) + ( 1 − p ) ( − p ) q ( 0 ) = p ( 1 − p ) [ q ( 1 ) − q ( 0 ) ] = 2 p ( 1 − p ) , 再乘 1 / ( 1 − γ ) 与直接求导完全一致。共同续值自动被 score 的零均值消掉。
若策略在某参数处把动作概率截成零,log π ( a ∣ s ) 不再对该动作良好定义,支持还可能随参数突变;简单 score 公式不能跨过该边界。确定性策略需要确定性策略梯度的另一套条件。定理也只给局部梯度,非凸参数化仍可能停在局部驻点或鞍点。
推论与应用
用整条轨迹回报替代未知 q π ,得到REINFORCE 公理库 REINFORCE 算法 REINFORCE · Monte Carlo policy gradient · 蒙特卡洛策略梯度 用完整采样回报和似然比恒等式构造无偏策略梯度估计,并以动作无关基线降低方差。 的无偏蒙特卡洛估计;用学习到的价值函数和 TD 误差替代优势,得到actor–critic 方法 公理库 Actor–critic 方法 Actor-critic method · Actor–critic algorithm · 演员—评论家方法 让 actor 调整参数化策略、critic 估计价值信号,并用双时间尺度控制移动目标与评估误差。 。两者区别在价值信号的偏差—方差,而非梯度定理本身。
占用分布提醒我们,梯度只在当前策略访问到的区域有数据。概率极小的动作或几乎到不了的状态可能具有高价值,却贡献微弱且难以估计;熵正则、探索约束和离策略校正处理的是这一覆盖问题,不是定理自动提供的性质。
参考资料
Richard S. Sutton, David McAllester, Satinder Singh, and Yishay Mansour, “Policy Gradient Methods for Reinforcement Learning with Function Approximation,” NeurIPS , 2000.
Ronald J. Williams, “Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning,” Machine Learning 8, 1992, pp. 229–256.
Alekh Agarwal, Sham M. Kakade, Jason D. Lee, and Gaurav Mahajan, “On the Theory of Policy Gradient Methods,” JMLR 22, 2021.