Skip to content

策略梯度定理

Policy gradient theorem · Policy gradient identity · 策略梯度恒等式

将折扣绩效对策略参数的梯度写成访问分布下的对数概率梯度与动作值乘积。

条目类型
定理

形式陈述

令可微随机策略为 πθ(as),初始分布为 μ,目标

J(θ)=ES0μ[vπθ(S0)].

本页固定使用归一化折扣占用分布

dμπθ(s)=(1γ)t=0γtPrμ,πθ(St=s),

其对 s 求和为一。动作值函数记为 qπθ。策略梯度定理给出

θJ(θ)=11γESdμπθAπθ(S)[θlogπθ(AS)qπθ(S,A)].

若改用未归一化占用测度 ρ=tγtPr(St=),前面的 1/(1γ) 应删除;混用两种约定会把梯度整体缩放错。

有限 MDP、奖励有界、γ<1 且每个动作概率在考虑的参数邻域可微并保持固定支持时,上式可直接成立。一般空间还需可测性与可积支配,才能把梯度移入无穷求和和积分。环境转移与奖励核必须不依赖 θ;若物理模型也由同一参数改变,还会出现模型导数项。

对任意只依赖状态的基线 b(s)

EAπθ(s)[θlogπθ(As)b(s)]=0,

故可把 qπ 换成 qπb。取 b=vπ 得优势函数,期望梯度不变而方差常更小。

直觉

轨迹分布会随策略改变,看似必须对所有未来状态概率求导。定理把这些隐藏导数望远镜式地吸收到占用分布中:只需在实际访问的状态上,增加带来高长期价值动作的对数概率,降低带来低价值动作的对数概率。

score logπ 衡量一次动作对参数变化有多敏感,qπ 衡量这次动作的长期后果。二者乘积才同时具备“该往哪调”和“调这一下有多重要”。基线只是把同一状态的共同价值扣除,不偏向任何动作。

例子与边界

考虑单状态、每步返回原状态的 MDP。动作 1 奖励 2,动作 0 奖励 0;令 p=πθ(1)=σ(θ)。归一化占用分布在该状态上的质量为一,

J(θ)=2p1γ,dJdθ=2p(1p)1γ.

两动作的长期值具有共同续项,故 q(1)q(0)=2。score 分别为 1pp,定理右侧的括号期望为

p(1p)q(1)+(1p)(p)q(0)=p(1p)[q(1)q(0)]=2p(1p),

再乘 1/(1γ) 与直接求导完全一致。共同续值自动被 score 的零均值消掉。

若策略在某参数处把动作概率截成零,logπ(as) 不再对该动作良好定义,支持还可能随参数突变;简单 score 公式不能跨过该边界。确定性策略需要确定性策略梯度的另一套条件。定理也只给局部梯度,非凸参数化仍可能停在局部驻点或鞍点。

推论与应用

用整条轨迹回报替代未知 qπ,得到REINFORCE的无偏蒙特卡洛估计;用学习到的价值函数和 TD 误差替代优势,得到actor–critic 方法。两者区别在价值信号的偏差—方差,而非梯度定理本身。

占用分布提醒我们,梯度只在当前策略访问到的区域有数据。概率极小的动作或几乎到不了的状态可能具有高价值,却贡献微弱且难以估计;熵正则、探索约束和离策略校正处理的是这一覆盖问题,不是定理自动提供的性质。

参考资料
  • Richard S. Sutton, David McAllester, Satinder Singh, and Yishay Mansour, “Policy Gradient Methods for Reinforcement Learning with Function Approximation,” NeurIPS, 2000.
  • Ronald J. Williams, “Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning,” Machine Learning 8, 1992, pp. 229–256.
  • Alekh Agarwal, Sham M. Kakade, Jason D. Lee, and Gaurav Mahajan, “On the Theory of Policy Gradient Methods,” JMLR 22, 2021.
关系图谱16 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组