Skip to content

Actor–critic 方法

Actor-critic method · Actor–critic algorithm · 演员—评论家方法

让 actor 调整参数化策略、critic 估计价值信号,并用双时间尺度控制移动目标与评估误差。

条目类型
方法

形式陈述

Actor–critic 同时维护策略 πθ 与价值近似 Vw。一次 on-policy 转移后,critic 构造TD 误差

δt=Rt+1+γVw(St+1)Vw(St),

并以步长 αt 更新 w;actor 以较慢步长 βt

θt+1=θt+βtδtθlogπθt(AtSt).

Vw=vπθ,则

E[δtSt=s,At=a]=Aπθ(s,a),

但要与策略梯度定理中从初始分布定义的折扣目标对齐,全局梯度的常数取决于如何抽取时刻。若在从 μ 启动的轨迹上独立抽取

Pr(T=t)=(1γ)γt

并使用第 T 步的 actor 信号,则 ST 服从归一化折扣占用分布,单样本期望为 (1γ)J。若改为从初始分布生成整条轨迹并累加

t0γtδtθlogπθ(AtSt),

其期望直接是 J,不再多出 (1γ)。几何重启可实现前一种采样。若不加折扣而从一条继续型稳态轨迹均匀取时刻,得到的则是稳态访问分布下的目标,不能默认为同一个起始状态折扣目标。

经典双时间尺度分析让 critic 比 actor 更快:两组步长各自满足总和发散、平方和收敛,并且

βtαt0.

在 actor 看来,critic 几乎已收敛到当前策略的固定点;在 critic 看来,策略参数近似不动。再配合有限或遍历状态过程、光滑有界参数化、稳定 critic、投影或有界迭代等条件,随机近似 ODE 方法可证明收敛到相应局部驻点集合。只写“两个学习率不同”不构成双时间尺度条件。

直觉

Actor 决定做什么,critic 判断刚才的结果比当前预期好还是坏。critic 不必等到整回合结束,下一状态价值已能提供一张临时评分;actor 据此提高正惊喜动作的概率,降低负惊喜动作的概率。与 REINFORCE 相比,这份评分方差较低,却依赖 critic 是否准确。

两者同时学习会形成追逐:策略一变,正确价值也变;价值若还没跟上,策略便沿旧地图前进。让 critic 处于更快时间尺度,不是经验口号,而是把移动目标近似成一系列静态求值问题的数学安排。

例子与边界

初始状态 s 有 left、right 两动作,均先得 0;left 到 L,下一步得 4 后终止,right 到 R,下一步得 1 后终止。取 γ=1/2,策略以概率 p=σ(θ) 选 left。若 critic 已准确给出

V(L)=4,V(R)=1,V(s)=p2+(1p)12,

p=1/2V(s)=5/4。首步 TD 误差分别为 3/43/4;softmax score 分别为 1/21/2,故 actor 信号的期望是

121234+12(12)(34)=38.

直接求导 J(θ)=12+32p 也得 J=32p(1p)=3/8。这里 critic 把第二步奖励提前转成首步优势。

若 critic 误差 e(s)=Vw(s)vπ(s) 满足 eε,TD 目标的条件偏差为 γE[e(St+1)]e(s),绝对值至多 (1+γ)ε。若 score 范数再由 G 控制,归一化占用分布下 actor 方向的偏差至多 G(1+γ)ε;换算成 J 时还要除以 1γ。因此一般近似 critic 会给 actor 带来系统偏差;critic 损失小并不等于策略梯度无偏。离策略数据还需密度比或强调权重,非线性 critic 也可能不稳定。

推论与应用

加入资格迹得到多步 actor–critic;用 compatible features 和特定最小二乘 critic 可恢复精确的自然梯度关系。A2C、A3C、PPO 等现代算法都保留 actor/critic 分工,但裁剪目标、并行旧策略或广义优势估计会改变基本更新及其保证。

双时间尺度不是唯一可行实现,却是判断理论声明是否完整的关键。若使用常数步长,合理目标通常是跟踪误差或稳态邻域;若 actor 与 critic 共用同一量级步长,则需联合动力系统分析,不能直接援引 critic“先收敛”的证明。

参考资料
  • Vijay R. Konda and John N. Tsitsiklis, “Actor-Critic Algorithms,” NeurIPS, 2000.
  • Vijay R. Konda and John N. Tsitsiklis, “On Actor-Critic Algorithms,” SIAM Journal on Control and Optimization 42(4), 2003, pp. 1143–1166.
  • Richard S. Sutton et al., “Policy Gradient Methods for Reinforcement Learning with Function Approximation,” NeurIPS, 2000.
  • Vivek S. Borkar, Stochastic Approximation: A Dynamical Systems Viewpoint, Cambridge University Press, 2008, Ch. 6.
关系图谱10 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组