“用整条轨迹回报替代未知 $q \pi$,得到REINFORCE的无偏蒙特卡洛估计;用学习到的价值函数和 TD 误差替代优势,得到actor–critic 方法。两者区别在价值信号的偏差—方差…”
形式陈述 ​
Actor–critic 同时维护策略
并以步长
若
但要与策略梯度定理中从初始分布定义的折扣目标对齐,全局梯度的常数取决于如何抽取时刻。若在从
并使用第
其期望直接是
经典双时间尺度分析让 critic 比 actor 更快:两组步长各自满足总和发散、平方和收敛,并且
在 actor 看来,critic 几乎已收敛到当前策略的固定点;在 critic 看来,策略参数近似不动。再配合有限或遍历状态过程、光滑有界参数化、稳定 critic、投影或有界迭代等条件,随机近似 ODE 方法可证明收敛到相应局部驻点集合。只写“两个学习率不同”不构成双时间尺度条件。
直觉
Actor 决定做什么,critic 判断刚才的结果比当前预期好还是坏。critic 不必等到整回合结束,下一状态价值已能提供一张临时评分;actor 据此提高正惊喜动作的概率,降低负惊喜动作的概率。与 REINFORCE 相比,这份评分方差较低,却依赖 critic 是否准确。
两者同时学习会形成追逐:策略一变,正确价值也变;价值若还没跟上,策略便沿旧地图前进。让 critic 处于更快时间尺度,不是经验口号,而是把移动目标近似成一系列静态求值问题的数学安排。
例子与边界
初始状态
在
直接求导
若 critic 误差
推论与应用
加入资格迹得到多步 actor–critic;用 compatible features 和特定最小二乘 critic 可恢复精确的自然梯度关系。A2C、A3C、PPO 等现代算法都保留 actor/critic 分工,但裁剪目标、并行旧策略或广义优势估计会改变基本更新及其保证。
双时间尺度不是唯一可行实现,却是判断理论声明是否完整的关键。若使用常数步长,合理目标通常是跟踪误差或稳态邻域;若 actor 与 critic 共用同一量级步长,则需联合动力系统分析,不能直接援引 critic“先收敛”的证明。
参考资料
- Vijay R. Konda and John N. Tsitsiklis, “Actor-Critic Algorithms,” NeurIPS, 2000.
- Vijay R. Konda and John N. Tsitsiklis, “On Actor-Critic Algorithms,” SIAM Journal on Control and Optimization 42(4), 2003, pp. 1143–1166.
- Richard S. Sutton et al., “Policy Gradient Methods for Reinforcement Learning with Function Approximation,” NeurIPS, 2000.
- Vivek S. Borkar, Stochastic Approximation: A Dynamical Systems Viewpoint, Cambridge University Press, 2008, Ch. 6.