“TD(0)是一步表格策略评估的基本算法。动作值上的 on policy 更新产生SARSA;将下一动作换成最大化目标产生Q learning。这三者共享 TD 误差的外形,但预测对象、采样策…”
形式陈述 ​
SARSA 的名字来自一次更新所用的五元组
这是动作值上的时序差分更新。终止转移没有
在固定策略下,对下一状态和实际下一动作取条件期望,目标成为
正是
若策略固定,条件期望目标对应该策略的动作值 Bellman 方程,SARSA 是 on-policy prediction。用于控制时,常令
再加上适当的 GLIE 与回合条件,可得到表格 SARSA 收敛到
“
常见的有限动作
直觉
SARSA 用“我下一步真的会做什么”给当前动作定价。若行为策略为了探索可能在危险状态选到保守性较差的动作,这种风险会进入目标值;所以它学习的是包含探索习惯在内的 on-policy 后果。
控制过程把评估和改进交错进行:动作值变化使行为策略更贪心,新策略又改变以后采到的数据和目标。GLIE 让探索永不完全丢失,同时使这张移动策略最终趋向贪心,恰好平衡辨识与优化。
因此同一环境转移在探索率变化后可能产生不同的下一动作目标;这种随行为策略而变的续值,正是 on-policy 的含义。
例子与边界
设样本从
故
值为
GLIE 保证也有明确边界:访问条件通常需对控制过程可能相关的全部状态—动作成立;环境动力学根本到不了的状态不能靠探索策略创造。函数逼近、经验回放或并行旧策略数据会破坏严格 on-policy 结构。固定学习率的工程实现可以适应非平稳性,却不满足经典渐近步长假设。
推论与应用
在悬崖行走等问题中,持续
Expected SARSA 把实际
参考资料
- Gavin A. Rummery and Mahesan Niranjan, On-Line Q-Learning Using Connectionist Systems, Cambridge University Engineering Department Technical Report CUED/F-INFENG/TR 166, 1994.
- Satinder P. Singh, Tommi Jaakkola, Michael L. Littman, and Csaba Szepesvári, “Convergence Results for Single-Step On-Policy Reinforcement-Learning Algorithms,” Machine Learning 38, 2000, pp. 287–308.
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Secs. 6.4–6.5.