“TD(0) 是时序差分学习的一步预测特例。固定策略 $\pi$ 产生转移 $(S t,R {t+1},S {t+1})$ 后,表格算法更新 $$ V {t+1}(S t)=V t(S t)+…”
形式陈述 ​
时序差分学习是一族用采样转移逼近 Bellman 误差的方法。给定策略产生的转移
终止状态的续值约定为零。条件于
其中
表格更新只改变被访问状态;可微函数逼近
称“半梯度”是因为目标
TD 方法还包括多步回报和资格迹:它们在纯一步 bootstrap 与等到完整蒙特卡洛回报之间分配信用。TD 是方法族,固定策略预测、动作值预测和控制算法各有不同目标;不能从“都含
具体地,
若回合在
直觉
蒙特卡洛方法等整段轨迹结束后,拿真实累计回报纠正当前估计;TD 则把下一状态的现有估计当作临时收据,只走一步便更新。它因此能用于不断继续的任务,也能让后续信息逐步向前传播。
自举既是效率来源,也是偏差耦合来源。目标的一部分由当前估计产生,更新一个状态会改变另一个状态以后使用的标签。表格、固定策略、折扣情形中 Bellman 压缩能驯服这种耦合;叠加离策略采样和函数逼近后,这份稳定性不再自动存在。
例子与边界
设从状态
若样本到
若终止样本到来且步长为
经典边界常被称为“致命三元组”:函数逼近、bootstrap 与离策略更新同时出现时,甚至线性方法也可能发散。固定步长通常只得到稳态误差邻域而非几乎必然收敛;非平稳策略让目标不动点本身移动;未访问状态没有数据支撑。深度网络中的目标网络和经验回放能改善工程稳定性,却不是一般收敛定理。
推论与应用
TD(0)是一步表格策略评估的基本算法。动作值上的 on-policy 更新产生SARSA;将下一动作换成最大化目标产生Q-learning。这三者共享 TD 误差的外形,但预测对象、采样策略和不动点不同。
在 actor–critic 中,critic 用 TD 误差近似优势信号,actor 据此更新策略。若 critic 没有在 actor 移动前充分跟踪其价值,TD 偏差会直接进入策略梯度;这正是双时间尺度分析需要控制的量。
参考资料
- Richard S. Sutton, “Learning to Predict by the Methods of Temporal Differences,” Machine Learning 3, 1988, pp. 9–44.
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Chs. 6 and 12.
- John N. Tsitsiklis and Benjamin Van Roy, “An Analysis of Temporal-Difference Learning with Function Approximation,” IEEE Transactions on Automatic Control 42(5), 1997, pp. 674–690.