“迭代策略评估也是动态规划备份的基准:它假设模型 $P,r$ 已知并对所有下一状态求和。TD(0)用一次实际转移替代这份完整期望,保留一步 bootstrap 结构,同时引入采样噪声。”
形式陈述 ​
TD(0) 是时序差分学习的一步预测特例。固定策略
其他状态保持不变,终止状态价值取零。“0”指资格迹参数
在有限折扣 MDP 中,若奖励噪声二阶矩受控,策略固定,每个相关状态被无限访问,并且每个状态自己的步长满足 Robbins–Monro 条件
则标准异步随机近似结果给出
有限 episodic 情形还需回合能适当终止或等价的稳定性条件。常数步长适合跟踪缓慢变化的环境,但不满足平方可和与总和发散的组合,因此经典极限结论不适用。
直觉
TD(0) 每走一步就问:旧估计
奖励信息一次只跨过一条转移边。多次访问把终点附近的信号逐层向前传,步长则决定新证据与旧估计的混合比例。递减步长让早期误差最终被洗掉,同时抑制后期采样噪声。
它评估的是一套固定策略,而不负责挑选更优动作;把预测与策略改进混为一步,会悄悄改变待逼近的 Bellman 不动点。
例子与边界
一条确定性回合为
第二回合经过
随后
若行为策略不访问
推论与应用
把一步目标换成
TD(0) 的预测更新常作为控制算法的 critic。SARSA 和 Q-learning更新的是动作值且包含动作选择或最大化,不是 TD(0) 的同义名称,也不应仅因它们使用一步目标就归入本算法的特例关系。
参考资料
- Richard S. Sutton, “Learning to Predict by the Methods of Temporal Differences,” Machine Learning 3, 1988, pp. 9–44.
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Sec. 6.1.
- John N. Tsitsiklis, “Asynchronous Stochastic Approximation and Q-Learning,” Machine Learning 16, 1994, pp. 185–202.