形式陈述
在马尔可夫决策过程公理库马尔可夫决策过程Markov decision process · MDP · 马尔可夫决策模型以状态、动作、转移核与奖励刻画序贯决策,使当前状态成为预测下一步所需的充分信息。的一条轨迹上,从时刻 起的无限时域折扣回报定义为
下标约定很重要:动作 之后收到的是 。若 ,级数绝对收敛且 。随机奖励不必逐轨迹有界,但至少需要足够的可积性,才能合法交换期望与无穷求和。
几何权重给出一步递归
Bellman 方程正是对这条轨迹恒等式取适当的条件期望,而不是额外假设。有限时域 的回报可写成 ,终点后的续值为零;若终点还有残值,必须显式加入而不能悄悄丢弃。
折扣因子有两种常见解释。它既可表示对迟到收益的时间偏好,也可表示每步以概率 独立终止:此时一项奖励被计入的概率正是 。第二种解释说明为什么折扣目标天然对应几何长度的随机时域,但两种解释在建模含义上并不相同。
直觉
回报把整条未来压缩为现在可比较的一个数。几何折扣让遥远奖励逐渐变轻,也使“从下一时刻重新开始”只差一个固定因子 ,从而出现可递归求解的结构。若随意使用非几何权重,这种时间一致的一步分解一般会消失。
同时调节有效视野和数值条件。权重降到 约需 步,因此 的有效视野远长于 。它也放大回报尺度和估计方差;把 选得更接近一并不只是“看得更远”,还会让求值与学习变慢。
例子与边界
设从当前起依次获得奖励 ,随后进入零奖励吸收状态,取 ,则
下一时刻回报为 ,所以递归核验为 。若只观察前两项,截断值为 ,漏掉的第三项恰是 ;这比再换一组数字更清楚地展示了时间索引与截断误差。
一般地,奖励绝对值不超过 时,截掉前 项之后的尾部不超过
这个界适合决定模拟长度,却不说明随机估计的方差。若 且任务可能永不终止,级数可能发散;即使正负奖励相消,条件收敛也不足以支持任意换序和期望操作。终止几乎必然还不总能保证期望回报有限,需要控制终止时间和奖励尾部。
推论与应用
对 条件于 或 取期望,就得到状态值与动作值函数公理库状态值与动作值函数State-value and action-value functions · V-function and Q-function · 价值函数与动作价值函数以状态或状态—动作为条件,对未来折扣回报取期望,从而把轨迹目标变成可比较的局部函数。。递归式再经马尔可夫性质把未来压到下一状态,产生 Bellman 期望方程;若在首个动作上取最大值,则产生最优性方程。
折扣还为规划误差提供统一尺度:若每一步奖励近似误差不超过 ,最坏累计影响至多 。在平均奖励、风险敏感效用或有限时域约束中,目标并非同一个折扣和;算法名称即使相同,也必须重新核对它优化的回报定义。
参考资料
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Secs. 3.4–3.5.
- Martin L. Puterman, Markov Decision Processes, Wiley, 1994, Secs. 5.3 and 6.1.
- Dimitri P. Bertsekas and John N. Tsitsiklis, Neuro-Dynamic Programming, Athena Scientific, 1996, Sec. 2.1.