Skip to content

折扣回报

Discounted return · Discounted cumulative reward · 折扣累计奖励

将轨迹上未来奖励按几何权重汇总,并用递归分解连接即时奖励与后续决策价值。

条目类型
定义

形式陈述

马尔可夫决策过程的一条轨迹上,从时刻 t 起的无限时域折扣回报定义为

Gt=k=0γkRt+k+1,0γ<1.

下标约定很重要:动作 At 之后收到的是 Rt+1。若 |Rt|Rmax,级数绝对收敛且 |Gt|Rmax/(1γ)。随机奖励不必逐轨迹有界,但至少需要足够的可积性,才能合法交换期望与无穷求和。

几何权重给出一步递归

Gt=Rt+1+γGt+1.

Bellman 方程正是对这条轨迹恒等式取适当的条件期望,而不是额外假设。有限时域 T 的回报可写成 Gt(T)=k=0Tt1γkRt+k+1,终点后的续值为零;若终点还有残值,必须显式加入而不能悄悄丢弃。

折扣因子有两种常见解释。它既可表示对迟到收益的时间偏好,也可表示每步以概率 1γ 独立终止:此时一项奖励被计入的概率正是 γk。第二种解释说明为什么折扣目标天然对应几何长度的随机时域,但两种解释在建模含义上并不相同。

直觉

回报把整条未来压缩为现在可比较的一个数。几何折扣让遥远奖励逐渐变轻,也使“从下一时刻重新开始”只差一个固定因子 γ,从而出现可递归求解的结构。若随意使用非几何权重,这种时间一致的一步分解一般会消失。

γ 同时调节有效视野和数值条件。权重降到 e1 约需 1/(1γ) 步,因此 γ=0.99 的有效视野远长于 0.9。它也放大回报尺度和估计方差;把 γ 选得更接近一并不只是“看得更远”,还会让求值与学习变慢。

例子与边界

设从当前起依次获得奖励 2,1,3,随后进入零奖励吸收状态,取 γ=1/2,则

Gt=2+12(1)+14(3)=94.

下一时刻回报为 Gt+1=1+123=12,所以递归核验为 2+12Gt+1=9/4。若只观察前两项,截断值为 3/2,漏掉的第三项恰是 3/4;这比再换一组数字更清楚地展示了时间索引与截断误差。

一般地,奖励绝对值不超过 Rmax 时,截掉前 n 项之后的尾部不超过

γnRmax1γ.

这个界适合决定模拟长度,却不说明随机估计的方差。若 γ=1 且任务可能永不终止,级数可能发散;即使正负奖励相消,条件收敛也不足以支持任意换序和期望操作。终止几乎必然还不总能保证期望回报有限,需要控制终止时间和奖励尾部。

推论与应用

Gt 条件于 St=s(St,At)=(s,a) 取期望,就得到状态值与动作值函数。递归式再经马尔可夫性质把未来压到下一状态,产生 Bellman 期望方程;若在首个动作上取最大值,则产生最优性方程。

折扣还为规划误差提供统一尺度:若每一步奖励近似误差不超过 ε,最坏累计影响至多 ε/(1γ)。在平均奖励、风险敏感效用或有限时域约束中,目标并非同一个折扣和;算法名称即使相同,也必须重新核对它优化的回报定义。

参考资料
  • Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Secs. 3.4–3.5.
  • Martin L. Puterman, Markov Decision Processes, Wiley, 1994, Secs. 5.3 and 6.1.
  • Dimitri P. Bertsekas and John N. Tsitsiklis, Neuro-Dynamic Programming, Athena Scientific, 1996, Sec. 2.1.
关系图谱15 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组