Skip to content

状态值与动作值函数

State-value and action-value functions · V-function and Q-function · 价值函数与动作价值函数

以状态或状态—动作为条件,对未来折扣回报取期望,从而把轨迹目标变成可比较的局部函数。

条目类型
定义

形式陈述

给定策略 π折扣回报 Gt,状态值和动作值定义为

vπ(s)=Eπ[GtSt=s],qπ(s,a)=Eπ[GtSt=s,At=a].

这里的期望同时覆盖策略随机性、状态转移与奖励噪声。第一式在时刻 t 立即按 π 行动;第二式固定第一个动作是 a,从下一时刻起才按 π 行动。混淆这个时间界面会把行为策略与被评估策略错误地揉在一起。

平稳策略下,两者满足

vπ(s)=aπ(as)qπ(s,a),

以及优势函数

Aπ(s,a)=qπ(s,a)vπ(s),aπ(as)Aπ(s,a)=0.

最优值定义为 v(s)=supπvπ(s)q(s,a)=supπqπ(s,a)。有限折扣 MDP 中上确界可由确定性平稳策略达到;一般空间或无折扣情形需要额外的可测选择、紧性与存在性条件。

价值函数是条件均值,不是一次轨迹实际得到的回报,也不是状态本身固有的分数。改变策略、奖励或折扣因子都会改变 vπ;同一状态在谨慎策略下可能安全而高值,在冒险策略下可能低值。

|Rt|Rmaxγ<1,则所有策略都有统一界

|vπ(s)|Rmax1γ,|qπ(s,a)|Rmax1γ.

这不仅保证条件期望存在,也为动态规划初始化、误差证书和随机近似噪声控制提供尺度。若奖励整体加上常数 c,继续型折扣任务的每个策略价值整体加 c/(1γ),动作的相对排序不变;但有状态依赖终止时,剩余步数不同会破坏这一简单平移。

直觉

vπ 回答“到了这里并继续照这套规则做,平均还能得到多少”;qπ 则回答“先试这个动作,再照规则做,会怎样”。正因为 qπ 把第一个动作拆出来,比较 qπ(s,a) 就能改进策略;vπ 更适合概括策略在状态上的总体前景。

优势函数使用同一状态的平均行为作基线。正优势表示某动作优于策略在该状态的平均选择,而非表示其绝对回报为正。这个中心化性质既服务于策略改进,也会在策略梯度估计中降低方差。

例子与边界

考虑一个状态 s,动作“离开”立即得 2 后终止;动作“等待”立即得 0 并确定回到 s。策略每次以 1/2 选两者,取 γ=1/2。由一次展开,

vπ(s)=122+12(0+12vπ(s)),

vπ(s)=4/3。两个动作值为

qπ(s,leave)=2,qπ(s,wait)=12vπ(s)=23.

它们按策略平均确为 4/3,优势分别是 2/32/3。这个例子还显示:等待的即时奖励虽为零,动作值并非零,因为它保留了未来机会。

若策略从未访问某状态,vπ(s) 作为“从该状态重新启动”的数学量仍可定义,但单靠该策略的一条长轨迹通常无法估计它。若回报不可积,条件期望可能不存在;若观测把多个隐状态合并,同一个观测上的单一价值会依赖隐藏状态的后验,不能当作真正的 Markov 状态值。

推论与应用

把回报的一步递归代入定义,得到Bellman 期望方程;把策略也纳入优化,则得到Bellman 最优性方程。这两种方程把无限轨迹问题化为局部的一步一致性条件。

模型已知时可解线性方程或做动态规划,模型未知时可用蒙特卡洛回报、时序差分学习或函数逼近估计价值。策略梯度定理则用 qπ 给每次动作的对数概率梯度加权。不同算法共享价值对象,但采样分布、偏差和收敛保证不能互相照搬。

参考资料
  • Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Sec. 3.5.
  • Martin L. Puterman, Markov Decision Processes, Wiley, 1994, Sec. 6.1.
  • Dimitri P. Bertsekas and John N. Tsitsiklis, Neuro-Dynamic Programming, Athena Scientific, 1996, Sec. 2.2.
关系图谱21 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组