形式陈述
给定策略公理库MDP 中的策略Policy in an MDP · MDP policy · 马尔可夫策略规定每个决策时刻如何由可用信息选择动作,并区分平稳、马尔可夫、历史依赖与随机策略。 与折扣回报公理库折扣回报Discounted return · Discounted cumulative reward · 折扣累计奖励将轨迹上未来奖励按几何权重汇总,并用递归分解连接即时奖励与后续决策价值。 ,状态值和动作值定义为
这里的期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。同时覆盖策略随机性、状态转移与奖励噪声。第一式在时刻 立即按 行动;第二式固定第一个动作是 ,从下一时刻起才按 行动。混淆这个时间界面会把行为策略与被评估策略错误地揉在一起。
平稳策略下,两者满足
以及优势函数
最优值定义为 、。有限折扣 MDP 中上确界可由确定性平稳策略达到;一般空间或无折扣情形需要额外的可测选择、紧性与存在性条件。
价值函数是条件均值,不是一次轨迹实际得到的回报,也不是状态本身固有的分数。改变策略、奖励或折扣因子都会改变 ;同一状态在谨慎策略下可能安全而高值,在冒险策略下可能低值。
若 且 ,则所有策略都有统一界
这不仅保证条件期望存在,也为动态规划初始化、误差证书和随机近似噪声控制提供尺度。若奖励整体加上常数 ,继续型折扣任务的每个策略价值整体加 ,动作的相对排序不变;但有状态依赖终止时,剩余步数不同会破坏这一简单平移。
直觉
回答“到了这里并继续照这套规则做,平均还能得到多少”; 则回答“先试这个动作,再照规则做,会怎样”。正因为 把第一个动作拆出来,比较 就能改进策略; 更适合概括策略在状态上的总体前景。
优势函数使用同一状态的平均行为作基线。正优势表示某动作优于策略在该状态的平均选择,而非表示其绝对回报为正。这个中心化性质既服务于策略改进,也会在策略梯度估计中降低方差。
例子与边界
考虑一个状态 ,动作“离开”立即得 后终止;动作“等待”立即得 并确定回到 。策略每次以 选两者,取 。由一次展开,
故 。两个动作值为
它们按策略平均确为 ,优势分别是 与 。这个例子还显示:等待的即时奖励虽为零,动作值并非零,因为它保留了未来机会。
若策略从未访问某状态, 作为“从该状态重新启动”的数学量仍可定义,但单靠该策略的一条长轨迹通常无法估计它。若回报不可积,条件期望可能不存在;若观测把多个隐状态合并,同一个观测上的单一价值会依赖隐藏状态的后验,不能当作真正的 Markov 状态值。
推论与应用
把回报的一步递归代入定义,得到Bellman 期望方程公理库Bellman 期望方程Bellman expectation equation · Bellman equation for a policy · 策略 Bellman 方程将固定策略的价值写成即时奖励与下一状态价值的递归期望,并以压缩映射刻画唯一解。;把策略也纳入优化,则得到Bellman 最优性方程公理库Bellman 最优性方程Bellman optimality equation · Optimal Bellman equation · 最优 Bellman 方程以一步动作最大化刻画最优价值,并由折扣最优 Bellman 算子的压缩性保证唯一不动点。。这两种方程把无限轨迹问题化为局部的一步一致性条件。
模型已知时可解线性方程或做动态规划,模型未知时可用蒙特卡洛回报、时序差分学习公理库时序差分学习Temporal-difference learning · TD learning · 时差学习用相邻时刻的奖励与自举价值之差构造随机近似,在完整回报到来前更新价值估计。或函数逼近估计价值。策略梯度定理则用 给每次动作的对数概率梯度加权。不同算法共享价值对象,但采样分布、偏差和收敛保证不能互相照搬。
参考资料
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Sec. 3.5.
- Martin L. Puterman, Markov Decision Processes, Wiley, 1994, Sec. 6.1.
- Dimitri P. Bertsekas and John N. Tsitsiklis, Neuro-Dynamic Programming, Athena Scientific, 1996, Sec. 2.2.