“可以把 $P$ 看成世界的动力学,把奖励看成任务给这套动力学贴上的偏好标签。同一仓库机器人动力学可以配上“速度优先”或“能耗优先”的奖励,形成不同决策问题;同一奖励在不同转移核下也可能要求完…”
形式陈述 ​
在马尔可夫决策过程中,一般策略是概率核序列
若决策只依赖当前状态,写成
固定平稳策略后,受控过程变成转移核
其一步期望奖励为
连续动作时把求和换成积分。这里随机化先选择动作,再由环境转移;不能把“平均动作”送进非线性动力学来代替混合分布。
在有限、完全可观测、无限时域折扣 MDP 中,若奖励有界且每个状态有有限动作,则至少存在一个确定性平稳最优策略;所以求最优期望折扣回报时,无须遍历全部历史依赖随机规则。这是最优性定理的结论,不是“所有约束控制问题都可去随机化”的普遍事实。有限时域最优策略一般会依赖剩余时间。
有限时域策略应写成
给定
若奖励由
直觉
策略是控制器,MDP 是环境。策略把“处于这个状态”翻译成动作分布;环境再把状态—动作翻译成下一状态。把两者合成后,轨迹分布才被完全确定。随机策略不是含糊地“偶尔换个选择”,而是每个状态上一张可重复采样的明确分布。
平稳性说规则不看绝对时钟,并不说行为序列不变:状态变化会让同一张规则选出不同动作。马尔可夫性说规则只读当前状态,也不意味着它短视;如果状态值已编码长期后果,一个只看当前状态的动作仍可能是长期最优的。
例子与边界
沿用健康态
取
若仓库规定“每十次发货至少两次选备用线路”,满足约束可能需要记录已用次数,单纯的平稳状态策略未必够用;将计数器纳入状态后才可重新讨论平稳性。部分可观测问题中,基于当前观测的规则一般也不是马尔可夫策略,因为观测不等于隐状态;信念状态策略是另一层构造。
随机化在约束 MDP、多智能体博弈和探索阶段可能不可省。确定性平稳最优策略的存在结论依赖目标与假设,不能用来否定这些场景中的随机策略。
推论与应用
给定
策略还决定数据分布。在线学习中常说“样本来自环境”,但状态—动作访问频率实际上由环境和策略共同产生。评估一个与采样策略不同的目标策略时,支持重叠成为必要条件:目标策略会选的动作若在数据策略下概率为零,轨迹中没有可恢复的反事实信息。
参考资料
- Martin L. Puterman, Markov Decision Processes, Wiley, 1994, Secs. 2.1 and 6.2.
- Richard S. Sutton and Andrew G. Barto, Reinforcement Learning: An Introduction, 2nd ed., MIT Press, 2018, Sec. 3.3.
- Onesimo Hernández-Lerma and Jean B. Lasserre, Discrete-Time Markov Control Processes, Springer, 1996, Ch. 2.