Skip to content

可选停止定理

Optional stopping theorem · Optional sampling theorem

在足以控制随机停止与极限交换的条件下,鞅的期望在停时前后保持不变。

形式陈述

(Mn,Fn)n0 是离散时间鞅,τ 是停时。首先,对每个确定的 N,停止过程 (Mnτ) 仍是鞅,因此

E[MNτ]=E[M0].

τN 几乎处处,则 MNτ=Mτ,立即得到

E[Mτ]=E[M0].

无界停时需要额外控制。一组常用充分条件是停止族 {Mnτ:n0} 一致可积且 τ< 几乎处处;此时 MnτMτ 几乎处处,并可把极限移入期望。另一种离散版本假设存在常数 C 使 |MnMn1|C 几乎处处,同时 Eτ<,也可推出上述结论。不同版本的条件不能任意拼接,结论必须与所用可积性假设匹配。

直觉

鞅的公平性说,在每个确定时刻以前已知全部信息后,下一步的条件均值没有偏移。合法的停时只根据已经看到的路径作决定,因此停止本身不能系统性挑中未来的好运。然而“不能偷看未来”还不够:若允许无限等待或不断放大赌注,少数极端路径可能承担越来越大的数值,使有限阶段保持的期望在极限中失真。

证明的核心因此分成两层。第一层完全由停时性质保证:截断在 N 以前的策略仍公平。第二层是分析问题:让 N 趋于无穷时,是否有支配收敛、一致可积或有界增量与有限期望时间来封住尾部。可选停止定理真正限制的不是“何时停”这一句话,而是随机时间与极端取值共同造成的尾部风险。

例子与边界

对对称随机游走 Sn,令 τ 为首次到达 ab 的时刻,其中 a,b 为正整数。停止前后状态被限制在有限区间,且停时几乎处处有限;对截断停时应用定理并控制极限可得

0=ESτ=aP(Sτ=a)+bP(Sτ=b),

从而 P(Sτ=b)=a/(a+b)。这不是“公平游戏不会输”的证明,而是把有界边界条件转成命中概率。

失败边界同样重要。令 τ=inf{n0:Sn=1}。对称随机游走最终命中 1 的概率为一,所以 Sτ=1,但 ES0=0;停时无界且期望无限,不能直接套用结论。倍增赌注策略则展示另一种失败:每个有限阶段仍可公平,赌注却无界增长,极小概率路径携带巨大损失,阻止极限与期望交换。

推论与应用

给出条件公平性,停时确保规则不读取未来,可选停止定理再补上尾部控制。三者结合可计算随机游走命中概率、期望访问次数和序贯检验的错误率,也能证明某些随机算法在自适应停止下仍保持无偏。

使用时应先写明选用的充分条件,再逐项验证,而不是在结论后附一句“满足技术条件”。如果目标只涉及有限时间,优先使用 Nτ 的有界版本;真正需要送 N 时,才检查一致可积或其他尾部条件。

参考资料
  • David Williams, Probability with Martingales, Cambridge University Press, 1991,Ch. 10, optional stopping。
  • MIT 6.436J/15.085J, Fundamentals of Probability, Martingales and Optional Stopping lecture notes。