Skip to content

序贯概率比检验

Sequential probability ratio test · SPRT

累积简单假设似然比并在越过上下边界时停止的序贯检验。

算法

检验简单假设 H0:P=P0H1:P=P1。观测依次到达,累计似然比

Λn=i=1np1(Xi)p0(Xi),Zn=logΛn.

选边界 0<B<1<A:若 ΛnA 停止并拒绝 H0;若 ΛnB 停止并接受 H0;居中则继续。停止时间

τ=inf{n:Λn(B,A)}

相对于观测过滤是停止时刻

Wald 近似边界为 A(1β)/αBβ/(1α),目标第一、第二类错误分别为 α,β。离散步长会越界,实际错误通常只近似目标,可用精确递推或模拟校准。

状态轨迹

每个观测把 log likelihood ratio 增加

Yi=logp1(Xi)/p0(Xi).

P1 下其均值是 D(P1P0)>0,轨迹倾向上边界;在 P0 下均值为 D(P0P1)<0,倾向下边界。困难样本会在中间徘徊,自动收集更多数据。

Bernoulli p0=0.4,p1=0.6 时,成功增加 log(1.5),失败增加 log(2/3)。证据逐步加总,不是每一步重新做独立固定样本检验。

性质

在满足误差约束的序贯检验中,SPRT 对两个简单假设具有期望样本量最优性质。证明使用似然比鞅、可选停止和信息下界;它不是NP 引理的直接固定样本复述。

错误界与期望样本量

若忽略越界 overshoot,A(1β)/αBβ/(1α) 来自终止似然比的两点近似。严格控制使用 likelihood-ratio martingale 与可选停止;离散增量使实际终值越过边界,因此公式只是近似。

p0=0.4,p1=0.6α=β=0.05,log 边界约 ±2.944。成功增量 log1.50.405,失败增量 log(2/3)0.405。连续八次成功使轨迹到 3.24 并拒绝;成功失败交替则证据抵消并继续。

P1 下单步平均增量为 D(P1P0)>0,期望样本量近似

E1τ(1β)logA+βlogBD(P1P0).

两假设越近,KL 越小,平均等待越长。这是序贯效率的定量来源。

边界

普通固定样本 p 值反复查看并停止不等于 SPRT,会膨胀错误率。SPRT 边界、假设和停止规则必须预先规定。

真实分布位于 P0,P1 之间时,停止时间可能很长;必须设计最大样本量、截断规则及相应再校准。依赖观测会破坏独立似然乘积。

截止时强制决定会改变两类错误,不能沿用无限期 SPRT 的保证。自适应抽样还要使用给定历史的条件 likelihood ratio;忽略动作机制可能破坏鞅性质。

复合假设的 mixture SPRT、GLR 序贯检验需先验或估计 nuisance 参数,各有不同保证。

似然比过程在 H0 下是非负均值一鞅,因此 Ville 不等式给

P0(supnΛn1/α)α.

只用上边界即可构造 anytime-valid 检验;双边 SPRT 还要同时设计接受错误。这个鞅界不要求预先固定查看次数,却要求 likelihood ratio 条件正确。

实际试验常采用 group sequential:只在若干预定 information times 查看统计量。Pocock 边界近似均匀分配严格程度,O'Brien–Fleming 早期更严、后期接近固定样本阈值。两者不是 SPRT 的简单离散化,需整体计算 alpha spending。

expected sample size 最优性针对两个简单假设和给定错误上限。加入观察成本、延迟结局、批量采样或第三种行动后,动态规划可能给不同边界。

报告序贯结果应包含计划边界、实际停止时刻、越界方向、最大样本规则和是否存在未成熟结局。只报告停止时普通 p 值会抹掉路径依赖。

若两类错误代价不对称,边界距离也应不对称:更严格控制误拒 H0 会提高上边界,通常延长在 P1 下作出拒绝所需证据。边界设计把错误预算转成样本量权衡,不存在同时无限降低两类错误且不增加观测的免费选择。

SPRT 接受 H0 是在指定 P0P1 二点决策中选择前者,不证明现实参数精确等于 θ0。indifference region 的选择决定“接受”实际含义。

参考资料
  • Abraham Wald, Sequential Analysis, Wiley, 1947。
  • David Siegmund, Sequential Analysis, Springer, 1985。
  • Tze Leung Lai, “Sequential Analysis: Some Classical Problems and New Challenges,” Statistica Sinica 11, 2001。