形式陈述
设两个简单假设 公理库 统计假设检验 Statistical hypothesis test · Test function 在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。 为 H 0 : P = P 0 与 H 1 : P = P 1 ,二者被共同测度 μ 支配,似然密度 公理库 似然函数 Likelihood function 固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。 分别为 p 0 , p 1 。给定 0 < α < 1 ,若检验函数 φ ∗ : X → [ 0 , 1 ] 和常数 k ≥ 0 满足
φ ∗ ( x ) = { 1 , p 1 ( x ) > k p 0 ( x ) , 0 , p 1 ( x ) < k p 0 ( x ) , 在等号集合上可随机化,并且 E 0 [ φ ∗ ] = α ,则对任意其他满足 E 0 [ φ ] ≤ α 的检验,
E 1 [ φ ] ≤ E 1 [ φ ∗ ] . 即 φ ∗ 是所有 level-α 检验中对这个指定备择 P 1 功效最大的检验。若无法精确达到 α ,可取 size 不超过 α 的相应版本;离散样本空间常靠边界随机化填满差额。
似然比可写为 Λ ( x ) = p 1 ( x ) / p 0 ( x ) ,并对 p 0 ( x ) = 0 的集合采用扩展值约定。拒绝发生在 P 1 相对 P 0 更能解释数据的区域,而不是单看某个密度的绝对高度。
直觉
证明
阈值结构保证逐点不等式
( φ ∗ ( x ) − φ ( x ) ) ( p 1 ( x ) − k p 0 ( x ) ) ≥ 0. 积分后得到
E 1 [ φ ∗ ] − E 1 [ φ ] ≥ k { E 0 [ φ ∗ ] − E 0 [ φ ] } ≥ 0. 第一步来自逐点符号匹配:在 p 1 > k p 0 区域,φ ∗ = 1 不小于任意检验;在反向区域,φ ∗ = 0 不大于任意检验,两项乘积均非负。第二步使用候选检验的 size 约束。证明没有用渐近近似,是有限样本结论。
反向结论在适当非退化条件下也成立:任何最强 level-α 检验都必须几乎处处具有这种似然比阈值形态,否则可把拒绝概率从低似然比区域搬到高似然比区域,在不增加 size 的同时提高功效。
例子与边界
设单个观测 X ∼ N ( μ , 1 ) ,检验 H 0 : μ = 0 对 H 1 : μ = 1 。似然比为
p 1 ( x ) p 0 ( x ) = exp ( x − 1 2 ) , 随 x 单调增加,因此最强 level-α 检验在
X > z 1 − α 时拒绝。其备择功效为
P 1 ( X > z 1 − α ) = 1 − Φ ( z 1 − α − 1 ) . 取 α = 0.05 ,阈值约 1.645 ,功效为 1 − Φ ( 0.645 ) ≈ 0.259 。换备择为 μ = − 1 时,最强拒绝域改到左尾;这说明最强性针对指定 P 1 ,不是一个无方向的普遍标签。
边界与失败情形
引理不直接给出复合假设的 uniformly most powerful 检验。若备择同时含正、负两个方向,对一个方向最强的尾部会损害另一个方向,通常需不变性、无偏约束或其他准则。
把 generalized likelihood ratio test 称为“由 NP 引理保证最优”是错误的。NP 比较两个固定分布;复合假设中分子、分母各自最大化后变成数据依赖选择,最优性和极限分布需要另外证明。
边界随机化必须预先规定且与额外随机币结合。例如二项检验在某个成功次数上以概率 γ 拒绝;观察数据后主观决定不等于该检验。
密度版本在零测集上可变,但由共同测度定义的似然比检验只需几乎处处确定。若模型不支配,应改用 P 0 + P 1 作为共同有限支配测度。
若 P 1 在某集合有正质量而 P 0 质量为零,该集合的似然比是无穷,应优先纳入拒绝域且不消耗 size;反向由 P 0 独占的集合对提高 P 1 功效毫无帮助。共同支配表示把这种奇异部分也纳入逐点排序。
对 n 个独立正态位置观测,似然比只通过 X ¯ 进入,阈值为 n X ¯ > z 1 − α 。样本量增加会提高指定备择功效,但最强拒绝方向仍随 P 1 改变,不能由大样本消除备择选择。
推论与应用
简单假设的最强检验是统计检验理论的局部构件。单调似然比族 公理库 单调似然比 Monotone likelihood ratio · MLR property 任意较大参数对较小参数的似然比都随同一统计量单调的分布族结构。 提供共同的证据排序,Karlin–Rubin 定理 公理库 Karlin–Rubin 定理 Karlin–Rubin theorem · UMP one-sided test under MLR 具有单调似然比的分布族中,统计量阈值检验对单侧复合备择一致最强。 据此把同一阈值结构扩展到单侧复合假设并得到 UMP 结果。序贯情形把停止规则纳入模型,因而SPRT 公理库 序贯概率比检验 Sequential probability ratio test · SPRT 累积简单假设似然比并在越过上下边界时停止的序贯检验。 只把本引理作为固定样本对照。
引理还把二元测试错误与总变差距离联系起来:在等先验、无 size 非对称约束时,最小总错误由两个密度的高低区域决定。
阈值 k 随允许 size 改变,功效曲线由同一似然比排序产生。这个排序也给 ROC 曲线的上包络:任一其他统计量阈值规则在相同假阳性率下不能超过 NP 检验对指定 P 1 的真阳性率。
参考资料
Jerzy Neyman and Egon S. Pearson, “On the Problem of the Most Efficient Tests,” Philosophical Transactions of the Royal Society A 231, 1933。
Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses , 3rd ed., Springer, 2005,Ch. 3。
George Casella and Roger L. Berger, Statistical Inference , 2nd ed., Duxbury, 2002,§8.3。