Skip to content

统计假设检验

Statistical hypothesis test · Test function

在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。

形式陈述

在模型 {Pθ:θΘ} 中,把参数空间分成不相交集合 Θ0Θ1。零假设和备择假设分别为

H0:θΘ0,H1:θΘ1.

检验函数是可测映射

φ:X[0,1].

观察到 X=x 后,以概率 φ(x) 拒绝 H0。取值仅为 0,1 时是非随机化检验,拒绝域为 C={x:φ(x)=1}。检验的功效函数是

βφ(θ)=Eθ[φ(X)],θΘ,

即参数为 θ 时的拒绝概率。

检验的 size 定义为复合零假设上的最坏拒绝概率

size(φ)=supθΘ0Eθ[φ(X)].

若该值不超过预先指定的 α(0,1),则称 φ 是 level-α 检验。size 是实际可达到的上确界,level 是允许的上界;一个 level-0.05 检验的 size 可以是 0.032

直觉

检验先承诺控制一种错误:当零假设中任一分布生成数据时,错误拒绝的概率不超过 α。然后在这个约束下争取对备择参数有较高拒绝概率。它不是给两个假设计算“相信程度”,而是设计一条重复使用时具有频率保证的决策规则。

复合假设中的上确界不可省略。只在某个方便的零参数点满足 5% 拒绝率,并不能保证整个零假设都受控;最不利参数可能在边界或内部另一处。

例子与计算

X1,,X10 独立 Bernoulli(p),检验

H0:p12H1:p>12.

S=iXi,采用拒绝域 S9。由于 Pp(S9)p 单调增加,零假设上的最坏点是 p=1/2,故 size 为

P1/2(S9)=(109)+(1010)210=1110240.0107.

它是 level-0.05 检验,但较保守。若拒绝域改为 S8,size 为

(108)+(109)+(1010)210=5610240.0547,

已超过 0.05。可在 S=8 时以适当概率随机拒绝,使 size 精确达到 0.05;随机化是离散样本空间中填补概率跳跃的数学工具。

具体地,保留 S9 时必拒绝,并在 S=8 时以概率

γ=0.0511/102445/10240.894

拒绝。于是边界参数 p=1/2 下总拒绝率恰为 0.05。规则的随机币必须独立于样本且预先规定;观察到 S=8 后再凭研究者判断是否拒绝,不是这一可复现的随机化检验。

边界与失败情形

“未拒绝 H0”不等于证明或接受 H0。它只表示当前数据没有越过这条按第一类错误校准的拒绝边界;样本量小或备择接近零假设时,检验可能缺乏功效。

检验必须在看数据前固定规则或完整选择流程。先尝试许多统计量、只报告最显著者,却仍按单次检验的 α 解释,会使真实 size 膨胀。选择、停止和多重比较都必须进入概率计算。

显著性不等于实际重要性。样本量很大时,极小效应也可能稳定拒绝精确零假设;效应大小与不确定性应另外报告。反之,未显著也不能推出效应为零。

检验结论依赖模型。若独立性、分布族或抽样机制不成立,名义 level 未必等于真实错误上界;稳健标准误或置换方法也各有自己的有效条件。

推论与应用

简单零假设对简单备择下,Neyman–Pearson 引理说明在固定 level 内,似然比阈值检验具有最大功效。复合备择通常不存在对所有参数同时最强的检验,需要不变性、单调似然比或局部最优等附加结构。

检验可看作统计决策规则:行动为拒绝或不拒绝,损失按真实假设与行动赋值。置信集合通过反演一族 level-α 检验得到,其覆盖率保证与对应检验的 size 控制互为两面。

参考资料
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 3。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。
  • E. L. Lehmann, Testing Statistical Hypotheses, 2nd ed., Springer, 1986,Ch. 1–3。