Skip to content

定义Definition

统计假设检验

Statistical hypothesis test · Test function

在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。

形式陈述 ​

在统计模型 {Pθ:θ∈Θ} 中,把参数空间分成不相交集合 Θ0 与 Θ1。零假设和备择假设分别为

H0:θ∈Θ0,H1:θ∈Θ1.

检验函数是可测映射

φ:X→[0,1].

观察到 X=x 后,以概率 φ(x) 拒绝 H0。取值仅为 0,1 时是非随机化检验,拒绝域为 C={x:φ(x)=1}。检验的功效函数是

βφ(θ)=Eθ[φ(X)],θ∈Θ,

即参数为 θ 时的拒绝概率。

检验的 size 定义为复合零假设上的最坏拒绝概率

size(φ)=supθ∈Θ0Eθ[φ(X)].

若该值不超过预先指定的 α∈(0,1),则称 φ 是 level-α 检验。size 是实际拒绝概率的上确界,但不一定由某个参数点达到;level 是允许的上界;一个 level-0.05 检验的 size 可以是 0.032。

直觉

检验先承诺控制一种错误:当零假设中任一分布生成数据时,错误拒绝的概率不超过 α。然后在这个约束下争取对备择参数有较高拒绝概率。它不是给两个假设计算“相信程度”,而是设计一条重复使用时具有频率保证的决策规则。

在 θ∈Θ0 时,βφ(θ) 是第一类错误概率;在 θ∈Θ1 时,1−βφ(θ) 才是第二类错误概率。同一条功效曲线横跨两种解释,因此一个较小的 level 并未同时保证较小的漏检率。

复合假设中的上确界不可省略。只在某个方便的零参数点满足 5% 拒绝率,并不能保证整个零假设都受控;最不利参数可能在边界或内部另一处。

例子与边界

设 X1,…,X10 独立 Bernoulli(p),检验

H0:p≤12对H1:p>12.

令 S=∑iXi,采用拒绝域 S≥9。由于 Pp(S≥9) 随 p 单调增加,零假设上的最坏点是 p=1/2,故 size 为

P1/2(S≥9)=(109)+(1010)210=111024≈0.0107.

它是 level-0.05 检验,但较保守。若拒绝域改为 S≥8,size 为

(108)+(109)+(1010)210=561024≈0.0547,

已超过 0.05。可在 S=8 时以适当概率随机拒绝,使 size 精确达到 0.05;随机化是离散样本空间中填补概率跳跃的数学工具。

这里单调性也可以直接看见:用同一组独立 Ui∼Unif(0,1) 构造 Xi(p)=1{Ui≤p},则 p 增大时成功数逐样本不减,因此这些上尾拒绝规则的拒绝概率不减。

具体地,保留 S≥9 时必拒绝,并在 S=8 时以概率

γ=0.05−11/102445/1024≈0.8933

拒绝。于是边界参数 p=1/2 下总拒绝率恰为 0.05。在备择 p=0.8 下,此规则功效是 P0.8(S≥9)+γP0.8(S=8)≈0.646,所以即使真实成功率达到 0.8,仍有约 35.4% 的漏检概率。这个数把控制误报与发现效应的能力明确分开。

规则的随机币必须独立于样本且预先规定;观察到 S=8 后再凭研究者判断是否拒绝,不是这一可复现的随机化检验。

边界与失败情形 ​

“未拒绝 H0”不等于证明或接受 H0。它只表示当前数据没有越过这条按第一类错误校准的拒绝边界;样本量小或备择接近零假设时,检验可能缺乏功效。

检验必须在看数据前固定规则或完整选择流程。先尝试许多统计量、只报告最显著者,却仍按单次检验的 α 解释,会使真实 size 膨胀。选择、停止和多重比较都必须进入概率计算。

显著性不等于实际重要性。样本量很大时,极小效应也可能稳定拒绝精确零假设;效应大小与不确定性应另外报告。反之,未显著也不能推出效应为零。

检验结论依赖模型。若独立性、分布族或抽样机制不成立,名义 level 未必等于真实错误上界;稳健标准误或置换方法也各有自己的有效条件。

推论与应用

具体检验必须与假设结构匹配。似然比检验适合给定参数模型并能比较受限与完整似然上确界的场景;序贯概率比检验针对两个简单假设边观测边停止;置换检验依赖零假设下的交换性,以重排分布校准有限样本显著性;卡方拟合优度检验比较分类计数与指定概率,并依赖期望频数足够大时的渐近近似。它们都实现拒绝规则,但样本时序、模型假设与校准来源不同。似然比或 Pearson 统计量若只用渐近参考分布定阈值,得到的是相应渐近 level 声明;要承诺本页的有限样本上界,还须另有有限样本校准。

对于完全指定的连续分布,Kolmogorov–Smirnov 检验比较最大 CDF 偏差,Cramér–von Mises 检验累积概率坐标上的平方误差。它们在连续简单原假设下可用均匀样本校准;若参数先由同一批数据拟合,参考分布必须相应重建。

简单零假设对简单备择下,Neyman–Pearson 引理说明在固定 level 内,似然比阈值检验具有最大功效。复合备择通常不存在对所有参数同时最强的检验,需要不变性、单调似然比或局部最优等附加结构。

检验可看作统计决策规则:行动为拒绝或不拒绝,损失按真实假设与行动赋值。p 值编码观测统计量在整族 level 中的位置,置信集合反演则把 size 控制转成覆盖率保证。

固定两种相邻输入的输出分布后,最能暴露隐私差异的事件是似然比超过阈值的区域。隐私损失分布核算对这个区域积分 p−eεq 的正部,得到 DP 所需的最小加法松弛。它与检验拒绝区域的概率有关,却不是单纯的 P[L>ε],后者通常是较松的充分上界。

参考资料
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 3。

  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。

  • E. L. Lehmann, Testing Statistical Hypotheses, 2nd ed., Springer, 1986,Ch. 1–3。

  • Larry Wasserman, All of Statistics: A Concise Course in Statistical Inference, Springer, 2004,Ch. 10,Definition 10.1:功效、size 与 level,CMU 教材全文。

关系图谱29 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

暂未标注直接上位概念。

下位 / 直接特例

类型化关系