形式陈述 ​
对一个已固定的统计检验问题,零假设为
这称为零假设下的超均匀性。因而规则“当
若检验统计量
复合零假设需要对 nuisance 参数取最坏情况、使用枢轴分布或构造其他统一有效校准。短语“至少同样极端”只有在统计量与单侧/双侧排序规则已经声明后才有数学含义。
p 值也可定义为一族嵌套检验中使观测结果刚好被拒绝的最小 level:
其中
直觉 ​
p 值问的是:若零假设中的校准分布生成数据,得到当前统计量这么极端或更极端的结果有多罕见。它把连续的证据排序压缩到
它没有反转条件概率。计算的是
例子与计算 ​
设
零假设下
因此它会被 level
离散例中,若
可能的 p 值只落在有限网格上,所以其零分布不连续均匀,但仍满足超均匀条件。
若零假设扩为
二项右尾概率随
边界与失败情形 ​
大 p 值不是零效应证据。样本量不足时,广泛的备择值都可能产生不极端的数据;要支持实际等价,应使用预设容忍区间的等效性检验或报告有精度保证的置信区间。
可选停止会破坏固定样本校准。若每收一批数据就计算普通 p 值并在首次小于
多重检验中,即使每个 p 值单独有效,选择最小值再与
推论与应用 ​
连续模型和嵌套 level 检验下,p 值是对全部显著性阈值的紧凑编码。置信集合反演同一检验族:参数值
报告 p 值时应同时给出统计量、检验方向、样本量、效应估计与不确定区间。这样能区分“统计上不协调”“效应有多大”和“估计有多精确”三个不同问题。
参考资料
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.3。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§8.3。
- Ronald L. Wasserstein and Nicole A. Lazar, “The ASA Statement on p-Values,” The American Statistician 70(2), 2016。