Skip to content

p 值

p-value · P-value

在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。

形式陈述

对一个已固定的统计检验问题,零假设为 H0:θΘ0。随机变量 p(X)[0,1] 称为有效 p 值,若对所有 u[0,1] 都有

supθΘ0Pθ{p(X)u}u.

这称为零假设下的超均匀性。因而规则“当 p(X)α 时拒绝”对每个 θΘ0 都是 level-α 检验。若等号在全部 u 成立,p 值在相应零分布下精确均匀;离散模型中通常只有不等式,因而较保守。

若检验统计量 T 的大值更不利于 H0,简单零假设 θ=θ0 下常定义

p(x)=Pθ0{T(X)T(x)}.

复合零假设需要对 nuisance 参数取最坏情况、使用枢轴分布或构造其他统一有效校准。短语“至少同样极端”只有在统计量与单侧/双侧排序规则已经声明后才有数学含义。

p 值也可定义为一族嵌套检验中使观测结果刚好被拒绝的最小 level:

p(x)=inf{α:xCα},

其中 Cαα 单调扩大。这一观点把 p 值与检验规则直接连接起来。

直觉

p 值问的是:若零假设中的校准分布生成数据,得到当前统计量这么极端或更极端的结果有多罕见。它把连续的证据排序压缩到 [0,1],小值表示观测结果与该零模型较不协调。

它没有反转条件概率。计算的是 P(数据极端H0),不是 P(H0数据);后者还需要备择模型与先验。p 值也不度量效应大小,相同效应在不同样本量下可得到完全不同的 p 值。

例子与计算

X1,,XnN(μ,σ2)σ 已知,检验 H0:μ=μ0 对双侧备择。令

Z=n(X¯μ0)σ.

零假设下 ZN(0,1),观察到 zobs=2.10 时,双侧 p 值为

p=2{1Φ(|2.10|)}0.0357.

因此它会被 level 0.05 检验拒绝,却不会被 level 0.01 检验拒绝。单侧备择 μ>μ0 的 p 值约为 0.0179;检验方向必须在查看数据前确定,不能事后选择较小者。

离散例中,若 XBinomial(10,1/2) 且观察到 X=9,检验成功率偏大时的单侧 p 值为

P(X9)=1110240.0107.

可能的 p 值只落在有限网格上,所以其零分布不连续均匀,但仍满足超均匀条件。

若零假设扩为 H0:p1/2,可定义

p(x)=sup0p1/2Pp(Xx).

二项右尾概率随 p 增加,故上确界在边界 p=1/2 达到,数值仍为 11/1024。这一步不是随意“代入最接近的零值”,而是证明整个复合零假设上的最坏尾概率;若统计量不具单调性,最不利参数未必在边界。

边界与失败情形

p=0.03 不表示零假设有 3% 概率为真,也不表示重复实验有 97% 会复制结论。它只校准当前统计量在指定零模型下的尾部位置。

大 p 值不是零效应证据。样本量不足时,广泛的备择值都可能产生不极端的数据;要支持实际等价,应使用预设容忍区间的等效性检验或报告有精度保证的置信区间。

可选停止会破坏固定样本校准。若每收一批数据就计算普通 p 值并在首次小于 0.05 时停止,最终误拒概率可能远超 5%。顺序检验需要专门的停止规则、alpha spending 或 anytime-valid p 值。

多重检验中,即使每个 p 值单独有效,选择最小值再与 0.05 比较也不控制总体错误。Bonferroni、闭合检验或 FDR 方法改变的是多重决策规则,而非把原始 p 值重新解释为后验概率。

推论与应用

连续模型和嵌套 level 检验下,p 值是对全部显著性阈值的紧凑编码。置信集合反演同一检验族:参数值 θ01α 置信集包含,当且仅当针对 H0:θ=θ0 的 p 值大于 α,前提是检验方向和模型一致。

报告 p 值时应同时给出统计量、检验方向、样本量、效应估计与不确定区间。这样能区分“统计上不协调”“效应有多大”和“估计有多精确”三个不同问题。

参考资料
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.3。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§8.3。
  • Ronald L. Wasserstein and Nicole A. Lazar, “The ASA Statement on p-Values,” The American Statistician 70(2), 2016。