大 p 值不是零效应证据。样本量不足时,广泛的备择值都可能产生不极端的数据;要支持实际等价,应使用预设容忍区间的等效性检验或报告有精度保证的置信区间公理库置信区间Confidence interval · Confidence set由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。。
可选停止会破坏固定样本校准。若每收一批数据就计算普通 p 值并在首次小于 时停止,最终误拒概率可能远超 。顺序检验需要专门的停止规则、alpha spending 或 anytime-valid p 值。
多重检验中,即使每个 p 值单独有效,选择最小值再与 比较也不控制总体错误。Bonferroni、闭合检验或 FDR 方法改变的是多重决策规则,而非把原始 p 值重新解释为后验概率。
推论与应用
连续模型和嵌套 level 检验下,p 值是对全部显著性阈值的紧凑编码。置信集合—检验对偶公理库置信集合与检验的对偶Confidence set and test duality · Test inversion逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。反演同一检验族:参数值 被 置信集包含,当且仅当针对 的 p 值大于 ,前提是检验方向和模型一致。
同时检验多个假设时,单个有效 p 值必须交给族错误率控制公理库多重检验与族错误率Multiple testing · Familywise error rate · FWER同时检验多个假设时至少一次错误拒绝的概率及其 Bonferroni、Holm 控制。或 FDR 程序;按数据到达过程持续查看时,则要使用序贯检验公理库序贯概率比检验Sequential probability ratio test · SPRT累积简单假设似然比并在越过上下边界时停止的序贯检验。或其他 anytime-valid 校准。两种场景改变的是联合决策规则,不能靠重新描述同一个固定样本 p 值解决。
报告 p 值时应同时给出统计量、检验方向、样本量、效应估计与不确定区间。这样能区分“统计上不协调”“效应有多大”和“估计有多精确”三个不同问题。
参考资料
Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.3。
George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§8.3。
Ronald L. Wasserstein and Nicole A. Lazar, “The ASA Statement on p-Values,” The American Statistician 70(2), 2016。