大 p 值不是零效应证据。样本量不足时,广泛的备择值都可能产生不极端的数据;要支持实际等价,应使用预设容忍区间的等效性检验或报告有精度保证的置信区间理路置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。。
可选停止会破坏固定样本校准。若每收一批数据就计算普通 p 值并在首次小于 时停止,最终误拒概率可能远超 。序贯检验理路序贯概率比检验Sequential probability ratio test · SPRT累积简单假设似然比并在越过上下边界时停止的序贯检验。、alpha spending 或由e-process理路检验鞅与 e-processTest martingale · Test supermartingale · e-process · 检验上鞅区分固定时刻的 e 值与可在停时读取的证据过程,并用非负检验上鞅构造随时有效检验。构造的 anytime-valid p 值使用各自的停止与校准条件。
多重检验中,即使每个 p 值单独有效,选择最小值再与 比较也不控制总体错误。Bonferroni 或闭合检验理路多重检验与族错误率Multiple testing · Familywise error rate · FWER同时检验多个假设时至少一次错误拒绝的概率及其 Bonferroni、Holm 控制。可控制族错误率,FDR 方法控制的是另一种错误指标;它们都改变联合决策规则,而非把原始 p 值重新解释为后验概率。
在边界约定协调的嵌套 level 检验族中,p 值是对全部显著性阈值的紧凑编码。置信集合—检验对偶理路置信集合与检验的对偶Confidence set and test duality · Test inversion逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。若反演同一套“ 时拒绝”规则,则参数值 被 置信集包含,当且仅当针对 的 p 值大于 。检验方向、模型与临界点约定都必须一致;连续零分布不能代替这项逐点边界约定。
报告 p 值时应同时给出统计量、检验方向、样本量、效应估计与不确定区间。这样能区分“统计上不协调”“效应有多大”和“估计有多精确”三个不同问题。
参考资料
Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.3。
George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§8.3。
Ronald L. Wasserstein and Nicole A. Lazar, “The ASA Statement on p-Values,” The American Statistician 70(2), 2016。