“检验错误与功效是在不同参数条件下计算拒绝事件概率,不是给定拒绝后零假设真假的概率。后一个反向条件属于含先验的Bayesian 模型。把 $P(\text{reject}\mid H 0)$…”
形式陈述 ​
对统计检验函数
当
当
因此备择上的功效就是
名义显著性水平
直觉 ​
第一类错误控制“误报”,第二类错误描述“漏报”。把拒绝阈值调得更苛刻通常减少误报,却增加邻近备择下的漏报;固定样本量和重叠分布下,二者不能同时任意小。增加信息量、改善测量噪声或把备择推得更远,才可能整体改善权衡。
功效曲线比一个数字更完整:它显示检验对每个真实参数有多大概率发现偏离。靠近零假设边界时,任何 level 受控的常规检验功效通常接近
例子与计算 ​
设
level-
时拒绝。若真实均值为
取
第二类错误概率约
对每个固定
边界与失败情形 ​
观测到显著结果后,不能说“犯第一类错误的概率是
事后功效把观测效应代回功效公式,通常只是 p 值的变形,不能弥补设计阶段未做的样本量规划。规划应针对科学上有意义的效应范围、方差与预期丢失率预先计算。
模型误设可能同时破坏两类错误计算。比如把相关观测当独立会低估标准误,使实际第一类错误高于名义值;更高的“功效”可能只是阈值错误,而非信息增加。
推论与应用 ​
给定目标功效
该公式明确显示样本量随噪声方差增长、随效应平方反比增长;它依赖已知方差与正态模型,实际设计需为估计方差和失访留余量。
ROC 曲线通过改变阈值展示真阳性率与假阳性率的权衡,但它遍历多个 level;选定实际阈值仍需结合错误代价和目标人群的分布。
参考资料
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.1–3.4。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。
- Jacob Cohen, Statistical Power Analysis for the Behavioral Sciences, 2nd ed., Routledge, 1988,Ch. 1–2。