Skip to content

第一/第二类错误与检验功效

Type I and type II errors · Power function

检验在零假设下错误拒绝、在备择下未拒绝的概率及其参数化拒绝能力。

形式陈述

统计检验函数 φ(X)[0,1],其功效函数为

πφ(θ)=Eθ[φ(X)].

θΘ0 时,拒绝零假设属于第一类错误,点态错误概率为 πφ(θ);检验的 size 是

αφ=supθΘ0πφ(θ).

θΘ1 时,未拒绝零假设属于第二类错误,其点态概率为

βφ(θ)=Eθ[1φ(X)]=1πφ(θ).

因此备择上的功效就是 1βφ(θ)。对复合备择,β 和功效都是参数函数,不存在一个脱离参数的“第二类错误率”,除非另外取上确界、平均或指定某个效应点。

名义显著性水平 α 是设计约束 αφα。它不是观测数据后随机产生的量,也不等于某个备择下的第二类错误概率。

直觉

第一类错误控制“误报”,第二类错误描述“漏报”。把拒绝阈值调得更苛刻通常减少误报,却增加邻近备择下的漏报;固定样本量和重叠分布下,二者不能同时任意小。增加信息量、改善测量噪声或把备择推得更远,才可能整体改善权衡。

功效曲线比一个数字更完整:它显示检验对每个真实参数有多大概率发现偏离。靠近零假设边界时,任何 level 受控的常规检验功效通常接近 α;距离增大后才逐渐接近一。

例子与计算

X1,,XnN(μ,σ2)σ 已知,检验

H0:μμ0H1:μ>μ0.

level-α 的单侧 z 检验在

Z=n(X¯μ0)σ>z1α

时拒绝。若真实均值为 μ,则 ZN(n(μμ0)/σ,1),故功效为

π(μ)=1Φ(z1αn(μμ0)σ).

α=0.05n=25σ=1,并考察 μμ0=0.5。因 z0.951.645,功效约为

1Φ(1.6452.5)=Φ(0.855)0.804,

第二类错误概率约 0.196。若样本量降到 n=4,功效变为 1Φ(0.645)0.259;显著性水平没变,发现同一效应的能力却显著下降。

对每个固定 μ>μ0,当 n 时上式功效趋于一,这叫点态一致性。但若备择也随样本量逼近边界,如 μn=μ0+c/n,功效保持为 1Φ(z1αc/σ),不会趋于一。声称“样本足够大一定检出”时,必须说明效应是否固定以及收敛对哪些参数一致。

边界与失败情形

αβ 不是互补概率,因为它们在不同参数集合下计算。只有固定某个备择参数时,功效与该点的第二类错误相加为一;不能写成“第一类错误加第二类错误等于一”。

观测到显著结果后,不能说“犯第一类错误的概率是 5%”。频率保证是在假设固定、数据重复生成前对事件的概率陈述;给定本次数据后零假设真假的概率需要先验与 Bayesian 模型。

事后功效把观测效应代回功效公式,通常只是 p 值的变形,不能弥补设计阶段未做的样本量规划。规划应针对科学上有意义的效应范围、方差与预期丢失率预先计算。

模型误设可能同时破坏两类错误计算。比如把相关观测当独立会低估标准误,使实际第一类错误高于名义值;更高的“功效”可能只是阈值错误,而非信息增加。

推论与应用

给定目标功效 1β 和最小相关效应 Δ>0,上述正态例可解出近似样本量

n(σ(z1α+z1β)Δ)2.

该公式明确显示样本量随噪声方差增长、随效应平方反比增长;它依赖已知方差与正态模型,实际设计需为估计方差和失访留余量。

ROC 曲线通过改变阈值展示真阳性率与假阳性率的权衡,但它遍历多个 level;选定实际阈值仍需结合错误代价和目标人群的分布。

参考资料
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.1–3.4。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。
  • Jacob Cohen, Statistical Power Analysis for the Behavioral Sciences, 2nd ed., Routledge, 1988,Ch. 1–2。