形式陈述
对统计检验公理库统计假设检验Statistical hypothesis test · Test function在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。函数 ,其功效函数为
当 时,拒绝零假设属于第一类错误,点态错误概率为 ;检验的 size 是
当 时,未拒绝零假设属于第二类错误,其点态概率可写成相应拒绝事件的条件概率公理库条件概率Conditional probability在已知正概率事件发生后,把交集概率重新规范到该事件内部。补集:
因此备择上的功效就是 。对复合备择, 和功效都是参数函数,不存在一个脱离参数的“第二类错误率”,除非另外取上确界、平均或指定某个效应点。
名义显著性水平 是设计约束 。它不是观测数据后随机产生的量,也不等于某个备择下的第二类错误概率。
直觉
第一类错误控制“误报”,第二类错误描述“漏报”。把拒绝阈值调得更苛刻通常减少误报,却增加邻近备择下的漏报;固定样本量和重叠分布下,二者不能同时任意小。增加信息量、改善测量噪声或把备择推得更远,才可能整体改善权衡。
功效曲线比一个数字更完整:它显示检验对每个真实参数有多大概率发现偏离。靠近零假设边界时,任何 level 受控的常规检验功效通常接近 ;距离增大后才逐渐接近一。
例子与边界
设 , 已知,检验
level- 的单侧 检验在
时拒绝。若真实均值为 ,则 ,故功效为
取 、、,并考察 。因 ,功效约为
第二类错误概率约 。若样本量降到 ,功效变为 ;显著性水平没变,发现同一效应的能力却显著下降。
对每个固定 ,当 时上式功效趋于一,这叫点态一致性。但若备择也随样本量逼近边界,如 ,功效保持为 ,不会趋于一。声称“样本足够大一定检出”时,必须说明效应是否固定以及收敛对哪些参数一致。
边界与失败情形
与 不是互补概率,因为它们在不同参数集合下计算。只有固定某个备择参数时,功效与该点的第二类错误相加为一;不能写成“第一类错误加第二类错误等于一”。
观测到显著结果后,不能说“犯第一类错误的概率是 ”。频率保证是在假设固定、数据重复生成前对事件的概率陈述;给定本次数据后零假设真假的概率需要先验与 Bayesian 模型。
事后功效把观测效应代回功效公式,通常只是 p 值的变形,不能弥补设计阶段未做的样本量规划。规划应针对科学上有意义的效应范围、方差与预期丢失率预先计算。
模型误设可能同时破坏两类错误计算。比如把相关观测当独立会低估标准误,使实际第一类错误高于名义值;更高的“功效”可能只是阈值错误,而非信息增加。
推论与应用
给定目标功效 和最小相关效应 ,上述正态例可解出近似样本量
该公式明确显示样本量随噪声方差增长、随效应平方反比增长;它依赖已知方差与正态模型,实际设计需为估计方差和失访留余量。
ROC 曲线通过改变阈值展示真阳性率与假阳性率的权衡,但它遍历多个 level;选定实际阈值仍需结合错误损失公理库估计量、决策规则与风险Estimator and decision rule · Statistical risk从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。和目标人群的分布。简单假设下的最优功效边界由Neyman–Pearson 引理公理库Neyman–Pearson 引理Neyman–Pearson lemma简单零假设对简单备择下,给定显著性约束时似然比阈值检验具有最大功效。给出。
参考资料
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.1–3.4。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。
- Jacob Cohen, Statistical Power Analysis for the Behavioral Sciences, 2nd ed., Routledge, 1988,Ch. 1–2。