“设两个简单假设为 $H 0:P=P 0$ 与 $H 1:P=P 1$,二者被共同测度 $\mu$ 支配,密度分别为 $p 0,p 1$。给定 $0<\alpha<1$,若检验函数 $\var…”
形式陈述 ​
在模型
检验函数是可测映射
观察到
即参数为
检验的 size 定义为复合零假设上的最坏拒绝概率
若该值不超过预先指定的
直觉 ​
检验先承诺控制一种错误:当零假设中任一分布生成数据时,错误拒绝的概率不超过
复合假设中的上确界不可省略。只在某个方便的零参数点满足
例子与计算 ​
设
令
它是 level-
已超过
具体地,保留
拒绝。于是边界参数
边界与失败情形 ​
“未拒绝
检验必须在看数据前固定规则或完整选择流程。先尝试许多统计量、只报告最显著者,却仍按单次检验的
显著性不等于实际重要性。样本量很大时,极小效应也可能稳定拒绝精确零假设;效应大小与不确定性应另外报告。反之,未显著也不能推出效应为零。
检验结论依赖模型。若独立性、分布族或抽样机制不成立,名义 level 未必等于真实错误上界;稳健标准误或置换方法也各有自己的有效条件。
推论与应用 ​
简单零假设对简单备择下,Neyman–Pearson 引理说明在固定 level 内,似然比阈值检验具有最大功效。复合备择通常不存在对所有参数同时最强的检验,需要不变性、单调似然比或局部最优等附加结构。
检验可看作统计决策规则:行动为拒绝或不拒绝,损失按真实假设与行动赋值。置信集合通过反演一族 level-
参考资料
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 3。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 8。
- E. L. Lehmann, Testing Statistical Hypotheses, 2nd ed., Springer, 1986,Ch. 1–3。