形式陈述
对每个 ,设 是检验公理库统计假设检验Statistical hypothesis test · Test function在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。点零假设 的非随机化 level- 规则:
定义未被拒绝参数组成的随机集合
则对任意 ,
所以 是覆盖至少 的置信集合公理库置信区间Confidence interval · Confidence set由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。。
反向地,若随机集合 满足 ,定义检验
则它对每个点零假设都是 level-。对偶来自同一事件的补集,不是近似类比。
直觉
检验族从“固定候选参数,观察数据后是否拒绝”出发;反演时固定数据,扫描所有候选参数,把未拒绝者保留下来。两个步骤交换了哪一项固定,却使用同一拒绝关系。
若检验统计量为 ,拒绝域为 ,置信集合就是解不等式
所得的全部 。该集合未必是单一区间;非单调统计量可产生不连通集合。
例子与边界
正态均值、已知方差时,双侧 检验在
时拒绝。保留所有不满足拒绝不等式的 ,得到
即
因此 在 level 被拒绝,当且仅当 不在对应 区间中。单侧检验反演为单侧置信界,而非同一个双侧区间。
复合假设与随机化
若检验复合零假设 ,可在参数空间中组织嵌套集合,但逐点反演最直接。nuisance 参数的 sup 校准、条件检验或 profile 处理会决定反演集合的覆盖。
随机化检验令 ,反演后严格说得到随机化置信程序,还需同一额外随机币决定边界参数是否纳入。忽略随机化会改变离散模型的精确覆盖。
边界与失败情形
“p 值大于 ”与“参数在区间内”等价,前提是 p 值、检验方向、尾部分配和区间来自同一嵌套检验族。混用不同校准方法会破坏对偶。
未拒绝的参数不等于被证明为真;置信集合整体覆盖是程序性质。集合中各点的“可信度”不是频率学后验概率。
若只对每个固定参数有渐近 level,反演只给点态渐近覆盖;参数靠近边界时可能不统一。有限样本对偶不会把渐近检验升级为精确区间。
p 值函数可一并反演:若 来自同一嵌套检验族,则 。当 p 值关于参数不单调时,集合可能不连通;把最小、最大端点间全部补齐会增加覆盖,却不再是原检验的精确反演。
对目标 ,可检验纤维零假设 并反演 。每个纤维内的 nuisance 参数都必须共同控制 size;plug-in 一个 nuisance 估计值或只挑最有利值,会产生另一套覆盖性质,不能沿用原对偶保证。
推论与应用
等效性检验反演可得到落在预设容忍范围内的区间判据;多参数似然比检验反演产生 profile likelihood 区域。
对偶允许在检验和区间之间选择更容易证明或计算的一侧,但所有 nuisance 与选择步骤必须同步带过去。
若检验族具有嵌套性,改变 会产生嵌套置信集合;若每个水平独立设计而拒绝域不嵌套,反演仍可逐水平覆盖,却无法用单一p 值公理库p 值p-value在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。函数编码全部结果。报告整条置信曲线时必须验证这种跨水平协调。
对有限多个参数的同时置信集合,检验对象应是相应联合零假设或经多重性校准的检验族。逐参数各自 覆盖不等于所有坐标同时 覆盖,对偶会把同一个 multiplicity 问题原样带到集合侧。
参考资料
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.5。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 9。
- David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 7。