形式陈述
对每个 ,设 是检验理路统计假设检验Statistical hypothesis test · Test function在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。点零假设 的非随机化 level- 规则:
定义未被拒绝参数组成的随机集合
则对任意 ,
所以 是覆盖至少 的置信集合理路置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。。注意这里没有把所有检验的错误概率相加:在真实参数为 时,漏掉真值只对应一个事件,即针对该 的检验拒绝。
反向地,若随机集合 满足 ,定义检验
则它对每个点零假设都是 level-。对偶来自同一事件的补集,不是近似类比。
直觉
检验族从“固定候选参数,观察数据后是否拒绝”出发;反演时固定数据,扫描所有候选参数,把未拒绝者保留下来。两个步骤交换了哪一项固定,却使用同一拒绝关系。
若检验统计量为 ,拒绝域为 ,置信集合就是解不等式
所得的全部 。该集合未必是单一区间;非单调统计量可产生不连通集合。
例子与边界
设 独立同分布于 , 已知; 表示标准正态分布的 分位数。双侧 检验在
时拒绝。保留所有不满足拒绝不等式的 ,得到
即
例如 ,取 ,标准误为 ,区间约为 。候选值 对应 ,被排除;候选值 对应 ,被保留。扫描全部候选参数,得到的正是上面的区间,而不只是对两个数的判断。
因此 在 level 被拒绝,当且仅当 不在对应 区间中。单侧检验反演为单侧置信界,而非同一个双侧区间。
复合假设与随机化
若检验复合零假设 ,可在参数空间中组织嵌套集合,但逐点反演最直接。nuisance 参数的 sup 校准、条件检验或 profile 处理会决定反演集合的覆盖。
随机化检验令 ,反演后严格说得到随机化置信程序,还需同一额外随机币决定边界参数是否纳入。忽略随机化会改变离散模型的精确覆盖。
边界与失败情形
把 p 值与区间对应时,还须统一边界约定。若规定 才拒绝,反演集为 ,与上面含端点的 区间一致;若规定 拒绝,则保留 的参数。连续模型中边界通常是零概率事件,但它仍影响某次数据恰在端点时的逻辑等价;离散模型尤其不能忽略。检验方向、尾部分配和校准方法也必须相同。
未拒绝的参数不等于被证明为真;置信集合整体覆盖是程序性质。集合中各点的“可信度”不是频率学后验概率。
若只对每个固定参数有渐近 level,反演只给点态渐近覆盖;参数靠近边界时可能不统一。有限样本对偶不会把渐近检验升级为精确区间。
p 值函数可一并反演:若 来自同一嵌套检验族,并采用 的拒绝约定,则 。当 p 值关于参数不单调时,集合可能不连通;把最小、最大端点间全部补齐会增加覆盖,却不再是原检验的精确反演。
对目标 ,可检验纤维零假设 并反演 。每个纤维内的 nuisance 参数都必须共同控制 size;plug-in 一个 nuisance 估计值或只挑最有利值,会产生另一套覆盖性质,不能沿用原对偶保证。
推论与应用
等效性检验反演可得到落在预设容忍范围内的区间判据;多参数似然比检验反演产生 profile likelihood 区域。
对偶允许在检验和区间之间选择更容易证明或计算的一侧,但所有 nuisance 与选择步骤必须同步带过去。选择后推断理路选择后推断与截断正态校准Post-selection inference · Selective inference · 选择性推断在同一观测先被筛选再用于推断时,按选择事件重算零分布,并由截断正态枢轴得到条件有效的检验和区间。给出完整实例:先在固定单侧筛选下构造截断正态枢轴,再证明其对均值单调,求出条件等尾区间的两个端点。条件检验的反演得到条件覆盖,不能偷偷换回未筛选的分布。
若检验族具有嵌套性,改变 会产生嵌套置信集合;若每个水平独立设计而拒绝域不嵌套,反演仍可逐水平覆盖,却无法用单一p 值理路p 值p-value在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。函数编码全部结果。报告整条置信曲线时必须验证这种跨水平协调。
对有限多个参数的同时置信集合,检验对象应是相应联合零假设或经多重性校准的检验族。逐参数各自 覆盖不等于所有坐标同时 覆盖,对偶会把同一个 multiplicity 问题原样带到集合侧。
参考资料
- UC Berkeley Stat 210a,p-values, confidence regions, and (mis-)interpreting Tests,2025 年课程讲义,章节 “Definition of a confidence region”“Duality of tests and confidence regions”。
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.5。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 9。
- David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 7。