Skip to content

定义Definition

置信区间

Confidence interval · Confidence set

以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。

形式陈述 ​

对统计模型 {Pθ:θ∈Θ} 与目标 g(θ)∈T,置信集合是由样本统计量决定的可测随机集合 Cn(X)⊆T。若对每个 θ,

Pθ(n){g(θ)∈Cn(X)}≥1−α,

则称其为有限样本覆盖至少 1−α 的置信集合。实值目标且 Cn=[Ln,Un] 时称置信区间。

精确覆盖可以指等号对每个参数成立,也常宽松地指有限样本保证而非渐近保证。固定 n 时,上述“对每个 θ 都成立”与下面的统一下界完全等价:

infθ∈ΘPθ(n){g(θ)∈Cn}≥1−α.

渐近点态覆盖则是对每个固定 θ,

lim infn→∞Pθ(n){g(θ)∈Cn}≥1−α.

真正需要区分量词的是渐近保证。统一渐近覆盖要求

lim infn→∞infθ∈ΘPθ(n){g(θ)∈Cn}≥1−α.

每个样本量都先寻找最难覆盖的参数,再取极限。这强于逐个固定参数取极限;靠近边界且随 n 移动的参数序列,可能使一个逐点有效的区间持续欠覆盖。

直觉

参数在频率学模型中固定,区间端点随样本随机。覆盖率描述重复生成数据并重新构造区间时,长期有多少区间罩住真值。观测后端点固定,事件已经发生或未发生,不再有来自同一抽样机制的 95% 随机性。

置信度是构造程序的校准,不是对本次区间中各参数的概率分配。区间宽度反映精度;只追求覆盖而不约束宽度,整个参数空间永远覆盖却毫无信息。

例子与边界

连续枢轴:已知方差的正态均值 ​

若 X1,…,Xn 独立同分布于 N(μ,σ2),σ>0 已知,记 zq 为标准正态分布的 q 分位数,则

Z=n(X¯−μ)σ∼N(0,1).

由 P(−z1−α/2≤Z≤z1−α/2)=1−α 对不等式反解 μ,得到

Cn(X)=[X¯−z1−α/2σn,X¯+z1−α/2σn].

这对所有 μ∈R 有精确覆盖 1−α。若 n=100、σ=2、x¯=5.3,95% 区间为

5.3±1.96(0.2)=[4.908,5.692].

构造时先找到由样本与参数组成、分布却不依赖该参数的枢轴,再选择它的中央概率区域,最后反解出参数集合。枢轴可以含未知参数,因为最终输出的区间端点只依赖数据与已知量。

中央区间不是唯一选择。同一枢轴可把 α 全放在一侧得到单侧上界或下界,也可按尾部不对称分配;这些区间仍可有相同覆盖率,却有不同长度和科学含义。尾部分配应由问题预先决定,而不是看见数据后选择更有利的一侧。

离散反演:二项比例的 Clopper–Pearson 区间 ​

现在固定整数 n≥1,令 X1,…,Xn 独立同分布于 Bernoulli(p),未知参数 p∈[0,1]。成功数 S=∑iXi 服从二项分布。预先选定错误预算 α∈(0,1),记 a=α/2。观察到 S=s 后,对每个候选参数 p0 计算两个包含观测值本身的尾概率:

Ap0(s)=Pp0(S≥s)=∑k=sn(nk)p0k(1−p0)n−k,Bp0(s)=Pp0(S≤s)=∑k=0s(nk)p0k(1−p0)n−k.

若 Ap0(s)<a,观测到的成功数对 p0 来说过大;若 Bp0(s)<a,则成功数过小。规定任一条件成立就拒绝 p0,并保留其余候选值。这是置信集合与检验的对偶的一次具体构造:

C(s)={p0∈[0,1]:Ap0(s)≥a, Bp0(s)≥a}.

先证明覆盖,而不假定这个集合已经是区间。固定真实参数 p,由于 Ap(s) 随整数 s 不增,事件 Ap(S)<a 若非空,就等于 S≥k,其中 k 是使 Ap(k)<a 的最小整数。因此

Pp{Ap(S)<a}=Ap(k)<a.

空事件的概率为零。下尾同理:取使 Bp(j)<a 的最大整数 j,其拒绝事件为 S≤j,概率也不超过 a。于是由并集上界,

Pp{p∉C(S)}≤Pp{Ap(S)<a}+Pp{Bp(S)<a}≤2a=α.

证明中固定的是任意真实 p,故该保证对整个 [0,1] 成立。这里没有对无穷多个候选参数累加错误率:漏掉真值只涉及针对真值的那一个检验。

接着证明反演结果的形状。取独立的 Vi∼Uniform[0,1],同时构造 Xi(p)=1{Vi≤p}。当 p 增加时,每个 Xi(p) 以及总数 S(p) 都不减,所以固定 s 时 Ap(s) 不减、Bp(s) 不增。对 0<p<q<1 和 1≤s≤n,让指定的 s−1 个 Vi 落在 [0,p],一个落在 (p,q],其余落在 (q,1],便有一个正概率事件使 S(p)=s−1、S(q)=s。因此上尾在内部严格增加;对阈值 s+1 使用同一论证,下尾在 0≤s<n 时严格减少。

尾概率是 p 的连续多项式。对 s>0,A0(s)=0、A1(s)=1;对 s<n,B0(s)=1、B1(s)=0。所以相应的尾概率方程都有唯一根,反演结果就是闭区间

C(s)=[L(s),U(s)],{L(0)=0,AL(s)(s)=a,1≤s≤n,{BU(s)(s)=a,0≤s<n,U(n)=1.

两个端点不会交错。内部情形在 p=L(s) 处满足 Ap(s)=a,而 Ap(s)+Bp(s)=1+Pp(S=s),故 Bp(s)≥1−a>a;下尾还需继续下降才到达其根 U(s)。边界 s=0,n 则直接由上述约定处理。拒绝规则用严格不等号 <a,所以尾概率恰等于 a 的参数保留在区间中。

这就是等尾 Clopper–Pearson 区间。两尾各分配 α/2 的错误预算,并不表示每个参数下都恰好花完预算;“精确”在这里指有限样本覆盖至少 1−α,而非处处等号,也不表示区间最短。

十次试验九次成功:把端点算出来 ​

取 n=10、s=9、α=0.05,故 a=0.025。端点方程简化为

10L9(1−L)+L10=0.025,1−U10=0.025.

上界可直接解得 U=0.9751/10。下界令 f(p)=10p9(1−p)+p10−0.025,在 [0,1] 上二分:每次取中点 m;若 f(m)<0,把左端点换成 m,否则把右端点换成 m。初始两端异号,单调性保证每步都保留唯一根。四十步后括区宽度为 2−40<10−12,得到

L∈[0.5549838829711, 0.5549838829721],C(9)≈[0.55498388297, 0.99747142146].

后一个区间仅显示端点的舍入值;理论区间由尾方程定义。若计算程序必须保证数值结果包含理论区间,应对下界向下、上界向上取整,而不是把显示精度当作新的统计规则。

可用两个候选参数核对反演。若 p0=0.5,则

A0.5(9)=(109)+(1010)210=111024=0.0107421875<0.025,

所以 0.5 被排除。若 p0=0.6,则

A0.6(9)=10(0.6)9(0.4)+(0.6)10=0.0463574016,B0.6(9)=1−(0.6)10=0.9939533824.

两尾均不小于 0.025,所以 0.6 被保留。这些判断与算出的端点一致。

全失败与全成功也有明确答案:

C(0)=[0, 1−a1/n],C(n)=[a1/n, 1].

在本例中,它们分别约为 [0,0.30849710782] 和 [0.69150289218,1]。十次全失败并不证明 p=0,因此上界不会塌缩为零;同理,十次全成功也不能把参数确定为一。

覆盖率核对:同一程序重新抽样 ​

区间算完以后,覆盖率问题还要换回“固定真值、让样本变化”的视角。仍取 n=10,假设真实 p=0.5。此时

P0.5(S≤1)=111024<0.025,P0.5(S≤2)=561024>0.025.

利用二项分布在 p=0.5 时的对称性,真值被保留恰好对应 S=2,…,8。所以实际覆盖率为

P0.5{0.5∈C(S)}=1−2111024=10021024=0.978515625.

这里的 97.8515625% 来自对所有可能样本结果求和,不是对已经观察到的 C(9) 赋予概率。离散尾部无法恰好截出 2.5% 的质量,因而留下了未用完的错误预算。

同一模型若直接使用 Wald 区间,令 p^=S/10,得到

CW(S)=[p^−1.96p^(1−p^)10,p^+1.96p^(1−p^)10].

当 s=9 时约为 [0.7141,1.0859]。它既越过参数空间,也比刚才的精确区间窄,但宽度本身不能说明校准好坏。在真实 p=0.5 时,逐一检查 s=0,…,10,条件 |s/10−0.5|≤1.96(s/10)(1−s/10)/10 仅在 s=3,…,7 成立。因此其实际覆盖率是

P0.5{0.5∈CW(S)}=1−21+10+451024=0.890625.

把 Wald 区间截到 [0,1] 内也不会改变这一数值:对本来就在 [0,1] 中的真值 0.5,截断前后的包含事件完全相同。修正端点越界,并没有修正这里的欠覆盖。

边界与失败情形 ​

观测后说“μ 以 95% 概率位于 [4.908,5.692]”不是上述频率学陈述。若要给参数条件概率,必须指定先验和后验模型。

Wald 区间 θ^±zse^ 常只有渐近覆盖;上面的有限求和展示了小样本欠覆盖,参数接近边界或弱识别时还可能出现其他失效机制。

可选停止或数据依赖选择会改变覆盖事件分布。反复查看普通区间直到排除零再停止,不保留固定样本 95% 覆盖;置信序列把所有时间的覆盖放入同一个概率事件,才能在同一错误预算下持续查看。

Clopper–Pearson 使用非随机化的等尾规则。把样本结果按零假设下的点概率排序来定义另一种双侧二项检验,反演时一般得到不同区间;若在离散拒绝边界加入随机化,则还需把同一个额外随机变量纳入置信程序。检验都叫“双侧”并不足以使其端点相同。

含干扰参数时,简单枢轴往往不存在。代入估计区间、剖面似然区间或对干扰参数取最坏情况,会给出不同覆盖性质;把未知量换成估计值后,必须用有限样本定理或一致性与 Slutsky 链条重新校准。

推论与应用

反演一族 level-$\alpha$ 检验可构造置信集合:保留所有未被对应点零假设拒绝的参数。双侧检验与区间必须使用一致的尾部和干扰参数处理方式;整族显著性水平还可由p 值编码。

比较区间方法应同时查看覆盖、期望长度、端点行为和模型鲁棒性;单个数据集上的窄区间不能证明程序校准良好。

分布无关的分位数区间直接选定两个样本秩,并把覆盖事件改写成二项计数区间。它对连续总体给出有限样本覆盖,无须先估计分位点密度;但秩必须预先规定,小样本时有限端点也未必能达到指定覆盖率。

若 g 是一一单调变换,C=[L,U] 对 θ 覆盖时,g(C) 对 g(θ) 具有相同覆盖事件;递减变换需交换端点。直接对变换后估计量重新套对称标准误区间一般只是另一种渐近方法,有限样本端点和覆盖可能不同。

分割共形预测也构造区间或集合,但覆盖目标是一个未来响应,概率还平均了校准数据和新观测的随机性。它的边际预测覆盖不等于这里对固定总体参数的置信覆盖,也不自动保证每个固定输入的条件覆盖。

参考资料
  • C. J. Clopper and E. S. Pearson, The Use of Confidence or Fiducial Limits Illustrated in the Case of the Binomial, Biometrika 26(4), 1934, pp. 404–413;pp. 406–407 的式 (4)–(5) 与尾部反演,p. 410 的全失败、全成功端点。链接为原文扫描件镜像;本文数值直接求解尾方程,不取自原文的近似插值图表。
  • Lawrence D. Brown, T. Tony Cai and Anirban DasGupta, Interval Estimation for a Binomial Proportion, Statistical Science 16(2), 2001, pp. 101–133,§4.2.1,p. 113 的 Clopper–Pearson 端点定义与保守性;§2 的 Wald 覆盖问题。
  • Siva Balakrishnan, 36-705: Intermediate Statistics, Lecture 25, Carnegie Mellon University, 2019,p. 25-1 的覆盖定义、§25.1 的检验反演及 §25.2.1 的枢轴。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 9。
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.5。
  • David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 7。
关系图谱14 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系