Skip to content

置信区间

Confidence interval · Confidence set

由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。

形式陈述

统计模型 {Pθ:θΘ} 与目标 g(θ)T,置信集合是由样本统计量决定的可测随机集合 Cn(X)T。若对每个 θ

Pθ(n){g(θ)Cn(X)}1α,

则称其为有限样本、点态覆盖至少 1α 的置信集合。实值目标且 Cn=[Ln,Un] 时称置信区间。

精确覆盖可以指等号对每个参数成立,也常宽松地指有限样本保证而非渐近保证。统一诚实覆盖要求

infθΘPθ(n){g(θ)Cn}1α.

渐近点态覆盖则是对每个固定 θ

lim infnPθ(n){g(θ)Cn}1α.

这些量词不可互换;边界附近随 n 改变的参数序列可能揭示点态区间的不统一失效。

直觉

参数在频率学模型中固定,区间端点随样本随机。覆盖率描述重复生成数据并重新构造区间时,长期有多少区间罩住真值。观测后端点固定,事件已经发生或未发生,不再有来自同一抽样机制的 95% 随机性。

置信度是构造程序的校准,不是对本次区间中各参数的概率分配。区间宽度反映精度;只追求覆盖而不约束宽度,整个参数空间永远覆盖却毫无信息。

例子与推导

XiN(μ,σ2)σ 已知,则

Z=n(X¯μ)σN(0,1).

P(z1α/2Zz1α/2)=1α 对不等式反解 μ,得到

Cn(X)=[X¯z1α/2σn,X¯+z1α/2σn].

这对所有 μR 有精确覆盖 1α。若 n=100σ=2x¯=5.395% 区间为

5.3±1.96(0.2)=[4.908,5.692].

状态轨迹是先找参数与统计量组成的已知分布枢轴,再选中央概率区域,最后把随机不等式反演为参数集合。

中央区间不是唯一选择。同一枢轴可把 α 全放在一侧得到单侧上界或下界,也可按尾部不对称分配;这些区间仍可有相同覆盖率,却有不同长度和科学含义。尾部分配应由问题预先决定,而不是看见数据后选择更有利的一侧。

边界与失败情形

观测后说“μ95% 概率位于 [4.908,5.692]”不是上述频率学陈述。若要给参数条件概率,必须指定先验和后验模型。

Wald 区间 θ^±zse^ 常只有渐近覆盖。二项比例接近零或一、小样本、参数边界、弱识别时,它可越出参数空间并严重欠覆盖。

可选停止或数据依赖选择会改变覆盖事件分布。反复查看普通区间直到排除零再停止,不保留固定样本 95% 覆盖;顺序有效 confidence sequence 需要对所有时间同时覆盖的不同保证。

离散模型通常无法对每个参数取得完全相同的精确覆盖,保守区间可能超过名义值。报告“exact”时应说明是有限样本至少覆盖还是处处等号。

含 nuisance 参数时,简单枢轴往往不存在。plug-in 区间、profile likelihood 区间或对 nuisance 取最坏情况会给出不同覆盖性质;只把未知量换成估计值,必须用有限样本定理或一致性与 Slutsky 链条重新校准。

推论与应用

反演一族 level-α 检验可构造置信集合:保留所有未被对应点零假设拒绝的参数。双侧检验与区间必须使用一致的尾部和 nuisance 处理方式。

比较区间方法应同时查看覆盖、期望长度、端点行为和模型鲁棒性;单个数据集上的窄区间不能证明程序校准良好。

g 是一一单调变换,C=[L,U]θ 覆盖时,g(C)g(θ) 具有相同覆盖事件;递减变换需交换端点。直接对变换后估计量重新套对称标准误区间一般只是另一种渐近方法,有限样本端点和覆盖可能不同。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,Ch. 9。
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,§3.5。
  • David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 7。