均值估得准,不代表产品或读数本身集中。容忍区间面对的是后一类问题:希望输出的范围包含总体中至少一定比例,同时对这个比例声明保留重复抽样保证。这里必然出现两层概率,它们对应两个不同的随机来源。
形式陈述
含量和置信分别指向什么
设X = ( X 1 , … , X n ) 为IID样本 理路 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 ,来自正态总体 理路 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 N ( μ , σ 2 ) ,其中n ≥ 2 、μ ∈ R 、σ > 0 。另有独立未来观测Y 来自同一总体。由样本输出一个可测区间C ( X ) ,可有无穷端点。给定样本后的总体含量为
(1) c μ , σ ( X ) = P μ , σ { Y ∈ C ( X ) ∣ X } . 例如C ( X ) = [ L ( X ) , U ( X ) ] 时,
c μ , σ ( X ) = Φ ( U ( X ) − μ σ ) − Φ ( L ( X ) − μ σ ) . 固定0 < p < 1 、0 < γ < 1 。若对每个允许的( μ , σ ) 都有
(2) P X { c μ , σ ( X ) ≥ p } ≥ γ , 则C 称为含量p 、置信水平γ 的容忍区间 。内层概率是同一总体的含量,外层概率是重新抽取整份样本后,输出区间能否达到该含量。参数保持固定,并未因观察数据而成为具有后验概率的随机量。
精确单侧正态上限
记X ¯ , S 为通常样本均值与无偏样本方差的平方根,ν = n − 1 、z p = Φ − 1 ( p ) 。令q γ ( t ν ( δ ) ) 表示非中心t 理路 非中心χ²、t与F分布 Noncentral distributions · Noncentral chi-square distribution · Noncentral t distribution · Noncentral F distribution · 非中心卡方分布 · 非中心t分布 · 非中心F分布 先移动正态均值再平方或除以独立随机尺度,统一得到非中心χ²、t和F,并用Poisson混合与条件积分计算备择下的功效。 的γ 分位数。定义
(3) k n , p , γ = q γ ( t n − 1 ( n z p ) ) n , U ( X ) = X ¯ + k n , p , γ S . 则C ( X ) = ( − ∞ , U ( X ) ] 满足式(2),而且外层概率恰为γ 。对称地下限L ( X ) = X ¯ − k n , p , γ S 使[ L ( X ) , ∞ ) 有同样合同。这里上下限是分别使用的单侧程序;把两者拼成有限区间并不自动保留原来的p , γ 。
式(3)允许一般的p , γ ∈ ( 0 , 1 ) ,所以k 不必恒正;通常关心较高含量与置信时才得到正的扩张因子。分位数由连续严格递增的非中心t CDF唯一确定。
直觉
标准化把未知参数消掉
IID正态样本给
(4) Z = n ( X ¯ − μ ) σ ∼ N ( 0 , 1 ) , V = ( n − 1 ) S 2 σ 2 ∼ χ ν 2 , Z ⊥ V . 这是正态均值与样本尺度的独立分解 理路 Student t 分布 Student's t-distribution · t distribution 由独立正态分子与卡方随机尺度定义 t 分布,解释自由度、重尾机制及正态样本均值的精确推断。 。单侧含量至少p 等价于U ≥ μ + z p σ ,再写成
(5) n z p − Z V / ν ≤ n k . 因为− Z 仍为独立标准正态,左侧正是t ν ( n z p ) 。取其γ 分位数,立刻得到外层概率γ ,且它不含未知的μ , σ 。下限结论用Z 代替− Z ,分布相同。
非中心参数的符号和位置都很重要:它是n z p ,先加在正态分子,再除以随机样本尺度。把中心t分位数简单加上n z p ,一般会得到错误的因子。
三类区间的概率合同不同
均值置信区间 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 保证重复抽样时包含固定均值的概率。例如X ¯ ± t 1 − α / 2 , ν S / n 覆盖μ 的概率为1 − α 。
预测区间针对一个新Y 。由于Y − X ¯ 的方差为σ 2 ( 1 + 1 / n ) ,且该正态变量与S 独立,
Y − X ¯ S 1 + 1 / n ∼ t ν . 因此X ¯ ± t 1 − α / 2 , ν S 1 + 1 / n 对一个未来值有边缘覆盖1 − α 。由全期望公式 理路 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 ,这只说明E X c μ , σ ( X ) = 1 − α ,并未说明多少份样本会达到某个指定的含量p 。
容忍合同式(2)直接控制含量随机变量的下尾。比如一般0 ≤ c ≤ 1 的变量可能以概率.9 取1、以概率.1 取0;它平均为.9 ,却不能据此证明P ( c ≥ .9 ) ≥ .95 。平均覆盖与高置信含量是两个不同要求。
例子与边界
五个样本:均值结论与含量结论分开报告
仍取读数( − .1 , − .1 , 0 , .1 , .1 ) ,于是X ¯ = 0 、S = .1 、ν = 4 。TOST 理路 等效性检验与双单侧TOST Equivalence test · Two one-sided tests · TOST · 双单侧等效检验 将预设等效区间外的复合零假设拆成两个单侧检验,证明无需Bonferroni的整体校准、等尾区间包含规则与共享尺度下的真实功效。 可以在5%水平证明均值处于预设( − .1 , .1 ) 内。
现在任务改为:以γ = .95 的置信,给出至少p = Φ ( 1 ) ≈ .841345 总体含量的上限。由于z p = 1 ,式(3)需计算
(6) k = q .95 ( t 4 ( 5 ) ) 5 ≈ 2.80910992 . 因此精确因子给U ≈ .280910992 。非中心分布页的四自由度闭式支持直接向外包围,具体得到
F 4 , 5 ( 5 ⋅ 2.809 ) < .949994 < .95 , (7) F 4 , 5 ( 5 ⋅ 2.810 ) > .950051 > .95 . 所以2.809 < k < 2.810 。若需要保留至少95%的单侧保证,使用上端因子2.810 ,得到U = .281 ;不能把任意四舍五入的小数都视为向安全方向舍入。
这份程序未能认证“至少84.13%总体位于.1 以下”,因为其认证上限仍大于.1 。它没有证明真实含量必然不足。
图片加载失败 总体含量与重复抽样置信 左图三行对应不同概率事件,单侧容忍范围的左箭头延伸至负无穷;右图的水平线是外层置信.95 ,总体含量另外固定为Φ ( 1 ) 。
均值与总体集中程度逻辑上也确实不同:例如总体N ( 0 , 1 ) 的均值严格在( − .1 , .1 ) ,却仅有Φ ( .1 ) ≈ .539828 的总体位于.1 以下。
两个样本时化成最大值
取n = 2 , p = .5 , γ = .75 。此时z p = 0 ,非中心t回到中心t 1 ,即标准Cauchy;其.75 分位数为1,因此k = 1 / 2 。又有
S = | X 1 − X 2 | 2 , X ¯ + S 2 = max ( X 1 , X 2 ) . 它的至少一半总体含量事件,就是最大值不小于总体中位数,概率为1 − ( 1 / 2 ) 2 = 3 / 4 。这项特例还对一般连续IID总体成立;既有顺序统计量覆盖 理路 给定校准资料后的共形覆盖 Calibration-conditional conformal prediction · PAC conformal calibration · Training-conditional coverage 把部署规则的条件覆盖率视为随校准资料变化的随机量,以顺序统计量和精确二项尾选择满足双层概率目标的校准秩。 给出不依赖正态的另一条构造路线。一般n , p , γ 下式(3)则明确消费了正态位置尺度模型。
不可忽略的模型边界
n = 1 没有这里使用的样本方差;σ = 0 不满足标准化条件。样本若相关、来自混合总体或经过依赖观测值的筛选,式(4)一般失效。仅凭样本直方图近似对称,不能把精确正态容忍保证扩展到任意分布。
在非退化正态总体中,任何有限上限的含量都小于1,所以p = 1 不能沿用有限式(3)。固定p < 1 时,提高γ 要求更大的分位数和更保守的上限。观察后擅自调低p 或γ 以配合结论,也是在改变预先约定的报告任务。
推论与应用
可直接证明的双侧保守因子
希望输出[ X ¯ − k S , X ¯ + k S ] ,且总体含量至少p 。任选δ μ , δ σ ∈ ( 0 , 1 ) ,使
( 1 − δ μ ) ( 1 − δ σ ) ≥ γ . 令a = z 1 − δ μ / 2 、z = z ( 1 + p ) / 2 ,并令q δ σ , ν 为中心卡方 理路 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 的下侧δ σ 分位数。取
(8) k = ( z + a n ) ν q δ σ , ν . 证明同时考虑| Z | ≤ a 与V ≥ q δ σ , ν 。由式(4)的独立性,两事件交集概率恰为( 1 − δ μ ) ( 1 − δ σ ) 。交集上
| X ¯ − μ | ≤ a σ / n , S ≥ σ q δ σ , ν / ν , 所以k S ≥ z σ + | X ¯ − μ | ,从而输出区间包含[ μ − z σ , μ + z σ ] 。后者总体含量恰为p ,式(2)即成立。
如果只使用并集上界 理路 并集界 Union bound · Boole 不等式 多个坏事件中至少一个发生的概率,不超过各事件概率之和。 ,条件δ μ + δ σ ≤ 1 − γ 也足够;本正态模型保留独立性可得到较大的交集概率。式(8)有明确证明,但没有声称是最短区间或最小对称因子。
最小对称因子怎样精确定义
对实数a ,令r p ( a ) > 0 是方程
(9) Φ ( a + r ) − Φ ( a − r ) = p 的唯一解。左侧随r 连续严格增加,从0趋于1,所以解存在唯一。它随a 连续、关于a 偶对称,并随| a | 增加:固定r 时,对a ≥ 0 求导得ϕ ( a + r ) − ϕ ( a − r ) ≤ 0 ,因而偏离中心要用更大的半宽。
给定Z 后,区间X ¯ ± k S 的标准化中心是Z / n ,半宽为k V / ν 。其含量至少p 恰好等价于这个半宽至少r p ( Z / n ) 。因此对k > 0 ,精确置信函数是
(10) H ( k ) = E Z [ 1 − F χ ν 2 ( ν r p ( Z / n ) 2 k 2 ) ] . 每个固定Z 的条件成功概率随k 连续严格增加,从0趋于1;被积函数在[ 0 , 1 ] 中,控制收敛定理 理路 控制收敛定理 Dominated convergence theorem 几乎处处收敛且被同一可积函数控制时,可以交换极限与积分。 允许将参数极限移入期望,因此积分也连续并有相同两端极限;严格递增则由每个固定Z 处的严格增加直接给出。于是H ( k ) = γ 有唯一解;它是在固定中心X ¯ 、固定倍数半宽k S 这类程序中的最小合格因子。没有比较任意不对称或数据依赖形状的所有程序。
这也提供能复核的计算路线:先截断| Z | ≤ B ,尾部贡献放在[ 0 , P ( | Z | > B ) ] ;在[ 0 , B ] 分段,利用r p 随非负输入增加而让条件成功概率递减,用端点值乘每段的正态质量给上下和。式(9)用严格递增函数的可靠括界求解,中心卡方CDF也向外包围。连续性保证紧区间上下和随网格加细趋同,再增大B 控制尾部。外层寻找H ( k ) = γ 可采用非中心分布页的双探点收缩策略,避免恰遇分位数时无限等待一个中点判号。
一般算法的成本由外层括界更新、正态网格段数、内层r p 求解和中心CDF精度共同决定,不能简写成一次查表的常数成本。Howe等实用近似也可用于初选因子,但除非另有误差控制,近似公式本身不等于式(10)的精确认证。
参考资料