Skip to content

方法Method

分布无关的分位数置信区间

Distribution-free quantile confidence interval · Exact order-statistic confidence interval

用固定秩的样本次序值夹住总体分位数,覆盖概率精确化为二项计数,无需估计密度或指定分布形状。

形式陈述 ​

不知道总体的形状和密度,能否仍给中位数或其他分位数一个有限样本保证?设 X1,…,Xn 是来自连续分布函数 F 的独立同分布样本,固定 p∈(0,1),qp=F←(p) 唯一,故 F(qp)=p。

在观察数据以前固定整数 0≤l<u≤n+1,以次序统计量构造

I(X)=[X(l),X(u)],X(0)=−∞,X(n+1)=+∞.

其覆盖概率精确为

P(qp∈I(X))=∑j=lu−1(nj)pj(1−p)n−j.

所以只须选秩使这项和至少为 1−α,便得到对全部上述连续总体都有效的置信区间。覆盖只依赖 n,p,l,u,不依赖未知密度;区间的数值宽度仍随总体形状和观察数据变化。

直觉

真正的分位位置未知,但每个样本落在它左侧的概率已知为 p。于是可以不问“这个位置的数值是多少”,先问“有多少个样本会落在它左边”。

若左侧样本数既不少于 l,又少于 u,真实分位就夹在第 l 与第 u 个样本值之间。把一个未知高度的问题转成一个已知概率的计数问题,正是分布无关性的来源。

例子与边界

八个观测的中位数区间 ​

取 n=8,p=1/2。区间 [X(2),X(7)] 覆盖当且仅当左侧计数介于二与六,因此

P(q1/2∈[X(2),X(7)])=1−2(1+8)28=238256≈0.9297.

它不能被称为至少 95% 覆盖的区间。改用 [X(1),X(8)],只排除零个或八个样本落在中位数左边的情况,覆盖变为

1−2256=254256≈0.9922.

若这八个排序观测为 1,2,4,5,7,9,10,13,两区间分别是 [2,10] 与 [1,13]。更宽区间的覆盖保证更高,但二项计数的离散性使保证无法按任意小步长调节。

有时所有有限端点都不够 ​

对五个观测的中位数,最宽的样本端点区间是 [X(1),X(5)],覆盖也只有 1−2/25=0.9375。任何更靠内的固定秩区间都不会达到 95%。

这时可以增加样本、接受较低覆盖,或允许单侧无穷端点;不能只把区间标签改成 95%。对很接近零或一的分位数,有限样本甚至很可能没有任何观测落在目标分位的某一侧,无穷端点的约定因此有实质作用。

推论与应用

覆盖恒等式的证明 ​

令

B=∑i=1n1{Xi<qp}.

连续性使 P(Xi=qp)=0,所以每个指标成功概率为 p,独立性给 B∼Binomial(n,p)。又因为真实分位几乎处处不与任何样本相等,

X(l)≤qp≤X(u)⟺l≤B≤u−1.

对二项分布求这个整数区间的概率,就是形式陈述中的公式。上限为 u−1 而不是 u,因为已有 u 个样本严格在目标左边时,第 u 个值也落在目标左边,右端点不再包住它。

怎样选秩 ​

一种直接方案是预先分配两侧错误率:选择 l,u 使

P(B<l)≤α/2,P(B≥u)≤α/2.

它通常给保守而对称的覆盖。也可在固定二项分布上枚举所有满足总覆盖要求的秩对,按秩宽或另一个预先指定标准选择。分布未知时,最短秩宽不保证最短数值长度。

若先看数据,再在许多候选区间中挑数值最短的一段,原来的固定秩覆盖公式就不再自动适用。选择步骤已经改变统计程序,需要重新校准。

精确覆盖与渐近分位正态的区别 ​

本方法不要求 f(qp)>0,甚至不要求密度存在,只要连续分布与分位约定满足条件即可。样本分位数的渐近线性化则借助正密度将秩误差转换为根号 n 的数值误差,通常给更便于近似计算的宽度。

遇到离散总体或大量并列值时,P(X<qp) 与 P(X≤qp) 可能夹住 p 而不等于它,前面的单一二项参数等式需要重新分析。不能直接沿用连续总体的精确覆盖数字。

对整个 CDF 或很多分位同时作保证,还可以先构造DKW 同时置信带再反演;那是在一次共同概率事件上控制所有阈值,与本页对一个固定分位的精确秩区间不同。

参考资料
关系图谱16 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具