形式陈述
不知道总体的形状和密度,能否仍给中位数或其他分位数一个有限样本保证?设 是来自连续分布函数 的独立同分布样本公理库独立同分布样本IID sample · Independent and identically distributed sample以乘积分布描述来自同一总体的独立重复观测。,固定 , 唯一,故 。
在观察数据以前固定整数 ,以次序统计量公理库顺序统计量Order statistic有限样本按键排序后第 k 个位置的值,保留重复出现的次数。构造
其覆盖概率公理库置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。精确为
所以只须选秩使这项和至少为 ,便得到对全部上述连续总体都有效的置信区间。覆盖只依赖 ,不依赖未知密度;区间的数值宽度仍随总体形状和观察数据变化。
直觉
真正的分位位置未知,但每个样本落在它左侧的概率已知为 。于是可以不问“这个位置的数值是多少”,先问“有多少个样本会落在它左边”。
若左侧样本数既不少于 ,又少于 ,真实分位就夹在第 与第 个样本值之间。把一个未知高度的问题转成一个已知概率的计数问题,正是分布无关性的来源。
例子与边界
八个观测的中位数区间
取 。区间 覆盖当且仅当左侧计数介于二与六,因此
它不能被称为至少 覆盖的区间。改用 ,只排除零个或八个样本落在中位数左边的情况,覆盖变为
若这八个排序观测为 ,两区间分别是 与 。更宽区间的覆盖保证更高,但二项计数的离散性使保证无法按任意小步长调节。
有时所有有限端点都不够
对五个观测的中位数,最宽的样本端点区间是 ,覆盖也只有 。任何更靠内的固定秩区间都不会达到 。
这时可以增加样本、接受较低覆盖,或允许单侧无穷端点;不能只把区间标签改成 。对很接近零或一的分位数,有限样本甚至很可能没有任何观测落在目标分位的某一侧,无穷端点的约定因此有实质作用。
推论与应用
覆盖恒等式的证明
令
连续性使 ,所以每个指标成功概率为 ,独立性给 。又因为真实分位几乎处处不与任何样本相等,
对二项分布公理库二项分布Binomial distribution固定次数独立同概率 Bernoulli 试验中成功总数的离散分布。求这个整数区间的概率,就是形式陈述中的公式。上限为 而不是 ,因为已有 个样本严格在目标左边时,第 个值也落在目标左边,右端点不再包住它。
怎样选秩
一种直接方案是预先分配两侧错误率:选择 使
它通常给保守而对称的覆盖。也可在固定二项分布上枚举所有满足总覆盖要求的秩对,按秩宽或另一个预先指定标准选择。分布未知时,最短秩宽不保证最短数值长度。
若先看数据,再在许多候选区间中挑数值最短的一段,原来的固定秩覆盖公式就不再自动适用。选择步骤已经改变统计程序,需要重新校准。
精确覆盖与渐近分位正态的区别
本方法不要求 ,甚至不要求密度存在,只要连续分布与分位约定满足条件即可。样本分位数的渐近线性化公理库样本分位数的渐近线性化Sample quantile asymptotics · Bahadur representation for a sample quantile在目标分位附近密度连续且为正时,经验分位的随机逆可线性化,余项由局部经验分布振荡控制。则借助正密度将秩误差转换为根号 的数值误差,通常给更便于近似计算的宽度。
遇到离散总体或大量并列值时, 与 可能夹住 而不等于它,前面的单一二项参数等式需要重新分析。不能直接沿用连续总体的精确覆盖数字。
对整个 CDF 或很多分位同时作保证,还可以先构造DKW 同时置信带公理库Dvoretzky–Kiefer–Wolfowitz 不等式Dvoretzky-Kiefer-Wolfowitz inequality · DKW inequality · DKW-Massart inequality经验分布函数在全部实数阈值上的最大误差具有统一有限样本指数界,可直接形成整条分布函数的置信带。再反演;那是在一次共同概率事件上控制所有阈值,与本页对一个固定分位的精确秩区间不同。
参考资料