形式陈述
设 独立同分布于未知总体 ,统计量 用来估计 。非参数 bootstrap 先构造经验测度公理库经验测度Empirical measure · Empirical distribution把有限观测的重复频数编码为原子概率测度。
再在原数据给定后,从 独立抽取 个值 ,计算同一规则 。每次等概率抽一个原样本位置,因此允许重复,也可能遗漏部分观测。星号表示重采样随机性; 表示条件于原数据的概率、期望和分布。
方法的理论对象与计算输出需要分开。给定合适的误差放大速度 ,有三条分布:
| 对象 |
定义 |
随什么改变 |
| 真实抽样律 |
|
由总体、样本量与抽样设计决定,通常未知 |
| 理想 bootstrap 律 |
|
原样本变化时,这条条件概率测度也变化 |
| 有限次模拟分布 |
|
固定原样本后,仍随 次模拟变化 |
理想条件律在执行模拟之前就已经定义;小样本时甚至可以枚举求出。增加 近似的是 ,而 bootstrap 理论研究的是 能否近似真实抽样律公理库统计量与抽样分布Statistic · Sampling distribution样本的可测数据摘要,以及该摘要在指定统计模型与重复抽样设计下的推前分布。 。均值通常取 ,后文 Uniform 支持端点模型中的最大值则需要 ;不说明速率,就可能在两个退化极限之间得到没有推断价值的“吻合”。
均值为什么有效:条件一致性的证明
陈述与量词
把原样本看成同一条无限 IID 序列的前 项,假设
记 、。结论是:存在一个原始抽样概率为 的数据路径集合,在其中每条路径上都有
这里第一式是冻结原数据路径之后的依分布收敛公理库依分布收敛Convergence in distribution · Weak convergence分布函数在极限分布连续点处收敛的随机变量收敛概念。:对每个有界连续函数 ,条件期望 趋于相应正态积分。几乎必然是对原始数据路径而言,不是声称重采样随机变量 本身几乎必然趋于某个正态随机变量。第二式称为 Kolmogorov 距离下的强一致性,也蕴含依概率的一致性。这个均值结论只要求有限二阶矩,不给出收敛速度。
冻结路径之后,需要三角阵列定理
由强大数定律公理库强大数定律Law of large numbers · Strong law of large numbers · SLLN独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。分别处理 与 ,
几乎必然成立。固定一条满足这些结论的数据路径。在第 行定义
行内变量条件独立、均值为零,总方差为 ,而它们的和就是 。随着 改变,重采样分布 也改变,所以不能仅对一个固定分布套用通常的 IID 中心极限定理。
这里使用 Lindeberg–Feller 三角阵列定理的下述形式:若每行独立且中心化,,并且对每个 ,
则行和 。不同行之间不要求独立。对本问题,尚需证明的条件恰为
有限二阶矩如何控制变化中的尾部
对每个正整数 ,再要求这条原始路径满足 和 的强大数定律。它们都可积,且这里只取可数多个 ,因此与前述事件相交后,仍是同一个概率为 的事件。
固定整数 。当 足够大, 且 。若尾部指示函数取一,则
由 ,有
先令 ,得到
再沿整数令 ,有限二阶矩使右侧趋于零。这就验证了 Lindeberg 条件,三角阵列定理给出条件正态极限。这里关键是固定截断后再取极限;“每个经验分布都只有有限个点”本身不能控制随 改变的尾部。
从共同极限到两条分布接近
设 为 的分布函数。收敛到连续分布函数时,逐点收敛可升级为一致收敛:给定 ,先选两端点使极限分布两侧尾概率均小于 ,再把中间区间分成有限网格,使每格的 增量小于 。网格点的收敛与分布函数单调性把格内误差控制为网格误差加 ;两端用尾概率控制。令 即得一致收敛。
于是条件极限给出 。通常的中心极限定理公理库中心极限定理Central limit theorem适当归一化的独立随机变量和在分布上趋于正态分布。对原样本给出 ,同一网格论证也适用。最后使用三角不等式:
若 ,原观测几乎必然恒为 ,两种中心化误差都恒为零,结论直接成立,无须除以零或调用非退化正态定理。这一有限方差均值结论见 DasGupta 第 29 章定理 29.1;上面的截断计算明确展示了条件证明中需要补上的尾部控制。
直觉
Bootstrap 把未知总体的重复实验换成经验分布的重复实验。观测数据提供一个替代总体,重采样把它经过统计量的同一计算过程,以重现误差的形状和尺度。数据没有因此增加;新增的是对这份替代总体的计算。
Jackknife公理库JackknifeJackknife resampling · Leave-one-out jackknife通过逐一删除观测重新计算统计量,估计其首阶偏差与方差的方法。则逐次删除观测,利用删一变化近似首阶偏差与方差;bootstrap 的直接对象是给定数据后的重采样分布。因此两者不能仅按“都重用数据”互换:删一法要控制扰动下的线性余项,bootstrap 则要证明所选误差尺度上的条件律有效。下文的最大值例子正会使普通经验 bootstrap 失败。
对均值,许多小贡献相加,经验分布的均值、方差和尾部控制足以支持正态近似。对上界,关键却是样本尚未到达的极端区域;经验分布把最右支持点直接钉在观测最大值上。两者的差别需要在正确误差尺度上计算,不能仅凭“经验分布接近总体”下结论。
Bootstrap:均值一致性与端点失败 图中左侧的 与 ,分别是中心化均值误差的真实分布函数和条件重采样分布函数。两条分布趋于同一正态律;底部的 a.s.(几乎必然)是对原始数据路径而言,条件律的收敛也在同一个满概率路径集上成立。右侧纵轴表示 Uniform 端点模型中最大值误差的零点概率质量,不是密度高度。这个质量随 增长仍不消失,因而无限多次模拟也不能修复近似。
例子与边界
一份样本的完整重采样分布
取原样本 ,其均值为 。一次抽到位置 时,重采样为 ,均值为 。全部 个有序位置序列等概率;按总和分组,得到下表。它是完整枚举的压缩写法,而非一次随机模拟。
| 重采样总和 |
3 |
4 |
5 |
6 |
8 |
9 |
10 |
13 |
14 |
18 |
| 有序序列个数 |
1 |
3 |
3 |
1 |
3 |
6 |
3 |
3 |
3 |
1 |
例如总和 只能由 各一次构成,有 种顺序;总和 来自两个 和一个 ,有三种位置。所有计数相加为 ,也可从 的系数逐项读出。因此
经验分布的方差使用分母 ,不是无偏样本方差的 :
三个重采样值在给定数据后相互独立,故
同样可用表中 得到 。对放大后的误差,;这说明原始标准误与极限方差相差一个样本量因子。
以 定义分位数。总和不超过 的累计概率为 ,不超过 为 ,故 。类似地,不超过 为 ,不超过 为 ,故 。80% percentile 区间于是为 。这只是条件分位数的准确计算,并没有证明在未知总体的重复抽样中,该区间覆盖真均值的概率是 80%。
最大值为什么失败:不消失的零点原子
先求真实误差的速度和分布
设 ,,以 估计上界。对 ,
因此正确的无量纲误差是 。对 ,
所以 。误差是 阶;若只看 ,极限为零,便看不到需要近似的非退化形状。
条件重采样把过多质量固定在零点
经验分布重采样总有 。用观测上界替代未知上界,得到可实施的对应误差
连续总体下原最大值几乎必然唯一,且 。一次重采样不选中最大值的概率为 ,全部 次都遗漏它的概率为 。只要选中至少一次,,故
这不是“有限分布离散,所以不能近似连续分布”的泛泛论断。均值的离散条件律就可以收敛到连续正态律。此处的问题是一个特定原子的质量不趋于零:真实 满足 ,而条件 非负,因此
误差下界不消失,连依概率一致性也失败。指数极限的分布函数在零点连续,同一计算也直接排除了条件律趋于 。
三个观测就能看见整个障碍
取数据 。三个重采样值都为 才有最大值 ,概率为 ;都落在前两个值中而不全为 ,概率为 ;其余概率 给出最大值 。
|
|
|
|
| 条件概率 |
|
|
|
|
|
|
|
由此 ;而真实 Uniform 模型中 ,且没有零点原子。 时零点质量分别约为 ,逐渐接近 而非消失。
也可统一从 求条件分布。若改写成正间隙的严格尾事件,则必须写
特别在 ,严格小于恰好排除最大值;误把它写成小于等于,会把失败所依赖的原子整个漏掉。
在明确模型下修复
若 Uniform 分布族本身可信,可使用参数 bootstrap:从 抽样。此时 条件下恰为 IID Uniform,所以 与真实 的有限样本分布完全相同。这项修复利用了支持端点模型,不能自动推广到未知尾部形状。
同一模型还给出精确的单侧 置信集合
因为 几乎必然,覆盖等价于 ,其概率正好为 。例如 ,区间为 。相比之下,普通经验 bootstrap 的 percentile 区间上端不超过 ,在这个模型中的覆盖率为零。该判断专指 percentile 区间,不能直接移用于其他区间构造。
推论与应用
区间、模拟误差与适用边界
给定 次重采样,计算
它估计条件标准差。percentile 区间直接取 的分位数;basic 区间则取 ;studentized 方法重采样标准化误差 并反演。前述均值样本的 80% basic 区间恰好也为 ,只是这两个分位点关于 对称所致,不是两类方法的一般等价关系。
固定原数据后,若一个条件事件概率为 ,用 次独立重采样估计它,频率的条件标准差为 。在三点最大值例子中,取 、,这个标准差约为 。增加 能把零点原子估得更准确,却不能把原子从理论分布中消除。极端分位数需要足够多的尾部样本;随机种子只解决复现问题,不能代替模拟精度判断。
还应保持居中方式一致。 描述给定数据后的新增波动; 同时包含原抽样误差。全方差公式直接给出
其中 。因此把原数据和重采样混在一起看,已经换了分布目标。
对光滑均值变换,Delta 方法公理库Delta 方法Delta method用可微映射的一阶 Taylor 展开传播估计量的渐近分布与协方差。可把上述一阶条件极限继续传播;若导数退化、目标是端点或经过模型选择,则需要重新检查速率与余项。经验分布的插件一致性并不自动蕴含误差分布的 bootstrap 一致性。BCa 利用偏差修正与Jackknife公理库JackknifeJackknife resampling · Leave-one-out jackknife通过逐一删除观测重新计算统计量,估计其首阶偏差与方差的方法。 acceleration 调整分位点,但其精度结论同样依赖目标的正则性。
重采样单元也必须对应原实验。时间序列逐点重抽会破坏依赖关系,聚类数据通常需要保留簇结构;回归中的 residual、pairs 与 wild bootstrap 分别使用不同的条件目标和误差假设。针对端点的 -out-of- 方法、尾部模型或其他修正都需要各自的有效性证明。重采样拟合若失败,应记录失败率并明确处理规则;静默丢弃失败样本相当于额外条件于“计算成功”,会改变正在估计的分布。
对分层、整群和多阶段调查,重抽样应重现设计中的共同变化,而非默认逐行独立抽取。调查复制方差公理库调查重复权重方差估计Replicate weights · Survey replication variance让替代权重重现复杂抽样的随机结构,完整重算估计并按方案规定汇总方差。把这些结构编码为复制权重,并说明缩放常数与重新校准怎样进入最终方差。
参考资料
- Anirban DasGupta,第 29 章 “The Bootstrap”,定义 29.2(印刷页 453)区分条件分布的强、弱一致性;定理 29.1(印刷页 454)给出有限二阶矩均值的强一致性。
- Yen-Chi Chen,STAT 535, Lecture 12: The Bootstrap,“Consistency of Bootstrap” 部分介绍条件三角阵列证明。本文只使用一致性结论,不主张无额外矩条件的误差速度。
- Joel Horowitz,“The Bootstrap”,Example 2.4,手稿页 11–12:样本最大值的重采样失败;本文在 Uniform 模型中直接计算原子和精确修复。
- Bradley Efron and Robert Tibshirani, An Introduction to the Bootstrap, Chapman & Hall, 1993:重采样与区间构造的系统介绍。