Skip to content

方法Method

Bootstrap

Bootstrap resampling · Nonparametric bootstrap

用条件重采样律近似抽样误差:完整计算均值的有限分布,证明有限方差下一致性,并由最大值的持久原子判定失败。

形式陈述 ​

设 X1,…,Xn 独立同分布于未知总体 P,统计量 Tn=tn(X1,…,Xn) 用来估计 θ=T(P)。非参数 bootstrap 先构造经验测度

Pn=1n∑i=1nδXi,

再在原数据给定后,从 Pn 独立抽取 n 个值 X1∗,…,Xn∗,计算同一规则 Tn∗=tn(X1∗,…,Xn∗)。每次等概率抽一个原样本位置,因此允许重复,也可能遗漏部分观测。星号表示重采样随机性;P∗,E∗,L∗ 表示条件于原数据的概率、期望和分布。

方法的理论对象与计算输出需要分开。给定合适的误差放大速度 an,有三条分布:

对象 定义 随什么改变
真实抽样律 Qn=LP{an(Tn−θ)} 由总体、样本量与抽样设计决定,通常未知
理想 bootstrap 律 Qn∗=L∗{an(Tn∗−Tn)} 原样本变化时,这条条件概率测度也变化
有限次模拟分布 Q^n,B∗=B−1∑b=1Bδan(Tn,b∗−Tn) 固定原样本后,仍随 B 次模拟变化

理想条件律在执行模拟之前就已经定义;小样本时甚至可以枚举求出。增加 B 近似的是 Qn∗,而 bootstrap 理论研究的是 Qn∗ 能否近似真实抽样律 Qn。均值通常取 an=n,后文 Uniform 支持端点模型中的最大值则需要 an=n;不说明速率,就可能在两个退化极限之间得到没有推断价值的“吻合”。

均值为什么有效:条件一致性的证明 ​

陈述与量词 ​

把原样本看成同一条无限 IID 序列的前 n 项,假设

EPX1=μ,0<σ2=VarP(X1)<∞.

记 Zn=n(X¯n−μ)、Zn∗=n(X¯n∗−X¯n)。结论是:存在一个原始抽样概率为 1 的数据路径集合,在其中每条路径上都有

L∗(Zn∗)⇒N(0,σ2),supt|P∗(Zn∗≤t)−PP(Zn≤t)|⟶0.

这里第一式是冻结原数据路径之后的依分布收敛:对每个有界连续函数 f,条件期望 E∗f(Zn∗) 趋于相应正态积分。几乎必然是对原始数据路径而言,不是声称重采样随机变量 Zn∗ 本身几乎必然趋于某个正态随机变量。第二式称为 Kolmogorov 距离下的强一致性,也蕴含依概率的一致性。这个均值结论只要求有限二阶矩,不给出收敛速度。

冻结路径之后,需要三角阵列定理 ​

由强大数定律分别处理 Xi 与 Xi2,

X¯n→μ,sn2=1n∑i=1n(Xi−X¯n)2=1n∑i=1nXi2−X¯n2→σ2

几乎必然成立。固定一条满足这些结论的数据路径。在第 n 行定义

Yni∗=Xi∗−X¯nn,1≤i≤n.

行内变量条件独立、均值为零,总方差为 ∑iE∗(Yni∗)2=sn2,而它们的和就是 Zn∗。随着 n 改变,重采样分布 Pn 也改变,所以不能仅对一个固定分布套用通常的 IID 中心极限定理。

这里使用 Lindeberg–Feller 三角阵列定理的下述形式:若每行独立且中心化,∑iEYni2→v∈(0,∞),并且对每个 ε>0,

∑iE[Yni21{|Yni|>ε}]→0,

则行和 ∑iYni⇒N(0,v)。不同行之间不要求独立。对本问题,尚需证明的条件恰为

Ln(ε)=1n∑i=1n(Xi−X¯n)21{|Xi−X¯n|>εn}⟶0.

有限二阶矩如何控制变化中的尾部 ​

对每个正整数 K,再要求这条原始路径满足 Xi21{|Xi|>K} 和 1{|Xi|>K} 的强大数定律。它们都可积,且这里只取可数多个 K,因此与前述事件相交后,仍是同一个概率为 1 的事件。

固定整数 K>|μ|+1。当 n 足够大,|X¯n|<K 且 εn>2K。若尾部指示函数取一,则

|Xi|≥|Xi−X¯n|−|X¯n|>K.

由 (a−b)2≤2a2+2b2,有

Ln(ε)≤2n∑iXi21{|Xi|>K}+2X¯n21n∑i1{|Xi|>K}.

先令 n→∞,得到

lim supnLn(ε)≤2E[X121{|X1|>K}]+2μ2P(|X1|>K).

再沿整数令 K→∞,有限二阶矩使右侧趋于零。这就验证了 Lindeberg 条件,三角阵列定理给出条件正态极限。这里关键是固定截断后再取极限;“每个经验分布都只有有限个点”本身不能控制随 n 改变的尾部。

从共同极限到两条分布接近 ​

设 Φσ 为 N(0,σ2) 的分布函数。收敛到连续分布函数时,逐点收敛可升级为一致收敛:给定 η>0,先选两端点使极限分布两侧尾概率均小于 η,再把中间区间分成有限网格,使每格的 Φσ 增量小于 η。网格点的收敛与分布函数单调性把格内误差控制为网格误差加 η;两端用尾概率控制。令 η↓0 即得一致收敛。

于是条件极限给出 supt|P∗(Zn∗≤t)−Φσ(t)|→0。通常的中心极限定理对原样本给出 Zn⇒N(0,σ2),同一网格论证也适用。最后使用三角不等式:

supt|P∗(Zn∗≤t)−PP(Zn≤t)|≤supt|P∗(Zn∗≤t)−Φσ(t)|+supt|PP(Zn≤t)−Φσ(t)|→0.

若 σ2=0,原观测几乎必然恒为 μ,两种中心化误差都恒为零,结论直接成立,无须除以零或调用非退化正态定理。这一有限方差均值结论见 DasGupta 第 29 章定理 29.1;上面的截断计算明确展示了条件证明中需要补上的尾部控制。

直觉

Bootstrap 把未知总体的重复实验换成经验分布的重复实验。观测数据提供一个替代总体,重采样把它经过统计量的同一计算过程,以重现误差的形状和尺度。数据没有因此增加;新增的是对这份替代总体的计算。

Jackknife则逐次删除观测,利用删一变化近似首阶偏差与方差;bootstrap 的直接对象是给定数据后的重采样分布。因此两者不能仅按“都重用数据”互换:删一法要控制扰动下的线性余项,bootstrap 则要证明所选误差尺度上的条件律有效。下文的最大值例子正会使普通经验 bootstrap 失败。

对均值,许多小贡献相加,经验分布的均值、方差和尾部控制足以支持正态近似。对上界,关键却是样本尚未到达的极端区域;经验分布把最右支持点直接钉在观测最大值上。两者的差别需要在正确误差尺度上计算,不能仅凭“经验分布接近总体”下结论。

Bootstrap:均值一致性与端点失败

图中左侧的 Hn(t)=PP{n(X¯n−μ)≤t} 与 Hn∗(t)=P∗{n(X¯n∗−X¯n)≤t},分别是中心化均值误差的真实分布函数和条件重采样分布函数。两条分布趋于同一正态律;底部的 a.s.(几乎必然)是对原始数据路径而言,条件律的收敛也在同一个满概率路径集上成立。右侧纵轴表示 Uniform 端点模型中最大值误差的零点概率质量,不是密度高度。这个质量随 n 增长仍不消失,因而无限多次模拟也不能修复近似。

例子与边界

一份样本的完整重采样分布 ​

取原样本 (1,2,6),其均值为 x¯=3。一次抽到位置 (3,3,1) 时,重采样为 (6,6,1),均值为 13/3。全部 33=27 个有序位置序列等概率;按总和分组,得到下表。它是完整枚举的压缩写法,而非一次随机模拟。

重采样总和 s 3 4 5 6 8 9 10 13 14 18
有序序列个数 cs 1 3 3 1 3 6 3 3 3 1

例如总和 9 只能由 1,2,6 各一次构成,有 3!=6 种顺序;总和 13 来自两个 6 和一个 1,有三种位置。所有计数相加为 27,也可从 (z+z2+z6)3 的系数逐项读出。因此

P∗(X¯3∗=s/3)=cs/27.

经验分布的方差使用分母 n,不是无偏样本方差的 n−1:

s32=(1−3)2+(2−3)2+(6−3)23=143.

三个重采样值在给定数据后相互独立,故

E∗X¯3∗=3,Var∗(X¯3∗)=s323=149,se∗(X¯3∗)=143≈1.2472.

同样可用表中 ∑s(cs/27)(s/3−3)2 得到 14/9。对放大后的误差,Var∗{3(X¯3∗−3)}=14/3;这说明原始标准误与极限方差相差一个样本量因子。

以 qp∗=inf{t:P∗(X¯3∗≤t)≥p} 定义分位数。总和不超过 3 的累计概率为 1/27<0.1,不超过 4 为 4/27≥0.1,故 q0.1∗=4/3。类似地,不超过 13 为 23/27<0.9,不超过 14 为 26/27≥0.9,故 q0.9∗=14/3。80% percentile 区间于是为 [4/3,14/3]。这只是条件分位数的准确计算,并没有证明在未知总体的重复抽样中,该区间覆盖真均值的概率是 80%。

最大值为什么失败:不消失的零点原子 ​

先求真实误差的速度和分布 ​

设 Xi∼Uniform(0,θ),θ>0,以 Mn=maxiXi 估计上界。对 0≤t≤θ,

P(Mn≤t)=P(X1≤t,…,Xn≤t)=(t/θ)n.

因此正确的无量纲误差是 Un=n(θ−Mn)/θ。对 0≤x≤n,

P(Un>x)=(1−x/n)n⟶e−x,

所以 Un⇒Exp(1)。误差是 1/n 阶;若只看 n(θ−Mn),极限为零,便看不到需要近似的非退化形状。

条件重采样把过多质量固定在零点 ​

经验分布重采样总有 Mn∗≤Mn。用观测上界替代未知上界,得到可实施的对应误差

Un∗=n(Mn−Mn∗)Mn.

连续总体下原最大值几乎必然唯一,且 Mn>0。一次重采样不选中最大值的概率为 1−1/n,全部 n 次都遗漏它的概率为 (1−1/n)n。只要选中至少一次,Mn∗=Mn,故

P∗(Un∗=0)=1−(1−1/n)n⟶1−e−1≈0.63212.

这不是“有限分布离散,所以不能近似连续分布”的泛泛论断。均值的离散条件律就可以收敛到连续正态律。此处的问题是一个特定原子的质量不趋于零:真实 Un 满足 P(Un≤0)=0,而条件 Un∗ 非负,因此

supx|P∗(Un∗≤x)−P(Un≤x)|≥1−(1−1/n)n.

误差下界不消失,连依概率一致性也失败。指数极限的分布函数在零点连续,同一计算也直接排除了条件律趋于 Exp(1)。

三个观测就能看见整个障碍 ​

取数据 (0.2,0.5,0.9)。三个重采样值都为 0.2 才有最大值 0.2,概率为 1/27;都落在前两个值中而不全为 0.2,概率为 (2/3)3−(1/3)3=7/27;其余概率 19/27 给出最大值 0.9。

M3∗ 0.2 0.5 0.9
条件概率 1/27 7/27 19/27
U3∗=3(0.9−M3∗)/0.9 7/3 4/3 0

由此 E∗U3∗=(7+28)/81=35/81≈0.4321;而真实 Uniform 模型中 EU3=3/(3+1)=0.75,且没有零点原子。n=3,10,100 时零点质量分别约为 0.7037,0.6513,0.6340,逐渐接近 0.6321 而非消失。

也可统一从 P∗(Mn∗≤t)=Fn(t)n 求条件分布。若改写成正间隙的严格尾事件,则必须写

P∗(Un∗>x)=[1n#{i:Xi<Mn(1−x/n)}]n.

特别在 x=0,严格小于恰好排除最大值;误把它写成小于等于,会把失败所依赖的原子整个漏掉。

在明确模型下修复 ​

若 Uniform 分布族本身可信,可使用参数 bootstrap:从 Uniform(0,Mn) 抽样。此时 Xi∗/Mn 条件下恰为 IID Uniform(0,1),所以 n(Mn−Mn∗)/Mn 与真实 Un 的有限样本分布完全相同。这项修复利用了支持端点模型,不能自动推广到未知尾部形状。

同一模型还给出精确的单侧 1−α 置信集合

[Mn,Mnα1/n].

因为 Mn≤θ 几乎必然,覆盖等价于 Mn≥θα1/n,其概率正好为 1−α。例如 n=3,Mn=0.9,α=0.05,区间为 [0.9,2.44298]。相比之下,普通经验 bootstrap 的 percentile 区间上端不超过 Mn<θ,在这个模型中的覆盖率为零。该判断专指 percentile 区间,不能直接移用于其他区间构造。

推论与应用

区间、模拟误差与适用边界 ​

给定 B≥2 次重采样,计算

se^boot=1B−1∑b=1B(Tn,b∗−T¯∗)2.

它估计条件标准差。percentile 区间直接取 Tn∗ 的分位数;basic 区间则取 [2Tn−q1−α/2∗,2Tn−qα/2∗];studentized 方法重采样标准化误差 (Tn∗−Tn)/se^∗ 并反演。前述均值样本的 80% basic 区间恰好也为 [4/3,14/3],只是这两个分位点关于 3 对称所致,不是两类方法的一般等价关系。

固定原数据后,若一个条件事件概率为 p∗,用 B 次独立重采样估计它,频率的条件标准差为 p∗(1−p∗)/B。在三点最大值例子中,取 p∗=19/27、B=10000,这个标准差约为 0.00457。增加 B 能把零点原子估得更准确,却不能把原子从理论分布中消除。极端分位数需要足够多的尾部样本;随机种子只解决复现问题,不能代替模拟精度判断。

还应保持居中方式一致。X¯n∗−X¯n 描述给定数据后的新增波动;X¯n∗−μ 同时包含原抽样误差。全方差公式直接给出

Var(X¯n∗)=E(sn2/n)+Var(X¯n)=2n−1n2σ2,

其中 Esn2=(n−1)σ2/n。因此把原数据和重采样混在一起看,已经换了分布目标。

对光滑均值变换,Delta 方法可把上述一阶条件极限继续传播;若导数退化、目标是端点或经过模型选择,则需要重新检查速率与余项。经验分布的插件一致性并不自动蕴含误差分布的 bootstrap 一致性。BCa 利用偏差修正与Jackknife acceleration 调整分位点,但其精度结论同样依赖目标的正则性。

重采样单元也必须对应原实验。时间序列逐点重抽会破坏依赖关系,聚类数据通常需要保留簇结构;回归中的 residual、pairs 与 wild bootstrap 分别使用不同的条件目标和误差假设。针对端点的 m-out-of-n 方法、尾部模型或其他修正都需要各自的有效性证明。重采样拟合若失败,应记录失败率并明确处理规则;静默丢弃失败样本相当于额外条件于“计算成功”,会改变正在估计的分布。

对分层、整群和多阶段调查,重抽样应重现设计中的共同变化,而非默认逐行独立抽取。调查复制方差把这些结构编码为复制权重,并说明缩放常数与重新校准怎样进入最终方差。

参考资料
  • Anirban DasGupta,第 29 章 “The Bootstrap”,定义 29.2(印刷页 453)区分条件分布的强、弱一致性;定理 29.1(印刷页 454)给出有限二阶矩均值的强一致性。
  • Yen-Chi Chen,STAT 535, Lecture 12: The Bootstrap,“Consistency of Bootstrap” 部分介绍条件三角阵列证明。本文只使用一致性结论,不主张无额外矩条件的误差速度。
  • Joel Horowitz,“The Bootstrap”,Example 2.4,手稿页 11–12:样本最大值的重采样失败;本文在 Uniform 模型中直接计算原子和精确修复。
  • Bradley Efron and Robert Tibshirani, An Introduction to the Bootstrap, Chapman & Hall, 1993:重采样与区间构造的系统介绍。
关系图谱14 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系