Skip to content

Bootstrap

Bootstrap resampling · Nonparametric bootstrap

从经验分布重复抽样,以条件重采样分布近似统计量真实抽样分布的方法。

三步流程

给定 iid 样本 X1:n 与统计量 Tn=t(X1:n),非参数 bootstrap 只做三件事:

  1. 用经验分布P^n=1ni=1nδXi代替未知总体分布 P
  2. 条件于原数据,从 P^n 独立抽取 X1,,Xn,计算 Tn=t(X1:n),并重复 B 次;
  3. 用这些重采样值形成的条件分布 L(TnX1:n) 估计标准误、偏差或区间所需的抽样分布特征。

每次重采样都可能重复某些原观测并遗漏另一些。样本 (1,2,6) 若抽到索引 (3,3,1),便得到 (6,6,1);全部 33=27 个有序重采样可以枚举,而实际使用有限 B 次随机抽取来近似这项条件分布。

例子

对样本均值,条件于数据有

E[X¯]=X¯,Var(X¯)=1n(1ni(XiX¯)2).

右端正是真实均值方差的 plug-in 估计。这个例子展示经验分布为何能捕捉普通均值的一阶波动,但它本身并不保证同一重采样规则适用于极值、边界参数或依赖数据。

一致性条件与量词

典型理论目标是让居中的条件分布与真实抽样分布趋向同一极限:

L(n(TnTn))L(n(Tnθ)).

更明确地,对所有有界连续函数 f,要求

Ef{n(TnTn)}EPf{n(Tnθ)}p0.

这里条件分布随原样本随机,因此收敛发生在 P-概率意义下,而不是要求某一次 bootstrap 直方图与真实密度逐点相等。对光滑统计泛函,有限矩、非退化一阶导数以及经验过程/Delta 方法所需的正则性通常给出一致性;统计量、缩放速度或抽样设计改变后,这些条件必须重新验证。

区间与 Monte Carlo 误差

B 个重采样值,bootstrap 标准误为

se^boot=1B1b(TbT¯)2.

percentile 区间直接取 Tn 的分位数;basic 区间为

[2Tnq1α/2,2Tnqα/2],

studentized 区间则重采样 (TnTn)/se^。三者使用不同枢轴,有限样本性质不可互换,报告时不能只写“bootstrap 区间”而省略类型。

B 控制的是条件分布的 Monte Carlo 近似。估标准误时几千次往往已较稳定,估极端 0.001 分位数则需要远更多重采样;分位数模拟误差可用 binomial rank 区间评估。固定随机种子只保证复现,增加 B 也只能减少模拟误差,不能修复 bootstrap 本身的理论偏差。

失败情形

非光滑或非正则目标是第一类失败。用样本最大值估计 Uniform 上界时,经验分布的最大支持点固定在观测最大值,普通 bootstrap 无法生成落在其上方的新极值;无穷方差均值、小样本稀有事件、边界参数和模型选择后的非光滑规则也可能没有标准 n 近似。可选修复包括 m-out-of-n bootstrap、尾部模型或针对目标另证有效的缩放,但它们不是增加 B 就能得到的改良。

抽样单元不匹配是第二类失败。依赖时间序列不能逐点 iid 重采样,通常需要 block bootstrap 并选择块长;分层、聚类和复杂调查必须复制原抽样设计;异方差回归常使用 wild 或 pairs bootstrap。错误重采样单位会改变目标概率结构,即使每次拟合都数值收敛也不会自动正确。

计算失败还会额外改变近似。诊断应报告重采样拟合失败率、极端值以及区间对 B 和方法的敏感性;静默丢弃不收敛的拟合等于条件于“算法成功”,会改变目标分布,应改进拟合或明确失败处理规则。

变体与应用

nonparametric bootstrap 只依赖经验分布,但仍以 iid 抽样单元为默认;parametric bootstrap 则从拟合模型 Pθ^ 抽样,适合模型结构可信而统计量复杂的情形。两者都可用于标准误、偏差估计和区间,但前者依赖经验分布逼近,后者还承担模型错设风险。

回归中的残差 bootstrap 固定设计并重采样中心化残差,pairs bootstrap 连 (X,Y) 一起抽样,wild bootstrap 用随机权重保留异方差结构;三者对应不同的条件目标与误差假设,不能互换名称后沿用同一证明。

BCa 区间用 bias-correction z0 与 jackknife acceleration a 调整分位点,在光滑问题中可取得二阶准确性。它需要额外 jackknife 计算;若 jackknife 对目标统计量本身失效,BCa 的 acceleration 也不可靠。

参考资料
  • Bradley Efron, “Bootstrap Methods: Another Look at the Jackknife,” Annals of Statistics 7(1), 1979。
  • Bradley Efron and Robert Tibshirani, An Introduction to the Bootstrap, Chapman & Hall, 1993。
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 23。