Skip to content

方法Method

回归的野生Bootstrap

Wild bootstrap regression · Multiplier residual bootstrap · 异方差回归野生重抽

保留固定设计与每行残差尺度,以独立乘子生成重抽响应,证明条件协方差、固定维异方差有效性及重新学生化的误差控制。

某些设计位置的响应天生比其他位置波动大。把所有残差倒进一个池子再随机分回各行,会抹掉这份位置差异。野生Bootstrap把第i行残差留在第i行,只乘上一个新的随机权重;它要保存的是回归得分的总体波动,而不是逐行准确估计每个未知噪声分布。

形式陈述 ​

生成规则与有限条件协方差 ​

给定固定设计X∈R^(n×p)满列秩及响应Y,先算

A=(XTX)−1,β^=AXTY,e=Y−Xβ^.

独立于原资料生成相互独立的乘子ξ_1,…,ξ_n,具有共同分布,Eξ_i=0、Eξ_i²=1。使用原残差的基础版本为

(1)Yi∗=xiTβ^+eiξi,β^∗=AXTY∗.

这里每行x_i视为列向量;X始终不变。条件于资料,星号概率只来自乘子,于是

(2)E∗β^∗=β^,Cov∗(β^∗)=A(∑iei2xixiT)A=V^HC0.

最后一项恰为HC0协方差。式(2)是有限资料上的精确条件恒等式,不是说它已经等于真实Var(β̂),也不是有限样本覆盖定理。

一份固定维的有效性合同 ​

以下n→∞、p固定,允许设计和误差分布随n变化,为简洁省去第二个下标。模型为Y_i=x_iᵀβ+ε_i,条件为:

  1. 设计确定,sup_{n,i}‖x_i‖≤K<∞,Q_n=n^(−1)Σ_i x_i x_iᵀ→Q,Q正定
  2. 每一行数组内ε_i独立,Eε_i=0,sup_{n,i}Eε_i⁴≤C<∞
  3. 令σ_i²=Eε_i²、Ω_n=n^(−1)Σ_i σ_i²x_i x_iᵀ,假设Ω_n→Ω
  4. 乘子分布固定,除前述两矩条件外Eξ_i⁴<∞;选定固定对比c,使v=cᵀQ^(−1)ΩQ^(−1)c>0

定义

(3)Ω^n=1n∑iei2xixiT,v^n=cTQn−1Ω^nQn−1c.

每份重抽后重新拟合并计算残差e_i^=Y_i^−x_iᵀβ̂^,再用相同式(3)生成Ω̂_n^、v̂_n^*。则原根和重抽根

(4)Tn=ncT(β^−β)v^n,Tn∗=ncT(β^∗−β^)v^n∗

满足

(5)Tn⇒N(0,1),supz|P∗(Tn∗≤z)−Φ(z)|⟶P0.

其中N(0,1)是标准正态分布,第一条箭头表示分布收敛。

分母为零时,为定义整条随机变量可暂约定相应根为0;证明会给这种事件的概率趋零。实际程序应记录零分母频率,而非静默丢弃并重新归一化剩余重抽。若原v̂_n=0,则本次不报告通常的学生化区间。

直觉

每行只有一条误差记录时,e_i²一般不会逐行收敛到σ_i²。定理也不要求它这样做。回归对比只消费加权平均Σ e_i² x_i x_iᵀ/n;许多独立行的平均可以稳定,单个行方差仍然未知。

Rademacher乘子只取±1,看起来像对残差改符号。这里的一阶定理却不要求原误差对称:只用原误差的均值、方差、四阶矩与独立性。有限样本的精确符号随机化检验需要另加对称性等条件,不能把它与式(5)合并。

第一步:残差替换不改变总体二阶尺度 ​

令Δ=β̂−β。OLS的线性表示为

Δ=Qn−11n∑ixiεi,Cov(Δ)=1nQn−1ΩnQn−1.

Q_n^(−1)有界、Ω_n有界,故由Chebyshev不等式,Δ=O_P(n^(−1/2))。设计有界使max_i|e_i−ε_i|≤K‖Δ‖=O_P(n^(−1/2))。

对每个矩阵元素,独立性和四阶矩界给

Var[1n∑i(εi2−σi2)xijxik]≤K4Cn.

所以将e换回ε后的中间矩阵趋于Ω。再展开e_i²−ε_i²=−2ε_i x_iᵀΔ+(x_iᵀΔ)²,以Cauchy–Schwarz控制平均交叉项,且n^(−1)Σ ε_i²=O_P(1),便得

(6)Ω^n⟶PΩ,1n∑iei4=OP(1).

第二条由|a+b|⁴≤8(|a|⁴+|b|⁴)、原四阶矩平均的有界期望及Δ的小量直接得到。p固定使逐元素控制也给任意矩阵范数控制。

第二步:独立小项为什么变成正态 ​

这里需要独立但不必同分布的三角数组,不能只调用IID样本均值CLT。一个足够的小项准则是:Z_{ni}独立、均值零,Σ_i EZ_{ni}²→s²>0,Σ_i EZ_{ni}⁴→0。下面给出机制。

Cauchy–Schwarz两次给

∑iE|Zni|3≤(∑iEZni2)1/2(∑iEZni4)1/2⟶0.

对固定实u,指数函数Taylor余项满足|e^(iuz)−1−iuz+(u²z²)/2|≤|uz|³/6。故每个特征函数等于1−u²EZ_{ni}²/2加上总和趋零的余项。最大方差趋零,因而各因子趋近1;用log(1+w)=w+O(|w|²),且Σ|w|²≤max|w|Σ|w|→0,独立乘积趋于exp(−u²s²/2)。Lévy连续性便给正态极限。

对原始回归对比,取Z_{ni}=cᵀQ_n^(−1)x_i ε_i/√n。系数有界,四阶矩和为O(1/n),总方差趋于v,所以上述论证适用。

对重抽对比,条件于资料取Z_{ni}^*=cᵀQ_n^(−1)x_i e_i ξ_i/√n。其条件总方差是v̂_n→_P v,而且

(7)∑iE∗|Zni∗|4≤C1Eξ14n2∑iei4=OP(1/n)⟶P0.

C_1只依赖已固定的c及最终有界的Q_n^(−1)、设计界。任意资料子序列可再取子序列,使式(6)–(7)几乎必然成立;对这些资料逐份应用刚才的确定数组论证,即得到条件分布依概率趋于N(0,v)。若原条件收敛失败,会存在一个失败概率不消失的子序列,与此子子序列性质矛盾。

第三步:重抽内部也要重新估计尺度 ​

记Δ^=β̂^−β̂。式(2)和式(6)给条件意义下Δ^=O_{P^}(n^(−1/2)),且这一预算在原资料概率意义下成立。对于尚未扣除重新拟合量的扰动e_i ξ_i,

E∗[1n∑iei2ξi2xixiT]=Ω^n.

每个元素的条件方差不超过常数乘n^(−2)Σe_i⁴,因而由式(7)趋零。真正残差还要减去x_iᵀΔ^;与第一步相同的平方展开给余项趋零,因为n^(−1)Σe_i²ξ_i²条件有界、设计有界、Δ^条件趋零。因此

Ω^n∗−Ω^n⟶P∗0依原资料概率成立.

v̂_n^*与v̂_n都趋向严格正的v,零分母事件相应趋零。最后用Slutsky定理处理两份学生化,得到式(5)的逐点条件CDF结论;标准正态CDF连续,再用有限网格和单调性得到上确界版本。

例子与边界

八个符号可完整列出重抽系数 ​

取无截距设计X=(1,2,3)ᵀ、Y=(1,0,2)ᵀ。则XᵀX=14、β̂=1/2,残差为(1/2,−1,1/2)。使用独立公平±1乘子,

β^∗−β^=ξ1−4ξ2+3ξ328.

八种符号中,零出现两次;±1/14、±3/14、±2/7各出现一次。因此条件均值为零,条件方差为

182(1142+9142+472)=13392.

直接计算式(2),中项为1/4+4+9/4=13/2,再除以14²,也得到13/392。这个例子核对的是有限条件协方差,不宣称八点分布已经是正态。

如果改成从三个原残差中独立均匀重抽并混回各行,残差池均值为零、方差为1/2,于是系数条件方差为(1/2)/14=1/28,已经与式(2)不同。一般异方差模型下,这种混池会把各行不同尺度换成同一平均尺度。

乘子并不只剩一种选择 ​

公平±1有前三矩0、1、0。另一种常用两点分布取

a=1−52,b=1+52,P(ξ=a)=5+125,P(ξ=b)=5−125.

直接计算Eξ=0,而a、b都满足x²=x+1,所以Eξ²=1、Eξ³=1、Eξ⁴=2。这称为Mammen两点乘子。匹配第三矩是额外结构;本页只证明一阶有效性,不由这条矩等式自动推出普遍的二阶覆盖改进。

哪些输入未被定理允许 ​

只有零均值和有限方差,未必足够完成本页四阶小项证明;高维p随n增长、极端杠杆行主导、簇内相关或时间依赖,也都需要另证。固定设计的有界性与Q_n正定实际上给

maxihi=maxixiTQn−1xin=O(1/n).

所以本页不是对“无论杠杆多高都有效”的承诺。一个明确的失败模型取n=s²、p=1,仅最后一行x_n=s,其余行x_i=0,误差独立公平取±1。此时Q_n=Ω_n=1,却有h_n=1、√n(β̂−β)=ε_n,极限不是正态;最后行被精确拟合,e_n=0,所以每份野生重抽都给β̂^*=β̂。设计行的一致有界条件在这里失败,不能只检查Q_n和Ω_n的极限。若X是看了同一Y之后选出来的,还必须将选择过程纳入模型;不能条件于最终X就自动恢复原误差独立性。

若要检验某个复合约束,采用受限拟合生成零假设重抽是另一种具体方案。式(1)使用不受限拟合并以β̂为中心,式(5)服务于其对比误差分布;不能只把两种实现都称作wild便交换有限样本结论。

推论与应用

区间使用相同的原始标准误 ​

取T_n^的α/2与1−α/2条件分位数q_−^、q_+^*,0<α<1。当原v̂_n>0时,区间为

(8)[cTβ^−q+∗v^n/n,cTβ^−q−∗v^n/n].

式(5)和正态分位数严格穿越给渐近1−α覆盖。若原分母为零,可报告当前推断不可用;理论上将该事件的置信集定义为全实线,也不改变渐近覆盖,因为其概率趋零。模拟只取有限B次时,还有分位数的Monte Carlo误差;B是另外的计算预算。

杠杆修正改变有限条件协方差 ​

将式(1)中的e_i分别改成e_i/√(1−h_i)或e_i/(1−h_i),条件协方差就分别变成HC2或HC3。这些杠杆修正要求h_i<1,并不能在高杠杆失秩处靠形式分母继续计算。

在本页的有界设计条件下,max h_i=O(1/n),两个修正因子都一致趋1,故它们与基础版本具有相同的一阶极限;有限条件分布和小样本表现仍可不同。报告中应明确选择哪一种残差及哪一种重抽内部协方差估计。

复用设计分解的计算流程 ​

先对固定X作QR分解,算β̂、e及所选残差修正。每次生成n个乘子,构造扰动向量e⊙ξ,以同一分解求β̂^*−β̂,再算新残差和对比标准误。不能把原尺度冻结后还声称计算了式(4)中重新学生化的版本。

初始分解需O(np²+p³)算术工作;一般每次完整HC0矩阵需O(np²)工作。若只做一个固定对比,可先求a=Q_n^(−1)c,利用v̂_n^=n^(−1)Σ(e_i^)²(x_iᵀa)²,在分解已存时将每次工作降至O(np+p²),再加n次乘子生成。保存设计分解O(np+p²),每次可复用O(n+p)缓冲;保存B个根另需O(B)。这些是固定精度算术成本,数值秩判定和高精度成本另列。

参考资料
  • C. F. J. Wu,“Jackknife, Bootstrap and Other Resampling Methods in Regression Analysis”,Annals of Statistics14(4),1986,1261–1295正文,§2、§7,尤其纸页1282式(7.1)–(7.4):保留逐行残差并乘零均值单位协方差扰动;该式使用HC2型缩放,与本页基础HC0版本分别标明。
  • Russell Davidson、Emmanuel Flachaire,“The Wild Bootstrap, Tamed at Last”,作者2007年4月稿,§2,印页3–5,式(2)–(8):残差校正、乘子两矩、两点分布及受限/不受限实现。正式版Journal of Econometrics146,2008,162–169。本页给较窄的固定p、统一四阶矩充分条件并完整证明,不引用特定对称模型的精确结论来替代一般渐近校准。
  • Enno Mammen,“Bootstrap and Wild Bootstrap for High Dimensional Linear Models”,Annals of Statistics21(1),1993,255–285,进一步阅读:增长维数需要额外条件,本页没有提供该扩展。
关系图谱28 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系