Skip to content

Delta 方法

Delta method

用可微映射的一阶 Taylor 展开传播估计量的渐近分布与协方差。

形式陈述

rn

rn(Tnθ)dZ,

其中 Tn,θRk。若 g:RkRmθ 处 Fréchet 可微,则

rn{g(Tn)g(θ)}dDg(θ)Z.

特别地,若

n(Tnθ)dNk(0,V),

n{g(Tn)g(θ)}dNm(0,Dg(θ)VDg(θ)T).

结论是对每个固定参数点的渐近陈述。若 Jacobian 秩不足,极限协方差退化;不能把零矩阵误报为“估计没有误差”。

推导

一阶 Taylor 展开

g(Tn)g(θ)=Dg(θ)(Tnθ)+r(Tnθ),

其中 r(h)/h0。分布收敛蕴含 rn(Tnθ)=OP(1),因而 Tnθ 依概率,并有

rnr(Tnθ)=oP(1).

首项由线性连续映射传播 Z,余项再由 Slutsky 定理消失。这说明可微性需要统一余项控制,仅有各方向导数不足。

例子与计算

Bernoulli 样本比例满足

n(p^p)dN(0,p(1p)),0<p<1.

取 logit g(p)=logp/(1p),导数为 g(p)=1/[p(1p)],故

n{g(p^)g(p)}dN(0,1p(1p)).

n=500,p^=0.4,logit 估计约 0.405,估计标准误为

1500(0.4)(0.6)0.0913.

先在 logit 坐标构造区间再反变换,会自然保持概率端点在 (0,1) 内;直接对 p 做对称区间是另一种渐近近似。

导数退化时

g(θ)=0,一阶 Delta 方法只给退化零极限。若标量 g 二阶可微、g(θ)=0rn(Tnθ)Z,则二阶展开给

rn2{g(Tn)g(θ)}d12g(θ)Z2.

例如 Tn=X¯E[X]=0nX¯N(0,σ2),取 g(t)=t2,则

nX¯2dσ2χ12,

不是 n 尺度的正态极限。

边界与失败情形

映射在参数点不可微时,普通 Delta 方法失效。g(t)=|t| 在零点把正态极限变成折叠正态,需要方向可微 Delta 方法。

参数在边界时,Tn 的原始极限本身可能非正态;不能先假定正态再传播。logit 导数在 p0,1 发散,也提示内部点近似不统一。

plug-in Jacobian Dg(Tn) 替换 Dg(θ) 需要导数连续与 Tn 一致。数值上导数巨大时,渐近方差会放大,有限样本近似可能很差。

比值给出必须保留协方差的多元例子:g(a,b)=a/bb0 时梯度为 (1/b,a/b2)。若分子、分母由同一样本估计,渐近方差含交叉协方差;把两个标准误分别相除会漏掉依赖,并可能得到完全错误的尺度。

若映射 gn 随样本量变化,固定函数版本不能直接套用。增长维数、变化截断阈值或正则化强度都要求统一 Taylor 余项;形式上对每个 n 可微,不保证 rn 倍余项仍依概率消失。

推论与应用

Delta 方法传播比值、对数、风险差和预测函数的标准误。多元情形保留协方差交叉项,不能只逐分量变换方差。

它提供一阶局部近似,不给有限样本偏差;曲率较强时可用二阶修正、bootstrap 或直接枢轴方法核验。

Delta 方差的 plug-in 估计还需要原协方差估计一致。若 Dg(θ) 有非满秩,输出某些方向没有一阶波动,报告矩阵逆或标准化统计量前应先检查秩;二阶项可能在这些方向上成为主导。

对置信区间,先在线性化坐标构造再反变换,与直接在原坐标使用对称区间通常只首阶等价。有限样本端点、覆盖和不对称性可能不同,应根据参数空间和数值稳定性选择并说明。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§3.1。
  • R. J. Serfling, Approximation Theorems of Mathematical Statistics, Wiley, 1980,§1.7。
  • Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 2。