Skip to content

稳健统计与影响函数

Robust statistics · Influence function

以污染邻域和统计泛函导数量化少量异常分布对估计的局部影响。

形式定义

把估计规则写为分布泛函 T(P)。在点污染路径

Pε,x=(1ε)P+εδx

下,影响函数定义为 Gateaux 导数

IF(x;T,P)=ddεT(Pε,x)|ε=0+.

supxIF(x;T,P)<,单点极端污染的局部一阶影响有界。

例子

均值泛函 T(P)=xdP 的影响函数为 xμ,无界。中位数在密度 f(m)>0

IF(x)=sign(xm)2f(m),

有界,所以单个极端数值的影响不会随其大小无限增长。

Huber M-估计的 influence 与截断 score 成比例,在正态效率与污染敏感性之间由阈值调节。

M-估计影响函数推导

若位置 M-泛函由

ψ(xT(P))dP(x)=0

定义,对污染路径求导可得

IF(x;T,P)=ψ(xT(P))EP[ψ(XT(P))],

前提是分母存在且非零。Huber 的 ψ 被截断,所以分子有界;样本均值对应 ψ(u)=u,影响随 x 无界。

影响函数还给渐近方差

n(T(Pn)T(P))N(0,EP[IF(X)2])

在适当可微性与二阶矩条件下成立。稳健性和效率因此由同一 influence 形状连接。

数据 (0,1,2,100) 中,均值为 25.75;中位数为 1.5。把 100 增至 106 会使均值近似线性爆炸,中位数保持 1.5,具体展示 bounded influence 的局部图像与高 breakdown 的有限污染结果。

其他稳健尺度

breakdown point 测量需替换多少比例数据才能把估计推到任意远;gross-error sensitivity 是 influence 上确界。局部 IF 有界不自动给高 breakdown,两个指标回答不同污染规模。

有限样本 replacement breakdown 定义为让估计无界所需最少替换比例。样本均值为 1/n,样本中位数接近 1/2。但高 breakdown 估计也可能在干净正态模型下效率较低。

边界

影响函数是一阶、无穷小污染分析。有限 10% 污染可能需要最大偏差曲线或 breakdown 分析;导数存在也不保证高阶近似准确。

高杠杆回归点的影响同时取决于残差和协变量位置,仅截断残差不能保证稳健。模型、尺度估计和调参也需联合处理。

影响函数只分析 ε0 的局部污染。固定 10% 污染需要最大偏差曲线或有限样本 breakdown;导数有界不保证高阶项很小。

自适应调参若由污染数据估计,阈值本身也有 influence。只分析固定尺度、固定阈值的 score 会低估完整算法敏感性。

稳健不是无假设:对抗任意污染会牺牲干净模型效率,且 contamination neighborhood 的选择决定保证。

asymptotic variance 与 influence 的二阶矩相连,但 bounded influence 不保证有限方差:若分母 Eψ 接近零,整体 sensitivity 仍可很大。调参应同时检查 gross-error sensitivity 与 model efficiency。

位置 equivariance 要求数据整体平移 c 时估计也平移 c;尺度 equivariance 类似。一个常数估计量 influence 为零,看似最稳健,却不满足位置目标的基本 equivariance,也没有有意义的准确性。稳健性不能脱离目标一致性评价。

finite-sample contamination neighborhood 常写为 (1ε)Pθ+εQ,其中 Q 任意。minimax robust procedure 在该邻域优化最坏风险;influence function 只是 ε=0 的局部导数接口。

回归 leverage 使协变量空间远端点即便残差初始不大也可强烈改变系数。高-breakdown regression 需同时约束 design 与 residual influence;仅使用 Huber loss 主要防 vertical outliers。

报告稳健分析应给 contamination model、tuning constant、scale estimate、breakdown 或 influence 指标,并与经典估计在干净模型下的效率比较。

参考资料
  • Peter J. Huber and Elvezio Ronchetti, Robust Statistics, 2nd ed., Wiley, 2009。
  • Frank Hampel et al., Robust Statistics: The Approach Based on Influence Functions, Wiley, 1986。
  • Peter Rousseeuw and Annick Leroy, Robust Regression and Outlier Detection, Wiley, 1987。