“从随机准则到参数收敛需要估计量一致性的识别与一致收敛条件;从估计方程的局部线性化到 sandwich 极限,则进入估计量的渐近正态性。稳健准则的 score 截断还可由影响函数量化,而不能只…”
形式陈述 ​
把估计规则写为分布泛函
下,影响函数定义为 Gateaux 导数
若
直觉
影响函数把“总体分布中加入极小污染”变成一阶导数:若单个极端点能让导数任意大,估计程序在少量污染下就可能剧烈移动。稳健性因此不是一句“对异常值不敏感”,而是关于污染邻域、损失、尺度和有限样本崩溃方式的成套声明。
例子与边界
均值泛函
有界,所以单个极端数值的影响不会随其大小无限增长。
Huber M-估计的 influence 与截断 score 成比例,在正态效率与污染敏感性之间由阈值调节。
M-估计影响函数推导 ​
若位置 M-泛函由
定义,对污染路径求导可得
前提是分母存在且非零。Huber 的
影响函数还给渐近方差
在适当可微性与二阶矩条件下成立。稳健性和效率因此由同一 influence 形状连接。
数据
其他稳健尺度 ​
breakdown point 测量需替换多少比例数据才能把估计推到任意远;gross-error sensitivity 是 influence 上确界。局部 IF 有界不自动给高 breakdown,两个指标回答不同污染规模。
有限样本 replacement breakdown 定义为让估计无界所需最少替换比例。样本均值为
边界 ​
影响函数是一阶、无穷小污染分析。有限
高杠杆回归点的影响同时取决于残差和协变量位置,仅截断残差不能保证稳健。模型、尺度估计和调参也需联合处理。
影响函数只分析
自适应调参若由污染数据估计,阈值本身也有 influence。只分析固定尺度、固定阈值的 score 会低估完整算法敏感性。
稳健不是无假设:对抗任意污染会牺牲干净模型效率,且 contamination neighborhood 的选择决定保证。
asymptotic variance 与 influence 的二阶矩相连,但 bounded influence 不保证有限方差:若分母
位置 equivariance 要求数据整体平移
finite-sample contamination neighborhood 常写为
回归 leverage 使协变量空间远端点即便残差初始不大也可强烈改变系数。高-breakdown regression 需同时约束 design 与 residual influence;仅使用 Huber loss 主要防 vertical outliers。
报告稳健分析应给 contamination model、tuning constant、scale estimate、breakdown 或 influence 指标,并与经典估计在干净模型下的效率比较。
推论与应用
M-估计通过选择有界或缓慢增长的 score 控制局部污染敏感性;Jackknife则从有限样本删除轨迹估计平滑统计量的一阶影响。稳健标准误、sandwich 协方差与高崩溃点方法分别处理不同风险,不能由一个 bounded influence 数值统包。
参考资料
- Peter J. Huber and Elvezio Ronchetti, Robust Statistics, 2nd ed., Wiley, 2009。
- Frank Hampel et al., Robust Statistics: The Approach Based on Influence Functions, Wiley, 1986。
- Peter Rousseeuw and Annick Leroy, Robust Regression and Outlier Detection, Wiley, 1987。