Skip to content

M-估计

M-estimation · M-estimator

通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。

随机准则与极值选择

在统计模型的参数空间 Θ 上,先给定由数据决定的随机准则 Mn:ΘR{+}。M-估计量是准则极小点的一个可测选择:

θ^nargminθΘMn(θ).

采用最大化记号也完全等价,只需把准则变号。定义关心的是全局极值结构;某个估计方程的根、梯度很小的点或优化器停止的位置,只有在额外条件下才代表同一对象。

argmin 可能有多个点,也可能为空。允许近似解时应直接写出准则差

Mn(θ^n)infθΘMn(θ)+rn,

并说明 rn 是确定容差还是随数据变化的随机量。若多解时没有预定选择规则,θ^n 甚至未必是定义良好的随机对象。

准则差比“参数移动了多少”更接近定义,因为同一个统计模型可以有不同坐标。只有在目标附近另有强凸性,例如

Mn(θ)Mn(θ^n)α2θθ^n2,

才可把 rn 转成 θ^nθ^n2rn/α。没有曲率时,准则值很接近仍可能对应相距很远的参数。

样本准则与总体目标

IID 数据下最重要的特例是经验平均

Mn(θ)=1ni=1nmθ(Xi),M(θ)=E[mθ(X)].

Mn 是实际被优化的随机函数,M 则描述重复抽样下的总体目标。二者不能只因符号相近便互换;有限样本的极小点也不会自动靠近总体极小点。依赖数据、删失似然或其他非逐点可加准则同样可以进入 M-估计框架,所以 IID 平均是主例而不是定义边界。

总体准则若在目标参数 θ0 处有唯一且分离的极小值,才提供识别入口。若 M 有一整段极小点,即使 Mn 已经一致接近 M,估计量也最多靠近这个集合;它选择哪个点还会受 tie-breaking、参数化和微小扰动影响。参数一致性需要进一步控制 MnM、估计量逃向无穷以及近似优化误差,属于后继的 argmin 理论。

位置估计的同一框架

位置参数展示了准则怎样改变统计目标。平方准则

Mn(μ)=1ni(Xiμ)2

给出样本均值;绝对值准则给出样本中位数。Huber 准则

ρc(u)={u2/2,|u|c,c|u|c2/2,|u|>c

在小残差区保持二次曲率,在大残差区只线性增长。其导数 ψc(u)=sign(u)min(|u|,c) 把单个异常值的 score 贡献截在 [c,c] 内。稳健性来自准则对大残差的响应改变,而不是给样本均值换一个名称;c 的选择也会在正态效率与污染敏感度之间移动权衡。

数据 (1,0,1,100) 把这种差异落到一次计算上。平方准则的极小点是样本均值 25,因为最后一个观测以完整残差进入一阶条件。若取 c=1,在 0μ1 内,四项 Huber score 依次为

1,μ,1μ,1,

总和在 μ=1/2 时为零。极端值 100 的贡献被限制为 1,估计位置因而主要由前三个观测确定。这个例子展示的是 influence 截断的机制;它不表示 Huber 准则能自动处理杠杆点、依赖或其他模型失配。

定义之外的保证

若准则可微,内部极小点常满足估计方程 Mn(θ)=0,但方程的根也可能是极大点或鞍点;绝对损失等非光滑准则则需要次梯度语言。非凸算法只找到局部点时,必须另证该点的准则差或统计性质,不能直接称为定义中的 M-估计量。

一致性与渐近正态也不是定义的组成部分。前者需要总体识别和足够统一的随机准则收敛;后者还需要局部可微性、非退化曲率及中心极限定理。数据驱动选择 Huber 阈值或惩罚强度后,准则本身也随机变化,固定调参值下的结论不能原样沿用。

具体地,令 ψ(x,θ)=θmθ(x),并写

Ψn(θ)=1ni=1nψ(Xi,θ),Ψ(θ)=E[ψ(X,θ)].

θ^nPθ0,它在内部近似满足 Ψn(θ^n)=oP(n1/2),且 A=θΨ(θ0) 非奇异,那么在所需的随机可微性和余项控制下,估计方程可线性化为

0=Ψn(θ0)+A(θ^nθ0)+oP(n1/2).

若中心极限定理还给出 nΨn(θ0)N(0,B),其中 B=Var(ψ(X,θ0)),便得到后继的渐近结论

n(θ^nθ0)N(0,A1BAT).

这个 sandwich 协方差允许准则并非真实负对数似然,但不免除总体识别、局部唯一性、微分与期望交换以及随机余项的检查。它是 M-估计定义建立后的性质,不是看到一个 argmin 公式便自动获得的分布。

负对数似然取 mθ(x)=logpθ(x),最小二乘取平方残差,二者和稳健位置准则都是这个极值接口的实例。当参数空间换成预测函数类、准则换成经验预测损失时,得到经验风险最小化;学习理论还须另行控制样本外泛化。M-估计比 ERM 更宽,也不预设准则必须来自似然或 IID 预测任务。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
  • Peter J. Huber and Elvezio M. Ronchetti, Robust Statistics, 2nd ed., Wiley, 2009,Ch. 4–6。
  • David Pollard, Asymptotics for Least Absolute Deviation Regression Estimators, Econometric Theory 7(2), 1991。