形式陈述
在统计模型公理库统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。的参数空间 上,先给定由数据决定的随机准则 。M-估计量是这个优化问题公理库优化问题Optimization problem在可行解集合上最小化或最大化目标函数的计算问题。的全局极小点的一个可测选择:
采用最大化记号也完全等价,只需把准则变号。定义关心的是全局极值结构;某个估计方程的根、梯度很小的点或优化器停止的位置,只有在额外条件下才代表同一对象。
argmin 可能有多个点,也可能为空。允许近似解时应直接写出准则差
并说明 是确定容差还是随数据变化的随机量。若多解时没有预定选择规则, 甚至未必是定义良好的随机对象。
准则差比“参数移动了多少”更接近定义,因为同一个统计模型可以有不同坐标。只有在目标附近另有强凸性,例如
才可把 转成 。没有曲率时,准则值很接近仍可能对应相距很远的参数。
样本准则与总体目标
IID 数据下最重要的特例是经验平均
是实际被优化的随机函数, 则描述重复抽样下的总体目标。二者不能只因符号相近便互换;有限样本的极小点也不会自动靠近总体极小点。依赖数据、删失似然或其他非逐点可加准则同样可以进入 M-估计框架,所以 IID 平均是主例而不是定义边界。
总体准则若在目标参数 处有唯一且分离的极小值,才提供识别入口。若 有一整段极小点,即使 已经一致接近 ,估计量也最多靠近这个集合;它选择哪个点还会受 tie-breaking、参数化和微小扰动影响。参数一致性需要进一步控制 、估计量逃向无穷以及近似优化误差,属于后继的 argmin 理论。
直觉
M-估计把统计目标与求解算法分开:总体准则说明希望识别什么参数,样本准则是从数据得到的随机近似,优化器则只负责寻找其极值。三层必须分别核对;总体目标正确不保证有限样本极值稳定,数值收敛也不保证落在定义所需的全局极小点。
例子与边界
位置估计的同一框架
位置参数展示了准则怎样改变统计目标。平方准则
给出样本均值;绝对值准则给出样本中位数。Huber 准则
在小残差区保持二次曲率,在大残差区只线性增长。其导数 把单个异常值的 score 贡献截在 内。稳健性来自准则对大残差的响应改变,而不是给样本均值换一个名称; 的选择也会在正态效率与污染敏感度之间移动权衡。
数据 把这种差异落到一次计算上。平方准则的极小点是样本均值 ,因为最后一个观测以完整残差进入一阶条件。若取 ,在 内,四项 Huber score 依次为
总和在 时为零。极端值 的贡献被限制为 ,估计位置因而主要由前三个观测确定。这个例子展示的是 influence 截断的机制;它不表示 Huber 准则能自动处理杠杆点、依赖或其他模型失配。
定义之外的保证
若准则可微,内部极小点常满足估计方程 ,但方程的根也可能是极大点或鞍点;绝对损失等非光滑准则则需要次梯度语言。非凸算法只找到局部点时,必须另证该点的准则差或统计性质,不能直接称为定义中的 M-估计量。
一致性与渐近正态也不是定义的组成部分。前者需要总体识别和足够统一的随机准则收敛;后者还需要局部可微性、非退化曲率及中心极限定理。数据驱动选择 Huber 阈值或惩罚强度后,准则本身也随机变化,固定调参值下的结论不能原样沿用。
具体地,令 ,并写
若 ,它在内部近似满足 ,且 非奇异,那么在所需的随机可微性和余项控制下,估计方程可线性化为
若中心极限定理还给出 ,其中 ,便得到后继的渐近结论
这个 sandwich 协方差允许准则并非真实负对数似然,但不免除总体识别、局部唯一性、微分与期望交换以及随机余项的检查。它是 M-估计定义建立后的性质,不是看到一个 argmin 公式便自动获得的分布。
推论与应用
负对数似然取 ,最小二乘取平方残差,二者和稳健位置准则都是这个极值接口的实例。当参数空间换成预测函数类、准则换成经验预测损失时,得到经验风险最小化公理库经验风险最小化Empirical risk minimization · ERM在假设类中选择训练样本平均损失最小的规则。;学习理论还须另行控制样本外泛化。M-估计比 ERM 更宽,也不预设准则必须来自似然或 IID 预测任务。
从随机准则到参数收敛需要估计量一致性公理库估计量的一致性Consistency of estimators · Consistent estimator估计误差随实验规模增长而消失的点态、统一、弱与强收敛性质及其证明边界。的识别与一致收敛条件;从估计方程的局部线性化到 sandwich 极限,则进入估计量的渐近正态性公理库估计量的渐近正态性Asymptotic normality of estimators估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。。稳健准则的 score 截断还可由影响函数公理库稳健统计与影响函数Robust statistics · Influence function以污染邻域和统计泛函导数量化少量异常分布对估计的局部影响。量化,而不能只凭损失曲线外观判断。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
- Peter J. Huber and Elvezio M. Ronchetti, Robust Statistics, 2nd ed., Wiley, 2009,Ch. 4–6。
- David Pollard, Asymptotics for Least Absolute Deviation Regression Estimators, Econometric Theory 7(2), 1991。