形式陈述
实际观测服从分布 ,工作统计模型理路统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。为 ,并给定损失 。若期望有定义,写
当最小值达到且集合只有一个点时,该点 称为这个准则下的伪真参数。它依赖真实分布、工作模型和损失,不能脱离准则只说“离真分布最近的参数”。如果 为空或有多点,应如实报告;定义本身不保证存在、唯一或可估。
M-估计理路M-估计M-estimation · M-estimator通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。通过 的极小化拟合工作模型。若对固定 ,样本准则一致逼近 , 分离,并且近似求解误差趋零,则Argmin 一致性定理理路Argmin 一致性定理Argmin consistency theorem用总体分离、随机一致逼近和近似求解容差,把样本准则的极小点定位到总体目标。给 。此处的一致性中心是 ,不是额外指定的科学目标 。
对数损失何时等价于 KL 投影
假设 和全部工作分布相对于同一测度有密度 ,且对考虑的每个参数, 在 下几乎处处,、。对数损失 满足有限量恒等式
第一项不依赖 ,所以最小化预期负对数似然与最小化这个方向的KL 散度理路KL 散度Kullback–Leibler divergence · Relative entropy同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。有同一个解集。方向是 ;一般不能反过来。若这些期望不是有限量,不可用 推导,应另用相对对数似然或直接定义的扩展值 KL 来处理。
直觉
模型可能只是一个压缩规则:把真实分布投到一族容易解释的形状上。伪真参数说明这种压缩保留哪项特征。压缩越来越稳定,不代表整个真实分布越来越像工作模型;它只意味着所选准则对最优代表的意见越来越一致。
这也解释了稳健标准误的边界。它可以校准估计值围绕实际目标的随机散布,却不能把“平均响应”自动变成“无污染中心”,也不能把关联系数自动变成因果效应。
例子与边界
错配正态模型仍准确地以均值为目标
工作模型为 ,真实分布为
这里 ,。工作负对数似然与 只差常数,因此
唯一伪真参数为 。工作模型不能表达双成分结构,但样本均值仍一致估计真实总体均值,且根号样本量方差为10。错误使用工作模型内的信息逆会报方差系数1;sandwich 协方差理路Sandwich 协方差估计Sandwich covariance estimation从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。则使用真实残差方差,得到10。
若问题本来就问“所有观测的平均值”,目标是1,并不存在中心偏差。若问题问“90%主体成分的位置”,目标是0,偏差1不是标准误问题;即使区间越来越窄,也只会越来越有把握地围住另一个目标。
同一分布,平方损失和 Huber 损失选择不同对象
另取离散分布 、。平方损失仍以均值1为极小点。固定阈值1的 Huber 准则,在 内的总体得分为
所以唯一解为 。唯一性也可核查:得分单调不增,在包含该点的区间严格递减,区间两端异号。这不是两个估计量对同一个目标给出相反答案,而是两条准则选取了不同的分布泛函。
这个离散例只用于比较损失目标,不使用前面的连续密度 KL 恒等式。离散 对连续正态工作分布的 KL 为无穷,不能把平方损失投影在此直接叫作有限 KL 投影。
线性投影不要求条件均值真是直线
设 、, 正定。平方损失 的唯一解为
这是一个边际正交条件,不蕴含 。例如 ,,,则 。最佳直线为常数1/3,而真实条件均值仍是抛物线。
把 代入可见,截距残差的方差为 。工作直线的抽样标准误可以估计,但不会让曲线逼近误差消失。若输入分布改变,最佳投影还可能改变,因此应说明相对于哪一个人群定义目标。
推论与应用
对标量目标,误差可恒等分解为
三项依次是计算误差、围绕准则目标的抽样误差,以及目标差异。它们不是三个可随意相加的标准差,也不自动独立。若最后一项为固定非零值,前两项随样本量消失后,围绕 收缩的普通区间一般不会覆盖 。
似然模型正确且可识别时,KL 非负性使真参数成为目标;模型错配时仍须检查工作目标的存在、唯一、分离和矩条件。sandwich 的稳健性是对某些方差模型限制的放宽,不是对任何错配都有效的万能修复。
自测与答案
- 把离散 Huber 例的污染位置10换为100,不变,目标如何变化?答案:仍为 ,因为该位置在解附近一直处于得分截断区;平方损失目标则从1变为10。
- 若工作参数空间为 , 的均值为2,使用平方损失,是否存在伪真参数?答案:不存在,最小值仅在被排除的边界1处逼近。不能仅凭严格凸性声称 argmin 存在。
参考资料
- Stanford STATS 200,Lecture 16: MLE under model misspecification,2016,§16.1、Theorem 16.3及§16.2:KL 投影与错配方差。讲义的一致性陈述留有正则条件;本文通过明确的 argmin 条件补全所用保证。
- Halbert White,Maximum Likelihood Estimation of Misspecified Models,Econometrica 50(1),1982,pp.1–25:错配极大似然理论的原始文献;本页的三个例子及有限期望恒等式均已自包含计算。