“结合MSE 分解还需加 $b(\theta)^2$;下界不会自动惩罚偏差大小。”
形式陈述 ​
在模型
则逐参数成立
证明令
平方取期望后,交叉项为
剩余两项恰为方差与偏差平方。该恒等式是平方损失风险的代数分解,不是独立的渐近近似。
直觉 ​
偏差描述估计量抽样中心相对目标的系统位移,方差描述它围绕自身中心的波动。MSE 同时惩罚两者:规则可以稍微移动中心换取明显更稳定的输出,也可能为消除小偏差付出巨大方差。
这三者都是
例子与计算 ​
若
考虑收缩估计量
对固定
但它依赖未知
样本方差若使用分母
还可比较两个具体样本量。对
边界与失败情形 ​
向量目标必须指定几何。若平方损失为
改用加权范数会相应改变方差迹与偏差项;协方差矩阵本身不能无条件压成一个标量。
绝对损失、
二阶矩不存在时,MSE 和方差都可能为无穷,分解虽可在扩展值下形式书写,却不能用有限数字比较规则。无偏也不蕴含一致性:估计量可始终带固定方差。
推论与应用 ​
该分解允许分别追踪正则化造成的系统偏移与数据有限造成的波动。带宽、模型复杂度和收缩强度的选择,常是在某个参数类或平均准则上平衡两项,而不是追求两项同时逐点最小。
有限样本恒等式不直接给出方差或偏差的数量级;要得到收敛率,还需模型的矩条件、光滑性或信息下界。
参考资料
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1。
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§7.3。
- Larry Wasserman, All of Statistics, Springer, 2004,Ch. 7。