Skip to content

偏差、方差与均方误差

Bias–variance decomposition · Mean squared error

平方损失下估计误差分解为抽样方差与偏差平方的恒等式。

形式陈述

在模型 {Pθ:θΘ} 中,用实值估计量 g^=T(X) 估计目标 g(θ)。假设对给定 θEθ[g^2]<。偏差和均方误差分别定义为

Biasθ(g^)=Eθ[g^]g(θ),MSEθ(g^)=Eθ[(g^g(θ))2].

则逐参数成立

MSEθ(g^)=Varθ(g^)+Biasθ(g^)2.

证明令 mθ=Eθ[g^],将误差写成

g^g(θ)=(g^mθ)+(mθg(θ)).

平方取期望后,交叉项为

2(mθg(θ))Eθ[g^mθ]=0,

剩余两项恰为方差与偏差平方。该恒等式是平方损失风险的代数分解,不是独立的渐近近似。

直觉

偏差描述估计量抽样中心相对目标的系统位移,方差描述它围绕自身中心的波动。MSE 同时惩罚两者:规则可以稍微移动中心换取明显更稳定的输出,也可能为消除小偏差付出巨大方差。

这三者都是 θ 的函数。说某估计量“低偏差”或“低方差”却不说明参数范围,可能只是在一个局部区域成立;最坏风险或先验平均风险还需在点态 MSE 之外再施加量词。

例子与计算

X1,,Xn 独立同分布,均值 μ、方差 σ2<,则 X¯ 无偏且

MSEμ(X¯)=σ2n.

考虑收缩估计量 μ^c=cX¯。它的偏差为 (c1)μ,方差为 c2σ2/n,故

MSEμ(μ^c)=c2σ2n+(1c)2μ2.

对固定 μ,最优系数为

c(μ)=μ2μ2+σ2/n,

但它依赖未知 μ,不能直接作为可实施规则。这个计算展示偏差—方差权衡,也展示“逐参数最优公式”不一定是合法估计量。

样本方差若使用分母 n,其偏差为 σ2/n;使用 n1 可消除偏差,却不保证在每个分布族和损失下拥有最小 MSE。

还可比较两个具体样本量。对 X¯,把 n100 增至 400 会把方差与 MSE 降为四分之一;若估计量带不随 n 消失的固定偏差 b,则 MSE 只会趋近 b2。因此“更多数据降低方差”不能消除由错误模型或固定正则化造成的渐近偏差。

边界与失败情形

向量目标必须指定几何。若平方损失为 g^g22,则

Eθg^g22=trCovθ(g^)+Biasθ(g^)22.

改用加权范数会相应改变方差迹与偏差项;协方差矩阵本身不能无条件压成一个标量。

绝对损失、01 损失或对数损失没有同一条“方差加偏差平方”恒等式。机器学习中预测误差还可能额外平均训练集、测试点与观测噪声,量词若不同,所谓 bias–variance decomposition 也不同。

二阶矩不存在时,MSE 和方差都可能为无穷,分解虽可在扩展值下形式书写,却不能用有限数字比较规则。无偏也不蕴含一致性:估计量可始终带固定方差。

推论与应用

该分解允许分别追踪正则化造成的系统偏移与数据有限造成的波动。带宽、模型复杂度和收缩强度的选择,常是在某个参数类或平均准则上平衡两项,而不是追求两项同时逐点最小。

有限样本恒等式不直接给出方差或偏差的数量级;要得到收敛率,还需模型的矩条件、光滑性或信息下界。

参考资料
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§7.3。
  • Larry Wasserman, All of Statistics, Springer, 2004,Ch. 7。