形式陈述
在模型 { P θ : θ ∈ Θ } 中,用实值估计量 g ^ = T ( X ) 估计目标 g ( θ ) 。对给定参数点假设二阶矩 公理库 期望 Expectation · Expected value 实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。 E θ [ g ^ 2 ] < ∞ ,定义
Bias θ ( g ^ ) = E θ [ g ^ ] − g ( θ ) , MSE θ ( g ^ ) = E θ [ ( g ^ − g ( θ ) ) 2 ] . 于是对每个满足二阶矩条件的 θ 都有
MSE θ ( g ^ ) = Var θ ( g ^ ) + Bias θ ( g ^ ) 2 . 其中 Var θ ( g ^ ) 是估计量抽样分布的方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 。若 E θ [ g ^ ] = g ( θ ) 对所有参数成立,估计量称为无偏;无偏是整族期望恒等式,而非这次观测误差恰好为零。
证明只需在误差中加减抽样中心 m θ = E θ [ g ^ ] :
g ^ − g ( θ ) = ( g ^ − m θ ) + ( m θ − g ( θ ) ) . 平方并取同一个 P θ 下的期望,交叉项为
2 ( m θ − g ( θ ) ) E θ [ g ^ − m θ ] = 0 , 其消失只用到了中心化误差均值为零。剩余两项恰为方差与偏差平方,所以这是一条有限样本恒等式,也是平方损失风险 公理库 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 的精确分解;其中没有大样本近似,也没有假定偏差与随机误差独立。
直觉
把同一参数下重复实验的估计值画成一团点,偏差是点云中心到目标的位移,方差是点云围绕自身中心的散布,MSE 则是点到目标的平均平方距离。改变估计规则可能移动中心,也可能压缩点云;二者最终都要在同一目标尺度上计入。
三项都会随 θ 改变。所谓低偏差、低方差若没有参数范围,只给出残缺比较;从点态 MSE 走到最坏风险或先验平均风险,还需再对 θ 取上确界或积分,量词不能由图像直觉代替。
例子与边界
若 X 1 , … , X n 独立同分布,均值为 μ 、方差为 σ 2 < ∞ ,则 X ¯ 无偏且
MSE μ ( X ¯ ) = σ 2 n . 把传感器零点偏移通常很小这一领域知识写成固定收缩规则 μ ^ c = c X ¯ 。其偏差为 ( c − 1 ) μ ,方差为 c 2 σ 2 / n ,故
MSE μ ( μ ^ c ) = c 2 σ 2 n + ( 1 − c ) 2 μ 2 . 若暂时把 μ 当作已知常数来做点态优化,形式上的最优系数为
c ∗ ( μ ) = μ 2 μ 2 + σ 2 / n , 它依赖正要估计的 μ ,因而不能直接实施。这个 oracle 计算的用途是定位权衡边界:靠近零时收缩收益较大,远离零时偏差代价占主导;它没有构造出一项合法估计量。
正态样本方差给出一个确实由偏差换得较低 MSE 的有限样本例子。令
S n 2 = 1 n ∑ i = 1 n ( X i − X ¯ ) 2 , S n − 1 2 = 1 n − 1 ∑ i = 1 n ( X i − X ¯ ) 2 . S n 2 的偏差为 − σ 2 / n ,而 S n − 1 2 无偏;利用正态平方和的 χ 2 分布可得
MSE ( S n 2 ) = ( 2 n − 1 ) σ 4 n 2 , MSE ( S n − 1 2 ) = 2 σ 4 n − 1 . 对 n > 1 ,前者反而更小。无偏校正解决了期望中心问题,却不是平方损失下自动最优的校正。
样本量增大时,X ¯ 的方差以 1 / n 衰减;若某规则的偏差趋于非零常数 b ,其 MSE 只能趋向 b 2 。更多数据可以压缩抽样波动,却不会自动消除由固定正则化、测量偏移或模型失配造成的持续位移。
边界与失败情形
向量目标必须先指定几何。对 Euclidean 平方损失,
E θ ‖ g ^ − g ‖ 2 2 = tr Cov θ ( g ^ ) + ‖ Bias θ ( g ^ ) ‖ 2 2 . 改用权重矩阵 W ⪰ 0 后,右侧相应变成 tr { W Cov ( g ^ ) } + Bias T W Bias 。协方差矩阵只有相对于方向或损失权重才能化成标量风险。
绝对损失、0 –1 损失与对数损失没有同一条分解。预测误差还可能依次平均训练集、未来协变量和观测噪声;若这些随机层级改变,教科书中的 prediction bias–variance 公式也要重新推导,不能直接借用这里的参数估计恒等式。
二阶矩不存在时,MSE 与方差可能为无穷,交叉项的代数操作也需谨慎;此时用有限数字比较两条规则没有根据。无偏同样不蕴含一致性 公理库 估计量的一致性 Consistency of estimators · Consistent estimator 估计误差随实验规模增长而消失的点态、统一、弱与强收敛性质及其证明边界。 :估计量若始终保留固定方差,其中心虽正确,误差却不会收缩。
推论与应用
该分解允许分别追踪正则化产生的系统位移与有限数据产生的波动。核密度带宽 公理库 非参数密度估计 Nonparametric density estimation · Kernel density estimation 不预设有限维密度族,通过核和平滑带宽从样本估计概率密度。 、模型复杂度和收缩强度通常通过参数类上的积分风险、上确界风险或交叉验证来选择,因为不存在一个可实施规则把两项在每个参数点同时压到最低。
恒等式只负责记账,不提供偏差或方差的数量级。收敛率要由矩条件、光滑性、模型结构或信息下界 公理库 Cramér–Rao 下界 Cramér–Rao lower bound · Information inequality 正则可微模型中由 score 协方差恒等式推出的方差与 MSE 下界、等号条件及非正则边界。 另行推出;从 MSE → 0 可借 Markov 不等式得到依概率一致,反向则还需要尾部控制。
参考资料
Erich L. Lehmann and George Casella, Theory of Point Estimation , 2nd ed., Springer, 1998,Ch. 1。
George Casella and Roger L. Berger, Statistical Inference , 2nd ed., Duxbury, 2002,§7.3。
Larry Wasserman, All of Statistics , Springer, 2004,Ch. 7。