形式陈述 ​
模型与目标 ​
在统计学习中,回归观察 IID 样本
并从函数类
经验风险为
平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。
条件均值与精确风险分解 ​
若
利用条件期望的正交性,对任意平方可积
交叉项为零,因为
因此条件均值是平方损失下的Bayes 最优预测器,第一项是不可约噪声,第二项是预测器到条件均值的
若限制在
与估计误差
直觉
条件均值分解把平方风险拆成不可约噪声与预测误差。给定
限制函数类后又出现第二层分解:类本身离条件均值多远是逼近误差,有限样本选出的函数离类内最优多远是估计误差,优化器没有精确找到经验最优则再增加优化误差。三者来源不同,不能用“最小二乘已经解完”合并。
例子与边界
线性最小二乘例子 ​
令
QR 或 SVD 最小二乘处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新
当真实关系
统计复杂度与计算边界 ​
若
这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的
无界响应与尾部条件 ​
平方损失在
这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。
房价异常值与目标边界 ​
在房价预测中,一处录入错误把价格放大一百倍。平方损失会让该点的贡献放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。
平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。
推论与应用
当真实关系线性且噪声条件均值为零时,线性类的逼近误差消失,分析可集中在协方差、噪声与样本误差;模型错设时,增加样本只会逼近类内最佳直线,无法消除条件均值的曲率偏差。
有界响应下,截断预测不会增加平方风险,并把损失包络控制在
参考资料
- László Györfi et al., A Distribution-Free Theory of Nonparametric Regression, 2002.
- Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations, Cambridge University Press, 1999, real-valued learning chapters.
- Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, 2nd ed., Springer, 2009, regression chapters.