模型与目标 ​
回归观察 IID 样本
并从函数类
经验风险为
平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。
条件均值与精确风险分解 ​
若
利用条件期望的正交性,对任意平方可积
交叉项为零,因为
因此条件均值是所有可测预测器中的 Bayes 最优解,第一项是不可约噪声,第二项是预测器到条件均值的
若限制在
与估计误差
线性最小二乘例子 ​
令
QR 或 SVD 最小二乘处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新
当真实关系
统计复杂度与计算边界 ​
若
这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的
无界响应与尾部条件 ​
平方损失在
这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。
例子与失败边界 ​
在房价预测中,一处录入错误把价格放大一百倍。平方损失会让该点的贡献放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。
平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。
参考资料
- László Györfi et al., A Distribution-Free Theory of Nonparametric Regression, 2002.
- Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations, real-valued learning chapters.
- Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, regression chapters.