Skip to content

回归学习与平方损失

Regression learning · Square-loss regression · 平方损失回归

以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。

模型与目标

回归观察 IID 样本

S=((X1,Y1),,(Xm,Ym)),YiR,

并从函数类 FRX 选择预测器 f。平方损失风险为

R(f)=E[(f(X)Y)2],

经验风险为

R^S(f)=1mi=1m(f(Xi)Yi)2.

平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。

条件均值与精确风险分解

Y 二阶可积,记

f(x)=E[YX=x].

利用条件期望的正交性,对任意平方可积 f

R(f)=E[(Yf(X))2]+E[(f(X)f(X))2].

交叉项为零,因为

E[Yf(X)X]=0.

因此条件均值是所有可测预测器中的 Bayes 最优解,第一项是不可约噪声,第二项是预测器到条件均值的 L2(PX) 平方距离。

若限制在 F 中,取 fFargminfFR(f),总体超额风险还要区分逼近误差

R(fF)R(f)

与估计误差 R(f^)R(fF)。数值线性代数精确求出经验最小二乘解,只控制优化误差,不会消除前两项。

线性最小二乘例子

fw(x)=wx。经验平方风险最小化等价于最小二乘问题

minwXwy22.

QR 或 SVD 最小二乘处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新 X 上的风险怎样。把正规方程解出来不等于证明模型会泛化。

当真实关系 Y=βX+ξE[ξX]=0 时,线性类包含条件均值,逼近误差为零。若真实条件均值弯曲而类只含直线,增加样本只能降低估计误差,无法消除模型偏差。

统计复杂度与计算边界

|Y|M 且把预测截断到 [M,M],平方损失落在 [0,4M2]。截断不会增加平方风险,因为对区间内的标签,投影只会缩短残差。此后才可对损失类使用有界集中或一致收敛;pseudo-dimension是控制实值函数类统计复杂度的一条后继路线,不是平方损失回归任务本身的组成部分。

这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的 ε 标度也会随所用界而改变。

无界响应与尾部条件

平方损失在 Y 无界时可重尾,即使 Y 有有限方差,(f(X)Y)2 也未必有足够高矩供 Hoeffding 型界使用。常见路线包括:假设噪声条件次高斯;对预测和响应做有原则的截断并单独控制截断偏差;使用 median-of-means、Catoni 等稳健风险估计;或在局部强凸条件下直接分析参数误差。

这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。

例子与失败边界

在房价预测中,一处录入错误把价格放大一百倍。平方损失会让该点的贡献放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。

平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。

参考资料
  • László Györfi et al., A Distribution-Free Theory of Nonparametric Regression, 2002.
  • Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations, real-valued learning chapters.
  • Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, regression chapters.