Skip to content

回归学习与平方损失

Regression learning · Square-loss regression · 平方损失回归

以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。

条目类型
模型

形式陈述

模型与目标

统计学习中,回归观察 IID 样本

S=((X1,Y1),,(Xm,Ym)),YiR,

并从函数类 FRX 选择预测器 f。平方损失风险为

R(f)=E[(f(X)Y)2],

经验风险为

R^S(f)=1mi=1m(f(Xi)Yi)2.

平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。

条件均值与精确风险分解

Y 二阶可积,记

f(x)=E[YX=x].

利用条件期望的正交性,对任意平方可积 f

R(f)=E[(Yf(X))2]+E[(f(X)f(X))2].

交叉项为零,因为

E[Yf(X)X]=0.

因此条件均值是平方损失下的Bayes 最优预测器,第一项是不可约噪声,第二项是预测器到条件均值的 L2(PX) 平方距离。

若限制在 F 中,取 fFargminfFR(f),总体超额风险还要区分逼近误差

R(fF)R(f)

与估计误差 R(f^)R(fF)。数值线性代数精确求出经验最小二乘解,只控制优化误差,不会消除前两项。

直觉

条件均值分解把平方风险拆成不可约噪声与预测误差。给定 X 后,Yf(X) 的条件均值为零,因此它与任何只依赖 X 的预测偏差正交;交叉项消失,偏离条件均值的代价就精确等于一项 L2(PX) 平方距离。

限制函数类后又出现第二层分解:类本身离条件均值多远是逼近误差,有限样本选出的函数离类内最优多远是估计误差,优化器没有精确找到经验最优则再增加优化误差。三者来源不同,不能用“最小二乘已经解完”合并。

例子与边界

线性最小二乘例子

fw(x)=wx。经验平方风险最小化等价于最小二乘问题

minwXwy22.

QR 或 SVD 最小二乘处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新 X 上的风险怎样。把正规方程解出来不等于证明模型会泛化。

当真实关系 Y=βX+ξE[ξX]=0 时,线性类包含条件均值,逼近误差为零。若真实条件均值弯曲而类只含直线,增加样本只能降低估计误差,无法消除模型偏差。

统计复杂度与计算边界

|Y|M 且把预测截断到 [M,M],平方损失落在 [0,4M2]。截断不会增加平方风险,因为对区间内的标签,投影只会缩短残差。此后才可对损失类使用有界集中或一致收敛;pseudo-dimension是控制实值函数类统计复杂度的一条后继路线,不是平方损失回归任务本身的组成部分。

这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的 ε 标度也会随所用界而改变。

无界响应与尾部条件

平方损失在 Y 无界时可重尾,即使 Y 有有限方差,(f(X)Y)2 也未必有足够高矩供 Hoeffding 型界使用。常见路线包括:假设噪声条件次高斯;对预测和响应做有原则的截断并单独控制截断偏差;使用 median-of-means、Catoni 等稳健风险估计;或在局部强凸条件下直接分析参数误差。

这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。

房价异常值与目标边界

在房价预测中,一处录入错误把价格放大一百倍。平方损失会让该点的贡献放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。

平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。

推论与应用

当真实关系线性且噪声条件均值为零时,线性类的逼近误差消失,分析可集中在协方差、噪声与样本误差;模型错设时,增加样本只会逼近类内最佳直线,无法消除条件均值的曲率偏差。

有界响应下,截断预测不会增加平方风险,并把损失包络控制在 4M2,从而允许伪维或 Rademacher 工具进入。无界响应下必须明确采用次高斯假设、截断偏差或稳健风险估计中的哪一条路线,结论不能同时享受彼此不兼容的前提。

参考资料
  • László Györfi et al., A Distribution-Free Theory of Nonparametric Regression, 2002.
  • Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations, Cambridge University Press, 1999, real-valued learning chapters.
  • Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, 2nd ed., Springer, 2009, regression chapters.
关系图谱10 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。