Skip to content

模型Model

回归学习与平方损失

Regression learning · Square-loss regression · 平方损失回归

以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。

形式陈述 ​

模型与目标 ​

在统计学习中,回归观察 m≥1 个IID 观测组成的样本

S=((X1,Y1),…,(Xm,Ym)),Yi∈R,

并从函数类 F⊆RX 选择预测器 f。平方损失风险为

R(f)=E[(f(X)−Y)2],

经验风险为

R^S(f)=1m∑i=1m(f(Xi)−Yi)2.

平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。

条件均值与精确风险分解 ​

若 Y 二阶可积,记

f∗(x)=E[Y∣X=x].

对任意使 f(X) 平方可积的可测 f,先展开平方,再用迭代期望消去交叉项,得到

R(f)=E[(Y−f∗(X))2]+E[(f(X)−f∗(X))2].

交叉项为零,因为

E[Y−f∗(X)∣X]=0.

因此条件均值是平方损失下的Bayes 最优预测器,第一项是不可约噪声,第二项是预测器到条件均值的 L2(PX) 平方距离。

以下类内分解继续假设 Y 二阶可积,并要求 F 中每个 f(X) 都二阶可积,使所比较的风险有限。若限制在非空 F 中且类内最小风险取得,取 fF∗∈arg⁡minf∈FR(f)。按超额风险分解,总体超额风险还要区分逼近误差

R(fF∗)−R(f∗)

与估计误差 R(f^)−R(fF∗)。若最小值未取得,就用 inff∈FR(f) 作类内基准,分解仍成立。数值线性代数精确求出经验最小二乘解,只控制优化误差,不会消除前两项。

直觉

条件均值分解把平方风险拆成不可约噪声与预测误差。给定 X 后,Y−f∗(X) 的条件均值为零,因此它与任何只依赖 X 的预测偏差正交;交叉项消失,偏离条件均值的代价就精确等于一项 L2(PX) 平方距离。

限制函数类后又出现第二层分解:类本身离条件均值多远是逼近误差,有限样本选出的函数离类内最优多远是估计误差,优化器没有精确找到经验最优则再增加优化误差。三者来源不同,不能用“最小二乘已经解完”合并。

例子与边界

线性最小二乘例子 ​

令 fw(x)=w⊤x。经验平方风险最小化等价于最小二乘问题

minw‖Xw−y‖22.

QR 或 SVD 最小二乘处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新 X 上的风险怎样。把正规方程解出来不等于证明模型会泛化。

当真实关系 Y=β⊤X+ξ 且 E[ξ∣X]=0 时,线性类包含条件均值,逼近误差为零。若真实条件均值弯曲而类只含直线,增加样本只能降低估计误差,无法消除模型偏差。

统计复杂度与计算边界 ​

若 |Y|≤M 且把预测截断到 [−M,M],平方损失落在 [0,4M2]。截断不会增加平方风险,因为对区间内的标签,投影只会缩短残差。此后才可对损失类使用有界集中或一致收敛;pseudo-dimension是控制实值函数类统计复杂度的一条后继路线,不是平方损失回归任务本身的组成部分。

这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的 ε 标度也会随所用界而改变。

无界响应与尾部条件 ​

平方损失在 Y 无界时可重尾,即使 Y 有有限方差,(f(X)−Y)2 也未必有足够高矩供 Hoeffding 型界使用。常见路线包括:假设噪声条件次高斯;对预测和响应做有原则的截断并单独控制截断偏差;使用 median-of-means、Catoni 等稳健风险估计;或在局部强凸条件下直接分析参数误差。

对预先固定的预测器,或在独立评价样本上固定训练结果,使用这里链接的有限方差 MoM 估计平方损失均值,还需证明平方损失本身有有限方差;仅有响应 Y 的有限方差不够。若在同一批数据上选择预测器,还需统一或选择后的校准,单个固定量的 MoM 保证不能自动完成泛化分析。

这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。

房价异常值与目标边界 ​

在房价预测中,一处录入错误把价格放大一百倍。若这使残差放大一百倍,该点的平方损失贡献就放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。

平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。

推论与应用

当真实关系线性且噪声条件均值为零时,线性类的逼近误差消失,分析可集中在协方差、噪声与样本误差;模型错设时,增加样本只会逼近类内最佳直线,无法消除条件均值的曲率偏差。

有界响应下,截断预测不会增加平方风险,并把损失包络控制在 4M2,从而允许伪维或 Rademacher 工具进入。无界响应下必须明确采用次高斯假设、截断偏差或稳健风险估计中的哪一条路线,结论不能同时享受彼此不兼容的前提。

局部预测:函数估计误差与新响应误差分开 ​

k近邻、NW核回归、回归直方图与局部多项式给出从样本到实值预测器的具体构造。前者指定邻居数,核法指定距离尺度,直方图固定输入分箱,局部多项式还需检查邻域设计满秩。它们的输出都可在本页平方风险下评价;每条统计率需要其各自的平滑性、设计与噪声条件。

固定训练结果后,在新输入 x 处令新响应 Ynew=m(x)+εnew,其中 E(εnew∣x)=0、方差为 σ2(x),且新噪声与训练资料独立。直接展开得到

E[(Ynew−m^(x))2∣train,x]=σ2(x)+(m^(x)−m(x))2.

再平均训练样本,右侧第二项才分成估计偏差平方与估计方差。例如估计器已完全知道 m(x)=2,在响应取 2±1 与 2±3 的两个等概率总体中,函数估计误差都为零,新响应平方风险却分别为1与9。均值曲线的准确程度不能单独决定预测集合宽度。

分位数回归改用不对称绝对损失,最优对象变为条件分位集合;它与本页的区别是目标泛函和损失,而不只是换一种优化器。若采用实值输入的局部平滑,还应为点态 m(x) 指定连续等结构版本:条件期望本身只在输入分布几乎处处确定。

参考资料
  • László Györfi et al., A Distribution-Free Theory of Nonparametric Regression, 2002.
  • Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations, Cambridge University Press, 1999, real-valued learning chapters.
  • Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning, 2nd ed., Springer, 2009, regression chapters.
关系图谱25 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系