形式陈述
模型与目标
在统计学习 理路 统计学习问题 Statistical learning problem 从未知分布的有限观测中选择决策规则,并以样本外表现评价其质量。 中,回归观察 m ≥ 1 个IID 观测 理路 独立同分布样本 IID sample · Independent and identically distributed sample 以乘积分布描述来自同一总体的独立重复观测。 组成的样本
S = ( ( X 1 , Y 1 ) , … , ( X m , Y m ) ) , Y i ∈ R , 并从函数类 F ⊆ R X 选择预测器 f 。平方损失风险为
R ( f ) = E [ ( f ( X ) − Y ) 2 ] , 经验风险为
R ^ S ( f ) = 1 m ∑ i = 1 m ( f ( X i ) − Y i ) 2 . 平方损失同时惩罚偏差方向和幅度,因而对大残差尤其敏感。它不是“连续标签版的 0–1 损失”:损失无界、最优预测器不同,所需的集中工具也不同。
条件均值与精确风险分解
若 Y 二阶可积,记
f ∗ ( x ) = E [ Y ∣ X = x ] . 对任意使 f ( X ) 平方可积的可测 f ,先展开平方,再用迭代期望 理路 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 消去交叉项,得到
R ( f ) = E [ ( Y − f ∗ ( X ) ) 2 ] + E [ ( f ( X ) − f ∗ ( X ) ) 2 ] . 交叉项为零,因为
E [ Y − f ∗ ( X ) ∣ X ] = 0. 因此条件均值是平方损失下的Bayes 最优预测器 理路 Bayes 预测器与 Bayes 风险 Bayes predictor · Bayes classifier · Bayes risk 已知真实联合分布时逐点最小化条件损失所得的最优决策。 ,第一项是不可约噪声,第二项是预测器到条件均值的 L 2 ( P X ) 平方距离。
以下类内分解继续假设 Y 二阶可积,并要求 F 中每个 f ( X ) 都二阶可积,使所比较的风险有限。若限制在非空 F 中且类内最小风险取得,取 f F ∗ ∈ arg min f ∈ F R ( f ) 。按超额风险分解 理路 超额风险与误差分解 Excess risk · Error decomposition 把相对最优决策的风险差拆成逼近、估计和优化来源。 ,总体超额风险还要区分逼近误差
R ( f F ∗ ) − R ( f ∗ ) 与估计误差 R ( f ^ ) − R ( f F ∗ ) 。若最小值未取得,就用 inf f ∈ F R ( f ) 作类内基准,分解仍成立。数值线性代数精确求出经验最小二乘解,只控制优化误差,不会消除前两项。
直觉
条件均值分解把平方风险拆成不可约噪声与预测误差。给定 X 后,Y − f ∗ ( X ) 的条件均值为零,因此它与任何只依赖 X 的预测偏差正交;交叉项消失,偏离条件均值的代价就精确等于一项 L 2 ( P X ) 平方距离。
限制函数类后又出现第二层分解:类本身离条件均值多远是逼近误差,有限样本选出的函数离类内最优多远是估计误差,优化器没有精确找到经验最优则再增加优化误差。三者来源不同,不能用“最小二乘已经解完”合并。
例子与边界
线性最小二乘例子
令 f w ( x ) = w ⊤ x 。经验平方风险最小化等价于最小二乘问题
min w ‖ X w − y ‖ 2 2 . QR 或 SVD 最小二乘 理路 用 QR 与 SVD 求最小二乘 Least squares via QR · Least squares via SVD · Numerical least squares 以 QR 作为满列秩最小二乘的默认计算路线,并用 SVD 处理秩亏、欠定和最小范数解。 处理秩亏与数值稳定性;学习分析则进一步问:设计向量怎样抽样、噪声尾部多重、协方差是否退化,以及样本解在新 X 上的风险怎样。把正规方程解出来不等于证明模型会泛化。
当真实关系 Y = β ⊤ X + ξ 且 E [ ξ ∣ X ] = 0 时,线性类包含条件均值,逼近误差为零。若真实条件均值弯曲而类只含直线,增加样本只能降低估计误差,无法消除模型偏差。
统计复杂度与计算边界
若 | Y | ≤ M 且把预测截断到 [ − M , M ] ,平方损失落在 [ 0 , 4 M 2 ] 。截断不会增加平方风险,因为对区间内的标签,投影只会缩短残差。此后才可对损失类使用有界集中或一致收敛;pseudo-dimension 理路 伪维 pseudo-dimension · Pollard dimension 通过逐点阈值打散,把 VC 维推广到实值函数类。 是控制实值函数类统计复杂度的一条后继路线,不是平方损失回归任务本身的组成部分。
这一步不能把二分类 VC 公式原样替换标签类型。平方损失的 Lipschitz 常数依赖预测与标签范围,超额风险的 ε 标度也会随所用界而改变。
无界响应与尾部条件
平方损失在 Y 无界时可重尾,即使 Y 有有限方差,( f ( X ) − Y ) 2 也未必有足够高矩供 Hoeffding 型界使用。常见路线包括:假设噪声条件次高斯;对预测和响应做有原则的截断并单独控制截断偏差;使用 median-of-means 理路 分组均值中位数估计 Median-of-means estimator · MoM 均值估计 将独立样本分成不相交的组,先平均再取中位数,以有限方差取得依赖置信度的均值误差保证,并明确组数、余数和尺度条件。 、Catoni 等稳健风险估计;或在局部强凸条件下直接分析参数误差。
对预先固定的预测器,或在独立评价样本上固定训练结果,使用这里链接的有限方差 MoM 估计平方损失均值,还需证明平方损失本身有有限方差;仅有响应 Y 的有限方差不够。若在同一批数据上选择预测器,还需统一或选择后的校准,单个固定量的 MoM 保证不能自动完成泛化分析。
这些方法处理的是不同问题。假定次高斯是分布条件,截断改变估计器,稳健均值改变经验目标。不能在证明中用次高斯尾界,却在结论里宣称只要求有限方差。
房价异常值与目标边界
在房价预测中,一处录入错误把价格放大一百倍。若这使残差放大一百倍,该点的平方损失贡献就放大一万倍,经验最小二乘线可能明显偏转;绝对损失或稳健平方损失估计更耐这种异常。若高价房是真实但稀有的部署对象,简单删除又会改变目标分布。边界处理必须先判断它是污染还是业务尾部。
平方风险低也不保证每个条件分位数准确。对严重异方差数据,条件均值仍是平方损失最优预测,但单一点预测没有表达区间宽度;概率预测或分位数回归需要另外的损失与评价协议。
推论与应用
当真实关系线性且噪声条件均值为零时,线性类的逼近误差消失,分析可集中在协方差、噪声与样本误差;模型错设时,增加样本只会逼近类内最佳直线,无法消除条件均值的曲率偏差。
有界响应下,截断预测不会增加平方风险,并把损失包络控制在 4 M 2 ,从而允许伪维或 Rademacher 工具进入。无界响应下必须明确采用次高斯假设、截断偏差或稳健风险估计中的哪一条路线,结论不能同时享受彼此不兼容的前提。
局部预测:函数估计误差与新响应误差分开
k近邻 理路 k 近邻回归 k-nearest-neighbor regression · kNN regression 用按距离选出的邻居响应平均估计条件均值,明确并列规则、局部偏差、噪声平均和维数代价。 、NW核回归 理路 Nadaraya–Watson 核回归 Nadaraya-Watson regression · Kernel regression · 核加权回归 将邻域核值归一化为响应权重,区分随机比值、人口平滑目标、边界偏差以及密度核和正半定核。 、回归直方图 理路 回归直方图 Regression histogram · Regressogram · Partitioning regression estimate 在预定输入分箱中估计条件均值,显式处理空箱,并从随机箱计数推导完整积分风险与维数代价。 与局部多项式 理路 局部多项式回归 Local polynomial regression · Local linear regression · 局部线性回归 在每个查询邻域解加权多项式拟合,用矩复制解释边界去偏,并核算负权重、局部秩与噪声代价。 给出从样本到实值预测器的具体构造。前者指定邻居数,核法指定距离尺度,直方图固定输入分箱,局部多项式还需检查邻域设计满秩。它们的输出都可在本页平方风险下评价;每条统计率需要其各自的平滑性、设计与噪声条件。
固定训练结果后,在新输入 x 处令新响应 Y n e w = m ( x ) + ε n e w ,其中 E ( ε n e w ∣ x ) = 0 、方差为 σ 2 ( x ) ,且新噪声与训练资料独立。直接展开得到
E [ ( Y n e w − m ^ ( x ) ) 2 ∣ train , x ] = σ 2 ( x ) + ( m ^ ( x ) − m ( x ) ) 2 . 再平均训练样本,右侧第二项才分成估计偏差平方与估计方差。例如估计器已完全知道 m ( x ) = 2 ,在响应取 2 ± 1 与 2 ± 3 的两个等概率总体中,函数估计误差都为零,新响应平方风险却分别为1与9。均值曲线的准确程度不能单独决定预测集合宽度。
分位数回归 理路 分位数回归与 pinball 损失 Quantile regression · Pinball loss · Check loss · 分位数损失 用不对称绝对损失定位条件分位数,推导总体最优性、分组与局部加权解,并区分函数类限制和预测覆盖。 改用不对称绝对损失,最优对象变为条件分位集合;它与本页的区别是目标泛函和损失,而不只是换一种优化器。若采用实值输入的局部平滑,还应为点态 m ( x ) 指定连续等结构版本:条件期望本身只在输入分布几乎处处确定。
参考资料
László Györfi et al., A Distribution-Free Theory of Nonparametric Regression , 2002.
Martin Anthony and Peter Bartlett, Neural Network Learning: Theoretical Foundations , Cambridge University Press, 1999, real-valued learning chapters.
Trevor Hastie, Robert Tibshirani, and Jerome Friedman, The Elements of Statistical Learning , 2nd ed., Springer, 2009, regression chapters.