形式陈述
带宽选择先要指定将来预测谁、用什么损失计分。对固定核的NW回归理路Nadaraya–Watson 核回归Nadaraya-Watson regression · Kernel regression · 核加权回归将邻域核值归一化为响应权重,区分随机比值、人口平滑目标、边界偏差以及密度核和正半定核。,取预先规定的有限候选集合 。对每个候选 ,删去第 个训练对,在剩余 对上重新执行完整预测规则,记其对 的预测为 。
对 ,平方损失留一准则为
本页约定:任一留一预测邻域为空,该候选记为不可用;从其余候选中选CV最小者,相等时取较大的带宽。若全部不可用,返回失败并报告原因。然后用选中的 在全部训练资料上重拟合。需要空箱后备值的业务可另定完整后备算法,再把其真实输出计入CV。
这属于模型选择协议理路留出法与交叉验证Holdout · Cross-validation · 交叉验证通过隔离训练、模型选择和最终评价的数据角色估计样本外风险,并识别反复查看测试集造成的选择偏差。。预处理的估计、变量缩放、异常值规则若也由训练资料学习,必须在每个留一子问题内重新学习;下面的快捷公式只适用于输入表示和核形状已固定的情形。
直觉
极小带宽会让每个训练点几乎只听自己的响应,训练误差看起来很低。删点后再问同一位置,就能看到“没有这条答案时会怎样”。较宽窗口虽然牺牲训练贴合,却可能改善这种样本外预测。
CV评价未来响应的平方损失。由于未来噪声给所有候选增加同一个不可约项,它也可用于比较条件均值估计风险。它并不直接评价置信区间覆盖、曲线导数或最坏输入位置误差;这些目标可以偏好另一种尺度。
例子与边界
三个点,三个候选,从失败到选择
训练输入为 ,响应为 。用矩形核 ,候选带宽为 。
时全样本预测完全复制响应,训练MSE为0;但每次删点后其位置都没有邻居,所以CV不可用。
时全样本权重矩阵与预测为
留一时两端各只能使用中点,预测1;中点使用两端,预测0。因此留一预测是 ,三个平方误差均为1,。
时全样本各点都预测 。删去端点后另外两点响应均值为 ;删去中点后为0。因此留一预测为 ,平方误差为 ,。按协议选择 ,最终重拟合预测这三个位置均为 。
这个结果是这份数据和候选集合上的选择,不能推出总体最优带宽正好为2.1。特别是原先无效的0.4不能因为训练误差最小而被自动选中。
k近邻不能照抄同一个留一分母
输入 、响应 ,取 。在训练位置0,全样本预测5,自身权重 。若套 ,会得到残差 ,即留一预测10。
真正删除第一个点后,仍须找两个邻居,因此使用1与3,预测20,残差 。错误公式只把原先剩下的一个邻居重新归一化,没有补入下一个邻居。k近邻理路k 近邻回归k-nearest-neighbor regression · kNN regression用按距离选出的邻居响应平均估计条件均值,明确并列规则、局部偏差、噪声平均和维数代价。虽是固定设计下的线性平滑器,却不因此满足NW的删点归一化性质。
调参所见资料不能兼任最终独立评价
若从很多 中挑最小CV值,再把这个最小值当作无偏的最终测试成绩,选择已倾向于保留偶然低估的候选。需要报告整个选择流程的泛化表现时,应留独立测试资料,或用嵌套验证理路嵌套交叉验证的执行协议Nested cross-validation protocol · Nested model evaluation protocol对重复实体资料逐层隔离拟合、校准、调参与评价,完整复算内层选择、外层损失和实际拟合次数。在外层只评价内层选出的流程。若同一实体有多行或数据有时间顺序,切分单位也应与部署任务匹配。
推论与应用
NW留一快捷式及其确切适用条件
固定 与输入表示,令 、,全样本预测权重 。在 且 时,删除第 条后其他未归一化核值不变,所以
相减得
三点例 的全样本残差为 ,分母为 ,得到 ,与直接重拟合一致。 时 ,分母为零正是在报告邻域消失,不能把数值加一个小常数后仍称为同一个CV。
局部多项式的删点公式需要相应的加权最小二乘删除恒等式及删点后满秩;若每折改带宽、重选变量或更改输入尺度,就应重拟合完整流程。核岭回归理路核岭回归kernel ridge regression · KRR · least-squares regularization network用表示定理把 RKHS 平方损失正则化化为一个 Gram 线性系统。有自己的留一公式,尤其要固定未归一化惩罚系数,不能只因符号同叫 就互换协议。
选择准则究竟估计哪个风险
对预先固定的 ,假设全部预测有有限二阶矩,且同一学习规则对样本置换对称。IID抽样使每个留一项都相当于:用 个独立观测训练,再在一个独立新观测测试。由期望线性,
式(3)不需要各留一损失独立;它们通常共享训练资料而相关。它对应训练量 的固定候选,也没有对 作无偏承诺。本页“无效候选返回失败”的协议在出现失败时不产生有限CV,因此式(3)只在所论规则总能预测,或已有明确可积后备规则时使用。
给定训练结果,对未来独立 使用条件均值正交分解,得到
不可约噪声项不依赖带宽,解释了平方预测损失选择的目标。若验证人群与部署人群不同,式(3)仍只针对原IID总体,不能自动替代目标风险。
计算、停止与推断带宽
个固定候选的直接核成对计算需 核求值(一维);多维距离再带 因子。可逐行累计以减少存储,或缓存距离但付出 空间。式(2)避免为每个留一问题重复扫描全部训练查询,但没有把所有成对核值变成线性数量。
网格扫描结束后按规定准则返回最小者;报告候选网格、不可用候选、平局规则、最小点是否位于网格端点。继续看图扩展网格可以改善预测搜索,却构成额外选择步骤,外层评价应覆盖它。
稳定局部线性设计理路局部多项式回归Local polynomial regression · Local linear regression · 局部线性回归在每个查询邻域解加权多项式拟合,用矩复制解释边界去偏,并核算负权重、局部秩与噪声代价。中,点估计风险可能为 。最小化给 ;此时偏差 与标准误 同阶。区间覆盖理路局部平滑的置信区间Local smoothing confidence intervals · Bias-aware nonparametric confidence intervals从固定设计的加权正态误差构造偏差可控区间,精确展示MSE带宽欠覆盖,并区分单点、网格与连续曲线覆盖。要求继续处理这个偏差;CV选得准确也不能自动使偏差相对标准误趋零。
自测与答案
- 三点例的CV损失有三项,能否把其样本标准差除以 当作普遍有效的CV标准误?不能;三项使用重叠训练资料,独立性未成立。
- 核整体乘以7,式(2)及选出的带宽会改变吗?固定候选和精确算术下不变,因为归一化权重全部不变。
参考资料