Skip to content

方法Method

非参数回归的带宽选择

Nonparametric regression bandwidth selection · Leave-one-out bandwidth selection

按预测损失选择局部尺度,手算核回归留一残差,识别空邻域、补邻居以及选择后评价和推断的边界。

形式陈述 ​

带宽选择先要指定将来预测谁、用什么损失计分。对固定核的NW回归,取预先规定的有限候选集合 H⊂(0,∞)。对每个候选 h,删去第 i 个训练对,在剩余 n−1 对上重新执行完整预测规则,记其对 Xi 的预测为 m^−i,h(Xi)。

对 n≥2,平方损失留一准则为

(1)CV(h)=1n∑i=1n[Yi−m^−i,h(Xi)]2,h^∈arg⁡minh∈HCV(h).

本页约定:任一留一预测邻域为空,该候选记为不可用;从其余候选中选CV最小者,相等时取较大的带宽。若全部不可用,返回失败并报告原因。然后用选中的 h^ 在全部训练资料上重拟合。需要空箱后备值的业务可另定完整后备算法,再把其真实输出计入CV。

这属于模型选择协议。预处理的估计、变量缩放、异常值规则若也由训练资料学习,必须在每个留一子问题内重新学习;下面的快捷公式只适用于输入表示和核形状已固定的情形。

直觉

极小带宽会让每个训练点几乎只听自己的响应,训练误差看起来很低。删点后再问同一位置,就能看到“没有这条答案时会怎样”。较宽窗口虽然牺牲训练贴合,却可能改善这种样本外预测。

CV评价未来响应的平方损失。由于未来噪声给所有候选增加同一个不可约项,它也可用于比较条件均值估计风险。它并不直接评价置信区间覆盖、曲线导数或最坏输入位置误差;这些目标可以偏好另一种尺度。

例子与边界

三个点,三个候选,从失败到选择 ​

训练输入为 (0,1,2),响应为 (0,1,0)。用矩形核 K(u)=1|u|≤1,候选带宽为 0.4,1.1,2.1。

h=0.4 时全样本预测完全复制响应,训练MSE为0;但每次删点后其位置都没有邻居,所以CV不可用。

h=1.1 时全样本权重矩阵与预测为

S=(1/21/201/31/31/301/21/2),SY=(1/2,1/3,1/2)⊤.

留一时两端各只能使用中点,预测1;中点使用两端,预测0。因此留一预测是 (1,0,1),三个平方误差均为1,CV(1.1)=1。

h=2.1 时全样本各点都预测 1/3。删去端点后另外两点响应均值为 1/2;删去中点后为0。因此留一预测为 (1/2,0,1/2),平方误差为 (1/4,1,1/4),CV(2.1)=1/2。按协议选择 h=2.1,最终重拟合预测这三个位置均为 1/3。

这个结果是这份数据和候选集合上的选择,不能推出总体最优带宽正好为2.1。特别是原先无效的0.4不能因为训练误差最小而被自动选中。

k近邻不能照抄同一个留一分母 ​

输入 (0,1,3)、响应 (0,10,30),取 k=2。在训练位置0,全样本预测5,自身权重 S11=1/2。若套 (Y1−m^(X1))/(1−S11),会得到残差 −10,即留一预测10。

真正删除第一个点后,仍须找两个邻居,因此使用1与3,预测20,残差 −20。错误公式只把原先剩下的一个邻居重新归一化,没有补入下一个邻居。k近邻虽是固定设计下的线性平滑器,却不因此满足NW的删点归一化性质。

调参所见资料不能兼任最终独立评价 ​

若从很多 h 中挑最小CV值,再把这个最小值当作无偏的最终测试成绩,选择已倾向于保留偶然低估的候选。需要报告整个选择流程的泛化表现时,应留独立测试资料,或用嵌套验证在外层只评价内层选出的流程。若同一实体有多行或数据有时间顺序,切分单位也应与部署任务匹配。

推论与应用

NW留一快捷式及其确切适用条件 ​

固定 h 与输入表示,令 aij=K((Xj−Xi)/h)、Ai=∑jaij,全样本预测权重 Sij=aij/Ai。在 Ai>0 且 Ai−aii>0 时,删除第 i 条后其他未归一化核值不变,所以

m^−i,h(Xi)=∑j≠iaijYjAi−aii=m^h(Xi)−SiiYi1−Sii.

相减得

(2)Yi−m^−i,h(Xi)=Yi−m^h(Xi)1−Sii.

三点例 h=1.1 的全样本残差为 (−1/2,2/3,−1/2),分母为 (1/2,2/3,1/2),得到 (−1,1,−1),与直接重拟合一致。h=0.4 时 Sii=1,分母为零正是在报告邻域消失,不能把数值加一个小常数后仍称为同一个CV。

局部多项式的删点公式需要相应的加权最小二乘删除恒等式及删点后满秩;若每折改带宽、重选变量或更改输入尺度,就应重拟合完整流程。核岭回归有自己的留一公式,尤其要固定未归一化惩罚系数,不能只因符号同叫 S 就互换协议。

选择准则究竟估计哪个风险 ​

对预先固定的 h,假设全部预测有有限二阶矩,且同一学习规则对样本置换对称。IID抽样使每个留一项都相当于:用 n−1 个独立观测训练,再在一个独立新观测测试。由期望线性,

(3)ECV(h)=E[(Ynew−m^n−1,h(Xnew))2].

式(3)不需要各留一损失独立;它们通常共享训练资料而相关。它对应训练量 n−1 的固定候选,也没有对 minhCV(h) 作无偏承诺。本页“无效候选返回失败”的协议在出现失败时不产生有限CV,因此式(3)只在所论规则总能预测,或已有明确可积后备规则时使用。

给定训练结果,对未来独立 (X,Y) 使用条件均值正交分解,得到

E[(Y−m^(X))2∣train]=EVar(Y∣X)+E[(m(X)−m^(X))2∣train].

不可约噪声项不依赖带宽,解释了平方预测损失选择的目标。若验证人群与部署人群不同,式(3)仍只针对原IID总体,不能自动替代目标风险。

计算、停止与推断带宽 ​

H=|H| 个固定候选的直接核成对计算需 O(Hn2) 核求值(一维);多维距离再带 d 因子。可逐行累计以减少存储,或缓存距离但付出 O(n2) 空间。式(2)避免为每个留一问题重复扫描全部训练查询,但没有把所有成对核值变成线性数量。

网格扫描结束后按规定准则返回最小者;报告候选网格、不可用候选、平局规则、最小点是否位于网格端点。继续看图扩展网格可以改善预测搜索,却构成额外选择步骤,外层评价应覆盖它。

稳定局部线性设计中,点估计风险可能为 Ah4+B/(nh)。最小化给 h≍n−1/5;此时偏差 h2 与标准误 (nh)−1/2 同阶。区间覆盖要求继续处理这个偏差;CV选得准确也不能自动使偏差相对标准误趋零。

自测与答案 ​

  1. 三点例的CV损失有三项,能否把其样本标准差除以 3 当作普遍有效的CV标准误?不能;三项使用重叠训练资料,独立性未成立。
  2. 核整体乘以7,式(2)及选出的带宽会改变吗?固定候选和精确算术下不变,因为归一化权重全部不变。
参考资料
  • Ryan Tibshirani, Nonparametric Regression, Spring 2017,§5.2,PDF pp. 22–23,式(23)–(24):留一公式所需的删点归一化性质,并指出需另查k近邻。
  • Yen-Chi Chen, Lecture 3: Regression: Nonparametric Approaches, 2019,§3.3.2 “Cross-Validation”,PDF pp. 5–6:预测风险与带宽选择。本页式(3)及所有有限数据例直接按删点协议推导。
关系图谱11 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组