非参数预测:从邻域计算到有效覆盖
形式陈述
完成本页后,你能从一份小数据算出邻域名单、预测权重和误差;比较同一函数的内部与边界;把一维速率推到多维;判断一个声称95%的区间是否真正控制了偏差、选择与覆盖范围。
主线依次是条件均值目标理路回归学习与平方损失Regression learning · Square-loss regression · 平方损失回归以条件均值为 Bayes 预测器组织平方损失回归,并说明无界响应、噪声尾部与函数类复杂度如何共同决定风险保证。 → k近邻理路k 近邻回归k-nearest-neighbor regression · kNN regression用按距离选出的邻居响应平均估计条件均值,明确并列规则、局部偏差、噪声平均和维数代价。 → NW权重理路Nadaraya–Watson 核回归Nadaraya-Watson regression · Kernel regression · 核加权回归将邻域核值归一化为响应权重,区分随机比值、人口平滑目标、边界偏差以及密度核和正半定核。 → 局部直线理路局部多项式回归Local polynomial regression · Local linear regression · 局部线性回归在每个查询邻域解加权多项式拟合,用矩复制解释边界去偏,并核算负权重、局部秩与噪声代价。 → 带宽选择理路非参数回归的带宽选择Nonparametric regression bandwidth selection · Leave-one-out bandwidth selection按预测损失选择局部尺度,手算核回归留一残差,识别空邻域、补邻居以及选择后评价和推断的边界。 → 局部覆盖理路局部平滑的置信区间Local smoothing confidence intervals · Bias-aware nonparametric confidence intervals从固定设计的加权正态误差构造偏差可控区间,精确展示MSE带宽欠覆盖,并区分单点、网格与连续曲线覆盖。。只需要基本求和、平方误差、二阶Taylor近似与正态分位数;各页提供具体公式和推导。
固定分箱、密度边界和条件分位数是三条可选分支,分别解决快速分块预测、支持内的密度质量、异方差响应位置。它们不需要被全部串成主线前置。
直觉
邻域方法不断在两种信息之间取舍:远处的数据较多,却可能来自不同的函数高度;近处的数据更可比,却留有较大噪声。局部直线增加了一条“先扣除趋势”的规则,区间则还要为剩余趋势和随机性分别留出空间。
计算时保持四份记录:用了哪些输入、响应权重是多少、目标是什么、概率平均哪些随机性。同一个核形状在密度估计和回归里需要不同归一化,同一个标准误在估计均值与预测新响应时也保护不同对象。
例子与边界
任务一:同一数据,固定邻居数和固定带宽
五个输入为 ,观测响应取自 :
分别在查询 和 做下面三项计算。条件噪声模型另设为独立、方差均为 ;给出的响应是这一回的观测值。
- 的近邻名单、预测与邻域半径
- 矩形核 、同一带宽 的NW预测
- 用第2项相同的窗口拟合局部直线,求截距权重、预测及条件方差
答案。 在内部点,三个近邻是 ,半径 ,预测 ;在边界,三个近邻是 ,半径 ,预测 。真实目标分别为 与0,所以条件偏差分别为 和 。
固定 后,内部窗口包含全部五个输入,NW权重各为 ,预测 、偏差 、条件方差 。边界窗口只有三个输入,NW预测仍为 、方差 。固定邻居数和固定带宽没有选出相同的内部窗口。
局部直线在内部因设计对称,截距权重仍各为 ,预测 ;在边界,权重是 ,预测 、方差 。边界权重和为1,加权位移为0,因而消去一阶趋势;负权重也说明预测可以低于全部观测。边界两方法MSE之差为
因此这里局部直线只在 时有更小MSE。偏差改善有可计算的噪声代价。
迁移。 把函数改为 、保持窗口和设计,边界NW为 ,局部直线为1,后者精确复制查询真值。把边界三个输入都移成同一个非零位置,局部直线又因秩不足不能识别截距;多项式复制依赖设计满秩。
任务二:不把人口积分误当成随机比值期望
另设随机输入 ,真曲线仍为 ,框核带宽 。定义人口平滑函数为该窗口内按输入分布归一化的均值。计算查询 和0的偏差,并解释它与有限样本NW期望的关系。
答案。 内部平均 ,用 展开后奇函数项积分为零,偏差为 。边界平均 ,有
故边界偏差为 。这是一份人口加权均值的精确计算。有限样本的分子分母都随机,一般不等于 ;在固定 、IID、、 下,才由分子分母的大数律得到该人口比值作为极限。当前样本仍须检查分母是否为零。
任务三:用留一损失选择,记录失败候选
输入为 、响应 ,框核带宽候选 。任一留一邻域为空就把该候选记为不可用;有效候选中选均方留一误差最小者。
答案。 的训练误差为0,但三个留一邻域都空,不能采用。的留一预测为 ,CV为1;的留一预测为 ,CV为 ,所以选择2.1。最终用全部三点重拟合,预测为 。
边界检查。 只有核值在删点后不变、仅需重新归一化时,NW残差才能写成 。近邻删点后会补入下一位邻居。对输入 、响应 、,查询0的真正留一预测为20;只归一化旧邻居会误报10。最小CV值还经过选择,最终泛化评价应在独立外层完成。
推论与应用
任务四:从局部矩到一维率和维数代价
假设局部线性权重复制常数和一次项、总绝对值有统一上界,真函数二阶Taylor余项至多常数乘距离平方。维中非零权重点距查询不超过 ,权重平方和为 ,给定设计与已冻结调参后,噪声条件均值为零、条件独立且方差统一有界。请推导带宽与MSE上界的幂次,并说明缺少哪些条件时不能这样计算。
答案。 矩复制消去常数之外的一阶误差,绝对余项之和给 ;独立噪声加权方差为 。所以MSE上界为
平衡两项得 ,MSE为 。时为 ,时为 。只比较MSE上界的幂次部分,使之缩小十倍所需样本倍数分别约为 和 ,常数与具体样本可用性另计。
没有矩消除而只有Lipschitz条件时,偏差通常只能界为 ,平衡的是 ,得到 。局部矩阵接近奇异、邻域计数不增长、噪声方差无界或函数有尖点,都可能破坏前面的某一步。所得是上界,最优下界需要另外证明;“非参数”本身不承诺一个通用幂次。
任务五:把95%的覆盖真正算出来
将 等分成偶数 段,观察 个等距点,查询 。对称框窗口含 个点,;真曲线 ,独立噪声为 ,已知。
复算。 对 求和得 、。MSE主项是 ,最优满足 。在取整误差可忽略的大样本下,。普通95%区间覆盖因此趋于
构造。 对固定设计的局部直线,如果已知 ,令 。则 至少有95%覆盖:在正态噪声波动不超过 的事件上,误差由随机波动和至多 的偏差组成。不能未经校准就由当前数据估出。
迁移到同时覆盖。 预定20个查询点时,把上分位数改为0.99875,并在每点保留偏差保护,再用并集界得到全部20点至少95%覆盖。若已知曲线为 -Lipschitz、每个连续位置距最近网格点至多 ,把该网格区间两端再各扩 ,得到整条连续曲线的同时带。没有网格间变化界,节点之间可以出现未被保护的窄峰。
目标检查。 这保护的是均值函数 ;未来响应还含自身噪声。若需求是未来响应覆盖,转向校准后的预测集合理路分割共形预测Split conformal prediction · 分割保形预测用冻结评分规则的校准秩构造预测集合,并在预先固定群组内分别校准,以获得边际或群组覆盖保证。,并保留其边际而非任意固定输入条件覆盖的量词。
三条选读分支的验收题
- 固定分箱:箱概率 、两条训练记录、箱内响应恒为2、空箱预测0。空箱概率理路回归直方图Regression histogram · Regressogram · Partitioning regression estimate在预定输入分箱中估计条件均值,显式处理空箱,并从随机箱计数推导完整积分风险与维数代价。为 ,该箱整体风险贡献为 ;只用非空箱均值的无偏性会漏掉这一项
- 密度边界:指数密度 在零用矩形核反射。反射估计理路核密度估计的边界修正Kernel density boundary correction · Reflection kernel density estimator在已知支持上反射核质量,证明归一化、计算边界偏差,并区分半直线、有限区间与非零边界斜率。期望为 ;恢复总质量仍留下非零边界斜率造成的一阶偏差
- 条件分位:时响应 ,时响应 ,各值条件等概率。0.75分位回归线理路分位数回归与 pinball 损失Quantile regression · Pinball loss · Check loss · 分位数损失用不对称绝对损失定位条件分位数,推导总体最优性、分组与局部加权解,并区分函数类限制和预测覆盖。为 ,条件均值为 ;改变损失改变总体目标,不能把0.75分位水平当成估计曲线的置信度
验收时应交出具体权重、算式、失败状态和覆盖事件。任一结论若需要新增的光滑性、设计或独立性条件,要能指出它进入了哪一步。
参考资料