Skip to content

方法Method

局部平滑的置信区间

Local smoothing confidence intervals · Bias-aware nonparametric confidence intervals

从固定设计的加权正态误差构造偏差可控区间,精确展示MSE带宽欠覆盖,并区分单点、网格与连续曲线覆盖。

形式陈述 ​

要给回归条件均值 m(x) 一个置信区间,必须同时记住随机波动和局部平滑偏差。本页先给一项有限样本、条件明确的构造。

固定设计 X1,…,Xn 与查询 x,观察

Yi=m(Xi)+εi,εi 独立,εi∼N(0,σi2),

其中各 σi2 已知。权重 ℓi(x) 在观察这些响应以前固定,或只依赖设计与独立资料。后一情形先条件于已经冻结的独立资料及随机种子,以下概率与方差均在这层条件下计算;无条件保证最后再平均该资料。设

m^(x)=∑iℓiYi,b(x)=∑iℓim(Xi)−m(x),s(x)2=∑iℓi2σi2>0.

由独立正态变量的线性组合,

(1)m^(x)−m(x)s(x)=Z+δ(x),Z∼N(0,1),δ(x)=b(x)/s(x).

给定 0<α<1。若已知一个在声明函数类上有效的偏差界 |b(x)|≤B(x),取 zq=Φ−1(q),则

(2)C(x)=[m^(x)−B(x)−z1−α/2s(x), m^(x)+B(x)+z1−α/2s(x)]

以至少 1−α 的概率覆盖 m(x)。在事件 |Z|≤z1−α/2 上,三角不等式直接给 |m^−m|≤zs+B,这就是完整证明。若 s=0,没有随机噪声,区间取 [m^−B,m^+B] 即可。

对局部线性,若权重满足 ∑iℓi=1、∑iℓi(Xi−x)=0,并已知相关区间上 |m″|≤M,Taylor余项给可计算的

(3)B(x)=M2∑i|ℓi|(Xi−x)2.

M是对目标函数类的假设或外部有效上界。把同一份资料中估出的曲率最大值直接当作已知 M,没有自动继承式(2)的有限样本保证。

直觉

标准误测量估计量围绕其自身期望的摆动。若该期望已经离开目标,准确估出摆动宽度仍可能漏掉真值。偏差可以随着样本量趋于零,却始终和标准误一样大;区间覆盖关心的正是两者的比值。

“95%”还需要指定一次覆盖几个目标。一个固定位置、事先固定的十个位置、整条连续曲线,以及一个将来的噪声响应,分别对应不同概率事件。只有把事件写清楚,才能知道该校准哪个误差量。

例子与边界

三点边界区间:数值与曲率账本 ​

使用输入 (0,1/4,1/2),查询0,观测响应 (0,5/16,3/4)。局部线性权重为 (5/6,1/3,−1/6),预测 −1/48。假定噪声独立正态、已知标准差均为0.1,且目标类满足 |m″|≤2。

于是

s2=0.01×56=1120,B=13(14)2+16(12)2=116.

95%区间的半宽约为 1/16+1.959964/120≈0.24142,得到约 [−0.2623,0.2206]。这些数值是给定观测的输出;覆盖保证来自对所有满足曲率界的 m 重复抽取噪声。观测响应恰与 t+t2 一致并不是构造时知道真曲线。

若只用 1.96s,得到的是没有偏差保护的另一条程序。它对平滑后的目标 ∑iℓim(Xi) 在正态模型下有95%覆盖,但对 m(0) 需要另查偏差。

MSE最优带宽可以持续停在约92.1%覆盖 ​

下面所有偏差和方差都能从固定设计精确算起。把 [0,1] 等分成偶数 n 段,观察 n+1 个输入 i/n,查询 x=1/2。取窗口内 2J+1 个对称输入 x+j/n(−J≤j≤J),等权平均;h=J/n<1/2。令 m(t)=t+t2,噪声独立 N(0,σ2)、σ>0已知。

利用 ∑j=−JJj=0 与 ∑j=−JJj2=J(J+1)(2J+1)/3,精确得到

(4)bn=J(J+1)3n2,sn2=σ22J+1.

当 J→∞、J/n→0 时,MSE的主项为

h49+σ22nh.

对 h 求导,主项最优点满足 h5=9σ2/(8n)。取最接近 nh 的整数 J 后,由式(4)仍有

bnsn⟶12.

正态性使每个有限样本都满足式(1),所以普通区间 m^±z0.975sn 的覆盖率不是凭模拟猜出,而是精确为

(5)Φ(z0.975−bn/sn)−Φ(−z0.975−bn/sn)⟶Φ(z0.975−1/2)−Φ(−z0.975−1/2)≈0.9209.

偏差和标准误都趋零,但覆盖不会趋于0.95。这是同一二次曲线的内部点例子,已足够说明预测MSE最优不能替代推断校准。

估计偏差后,标准误也要改变 ​

在边界三点 (0,a,2a) 上,局部线性权重为 ℓ=(5/6,1/3,−1/6)。对二次函数,其偏差是 −a2m″/6。用二阶差分估计曲率,得到偏差估计

b^=−16(Y1−2Y2+Y3).

校正后恰有 m^−b^=Y1。它对所有二次函数在0处无偏,却把方差从 5σ2/6 改为 σ2。若仍沿用旧标准误,正态区间的实际覆盖为

2Φ(z0.9755/6)−1≈0.9264,

达不到0.95。一般线性偏差估计 b^=a⊤Y 应使用 (ℓ−a)⊤Σ(ℓ−a),其中 Σ 是响应噪声协方差;减掉偏差估计和加上其方差,并不足以忽略二者的协方差。

推论与应用

欠平滑与偏差修正各自需要什么 ​

在稳定一维局部线性设计下,若 b=O(h2)、s≍(nh)−1/2,则 b/s=O(nh5)。选择 h→0、nh→∞ 且 nh5→0,便让平滑偏差相对标准误消失,称为欠平滑。例如 h=n−1/4 满足这些幂次条件。若还要从非正态噪声得到正态近似,需另证加权中心极限定理;若方差未知,还需标准误比值一致,才能用Slutsky步骤。这些都不是“把带宽调小”一项操作的自动结果。

偏差修正尝试估计并减去主偏差,通常需要更高阶光滑性和额外带宽。修正后的剩余偏差要相对新标准误消失,标准误还需包括估偏差带来的随机性。上面的二次函数例给精确有限模型计算;一般稳健偏差修正区间的高阶覆盖误差需专门定理,本页不以该例代替。

从一个点到有限网格,再到连续曲线 ​

在看到响应以前固定 J0 个查询 x1,…,xJ0,各有有效偏差界 Bj 和已知标准误 sj。把式(2)中的临界值改为 z1−α/(2J0),由并集界,全部网格点同时覆盖的概率至少为 1−α,不要求各点预测独立。

逐点95%不能直接得到这项保证。例如两个无偏、互相独立的正态估计各用95%区间,联合覆盖为 0.952=0.9025。同一曲线的各点通常相关,但相关本身也不保证联合覆盖正好95%。

网格保证还能在额外平滑界已知时转成连续带。设网格覆盖整个查询区间,每个 x 都有预先指定的最近网格点 xj(x),距离至多 Δ;又知 m是 L-Lipschitz。若网格区间为 [Lj,Uj],输出分段带

(6)C(x)=[Lj(x)−LΔ, Uj(x)+LΔ].

在全部网格覆盖的同一个事件上,|m(x)−m(xj(x))|≤LΔ,故式(6)同时覆盖每个连续位置。这个构造没有把原平滑器在每个 x 的点态区间直接连线。

若没有任何网格间变化界,有限网格会漏掉节点之间的窄峰。例如节点 j/J0 上 m(x)=Asin2⁡(πJ0x) 全为零,网格中点却达 A;单凭节点覆盖无法控制任意大的 A。更精细连续置信带可以研究随机过程上确界,但必须显式加入相应条件。

均值区间与未来响应集合 ​

上述目标是 m(x)。即使均值已精确知道,未来 Y=m(x)+ε 仍有自身噪声。分割共形预测使用独立校准秩给未来响应的边际覆盖;其有效性不要求本页的已知曲率与Gaussian模型,却也不自动给每个固定输入的条件覆盖。选择前应先确定所需的是函数均值还是未来响应。

自测与答案 ​

  1. 式(4)取 n=20,J=2,σ=1,偏差和标准误是多少?b=2⋅3/(3⋅400)=1/200,s=1/5;样本量在这里是21而不是20。
  2. 预定20个网格点、总错误率0.05,每个双侧区间的上分位数是多少?1−0.05/(2⋅20)=0.99875。将单点0.975保持不变不能继承共同覆盖证明。

未知光滑性带来的另一层限制 ​

本页连续带使用外部已知的变化界。若希望根据数据自动把平坦曲线的带收窄,同时对更粗糙的整个函数类仍保持统一覆盖,诚实置信带的适应性边界给出额外障碍:低矮局部峰与零函数的观测分布可很接近,却仍要求带容纳二者的上确界距离。该页给有限网格正态回归的完整两函数证明,并区分连续域覆盖与只覆盖设计点。它进一步限制未知函数类下的宽度,没有撤回本页在偏差界已知时的构造。

参考资料
  • Ryan Tibshirani, Direct Inference with Linear Smoothers, Spring 2014,§3.1–3.3,PDF pp. 3–5:固定输入、加权方差与平滑中心的区别。本页使用已知方差正态模型的精确构造,不采用讲义中的通用残差方差与t近似作为精确依据。
  • Sebastian Calonico, Matias D. Cattaneo and Max H. Farrell, On the Effect of Bias Estimation on Coverage Accuracy in Nonparametric Inference, 2018,§3、§3.1,稿件 pp. 19–22(PDF pp. 21–24):偏差估计与修正后方差;该文高阶渐近覆盖结论另有光滑性和带宽条件。本页式(1)–(6)均给出所用模型下的直接推导。
关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系