形式陈述
数据看上去很平滑,是否就能把整条曲线的置信带放心收窄?局部平滑区间 理路 局部平滑的置信区间 Local smoothing confidence intervals · Bias-aware nonparametric confidence intervals 从固定设计的加权正态误差构造偏差可控区间,精确展示MSE带宽欠覆盖,并区分单点、网格与连续曲线覆盖。 已经说明偏差和同时覆盖都要校准;本页再问:光滑程度未知时,能否同时保证对较粗糙函数有效、对较光滑函数很窄?
观察固定设计回归
独 立 已 知 Y i = f ( i / n ) + σ Z i , i = 1 , … , n , Z i 独立 N ( 0 , 1 ) , σ > 0 已知 . 程序若使用额外随机数,规定其分布与未知函数无关,且 P f 包含这份共同辅助随机性。乘上同一随机化分布不会增加总变差,因此下面的比较也覆盖这类程序。
这里的“固定设计”只描述观测位置。目标是覆盖整个连续区间 [ 0 , 1 ] 上的函数。对 0 < r ≤ 1 及 L > 0 ,定义
对 所 有 F r ( L ) = { f ∈ C [ 0 , 1 ] : ‖ f ‖ ∞ ≤ L , | f ( x ) − f ( y ) | ≤ L | x − y | r 对所有 x , y } . L 同时限制高度和Hölder半范数,但本页没有把二者的和当作球范数。将置信区间的统一覆盖要求 理路 置信区间 Confidence interval · Confidence set 以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。 用于整条函数,随机带 C n ( x ) = [ ℓ n ( x ) , u n ( x ) ] 满足 ℓ n ≤ u n ,并假定下面的同时事件与宽度都可测。记
W n = sup x ∈ [ 0 , 1 ] [ u n ( x ) − ℓ n ( x ) ] . 若 对 所 有 inf f ∈ F P f { f ( x ) ∈ C n ( x ) 对所有 x } ≥ 1 − α ,称它在类 F 上有限样本诚实。统一渐近版本是 lim inf n inf f ∈ F P f { f ∈ C n } ≥ 1 − α 。诚实指覆盖承诺统一适用于声明的类,不是描述估计者的品格。
本页证明以下有限样本障碍。设 0 < α < 1 / 2 ,选常数 c > 0 满足
c σ ≤ L , κ = 1 − 2 α − 3 2 c > 0. 令 h = n − 1 / ( 2 r + 1 ) ≤ 1 / 2 。任何在 F r ( L ) 上诚实的带,都必须在零函数下满足
(1) P 0 { W n ≥ c σ n − r / ( 2 r + 1 ) } ≥ κ , E 0 W n ≥ κ c σ n − r / ( 2 r + 1 ) . 这是一个不带对数因子的下界,已经足以排除更光滑类的快收窄要求;它不是声称给出了尖锐的最优带宽常数或分离半径。
直觉
一条低矮且很窄的峰可以对观测只造成少量总变化。它在某一点的高度却仍超过一条极窄置信带的容纳范围。若数据分布很难区分“完全平坦”和“藏着这条峰”,任何诚实带就不能在平坦函数下总是很窄。
这里的障碍不取决于先用核、小波还是样条估计。它对所有可测的带构造同时成立,包括复杂的调参和随机化。换一个更准确的点估计器,不能自动消除观测本身分不清两种函数的困难。
图片加载失败
例子与边界
两条函数怎样迫使带变宽
先给一个适用于任意两条候选函数的步骤。设 f 0 , f 1 的观测分布为 P 0 , P 1 ,d = ‖ f 1 − f 0 ‖ ∞ 。若带在两条函数下的同时覆盖概率都至少为 1 − α ,则由两点法的总变差比较 理路 两点检验下界 Le Cam's two-point method · two-point lower bound 把两个目标相隔但观测分布接近的参数点化为二元检验,从而证明估计下界。 ,事件 A 1 = { f 1 ∈ C n } 满足
P 0 ( A 1 ) ≥ P 1 ( A 1 ) − TV ( P 0 , P 1 ) ≥ 1 − α − TV ( P 0 , P 1 ) . 再与 A 0 = { f 0 ∈ C n } 交集,在 P 0 下有概率至少 1 − 2 α − TV 。同一个区间若同时包含两个函数在每一点的值,最大宽度至少为 d 。所以
(2) P 0 ( W n ≥ d ) ≥ 1 − 2 α − TV ( P 0 , P 1 ) . 这是对宽度的检验型限制。右侧若为负,只给平凡下界;需要选择分布足够接近的函数。
固定网格上的具体局部峰
令 ψ ( v ) = ( 1 − | v | ) + ,取 f 0 = 0 和
f 1 ( x ) = c σ h r ψ ( x − 1 / 2 h ) , h = n − 1 / ( 2 r + 1 ) . ψ 为1-Lipschitz、取值在 [ 0 , 1 ] ,因此 | ψ ( u ) − ψ ( v ) | ≤ min ( | u − v | , 1 ) ≤ | u − v | r 。这给 [ f 1 ] r ≤ c σ ≤ L ,且 ‖ f 1 ‖ ∞ = c σ h r ≤ L 。两函数确实都在声明的类中。
噪声是已知协方差的多元正态 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 。逐坐标展开正态对数密度比,KL散度 理路 KL 散度 Kullback–Leibler divergence · Relative entropy 同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。 在这里一律用自然对数(单位nat),因此为
D ( P 1 ‖ P 0 ) = 1 2 σ 2 ∑ i = 1 n f 1 ( i / n ) 2 . 峰的支撑长为 2 h ,其中最多有 2 n h + 1 个网格点。利用 n h 2 r + 1 = 1 及 h 2 r ≤ 1 ,
D ( P 1 ‖ P 0 ) ≤ c 2 2 ( 2 n h + 1 ) h 2 r ≤ 3 2 c 2 . Pinsker界给 TV ≤ D / 2 ≤ ( 3 / 2 ) c 。函数在 x = 1 / 2 处的距离恰为 c σ h r ,代入式(2)就得到式(1),期望界再由 E W n ≥ d P ( W n ≥ d ) 得到。
即使奇数 n 的网格没有 1 / 2 ,峰值距离仍然成立,因为带覆盖的是连续域。若目标只覆盖观测点,就必须用最大采样峰值重做距离那一步,不能原样照搬这个高度。
一组可以手算的常数
取 r = 1 / 2 , L = 1 , σ = 1 , α = 0.05 , c = 0.2 , n = 256 ,则 h = 1 / 16 、峰高为 0.05 。共有31个严格位于支撑内部的非零采样值。按对称三角形平方求和,可得
D ( P 1 ‖ P 0 ) = 0.013359375 , D / 2 ≈ 0.0817294 . 所以式(2)至少给 P 0 ( W n ≥ 0.05 ) ≥ 0.8182706 ,期望宽度至少约 0.0409135 。使用不计算实际网格的统一上界也可得到较松的 0.7267949 概率下界;两者都是下界,不是实际覆盖概率。
推论与应用
为什么更光滑的自适应带受到阻碍
固定 r < s ≤ 1 。本页定义下 F s ( L ) ⊆ F r ( L ) ,因为 | x − y | ≤ 1 时 | x − y | s ≤ | x − y | r 。若希望同一程序在大类上诚实,同时在更光滑类上满足
(3) sup f ∈ F s ( L ) E f W n ≤ K ( log n n ) s / ( 2 s + 1 ) , 其中 K 不随 n 变化,那么零函数也必须满足该上界。但 s / ( 2 s + 1 ) > r / ( 2 r + 1 ) ,式(3)右侧与式(1)下界的比值趋零,产生矛盾。零函数已经最光滑,仍无法在较粗糙类的统一覆盖承诺下获得所要求的宽度。
统一渐近诚实也有相同障碍:对任意小 ε > 0 ,足够大的 n 对整个类的覆盖都至少为 1 − α − ε ,在式(2)中多扣 2 ε 即可。若只知道每个固定函数的点态渐近覆盖,不能把它用于随 n 改变的峰 f 1 ;这正是统一量词发挥作用的位置。
光滑界已知时,一条诚实带确实能算出来
负结果并不排除诚实带本身。设 r , L 已知、n = M q ,把 [ 0 , 1 ] 分成 M 个宽 1 / M 的箱,第 j 箱包含观测 i = ( j − 1 ) q + 1 , … , j q 。函数评价时第一箱包含0,其余按右闭端点分配。每箱响应均值记为 Y ― j 。
任一箱中目标 f ( x ) 与该箱观测真均值之差至多 L M − r ,噪声标准差为 σ / q 。因此在该箱输出
(4) C n ( x ) = Y ― j ± [ L M − r + z 1 − α / ( 2 M ) σ q ] . 对 M 个正态箱均值用并集界 理路 并集界 Union bound · Boole 不等式 多个坏事件中至少一个发生的概率,不超过各事件概率之和。 ,以至少 1 − α 的概率同时控制它们的噪声;在同一事件上,已知Hölder界控制每个箱内的全部连续位置,故式(4)在整个 F r ( L ) 上诚实。这里不需要在无穷多个位置分别累加错误率。
例如 n = 64 , M = 4 , q = 16 , r = 1 , L = σ = 1 , α = 0.05 ,半宽为 1 / 4 + z 0.99375 / 4 ≈ 0.8744 。它可能宽,但保证明确。平衡 M − r 与 M log M / n 会提示 M ≍ ( n / log n ) 1 / ( 2 r + 1 ) ;这是在已知 r , L 下选择分箱尺度,不能把数据估出的 r 直接代入就继承统一覆盖。
可以改变什么要求
若预先排除与较光滑类统计上难区分的粗糙函数,或加入可检测的自相似性条件,某些模型允许自适应诚实带。排除范围与可检测尺度必须由对应定理指定,不能只从图像上判断曲线“没有坏峰”。Massé–Meiniel研究固定设计回归中的分离条件,其尖锐必要性定理另要求 r > 1 / 2 ;Hoffmann–Nickl的相关结果则在密度估计模型中。本页给出的两点证明具有自己的 0 < r ≤ 1 范围,不替代这些更精确结论。
改变损失或覆盖对象也可能改变结论。L 2 置信球容许窄而高的局部变化在积分下贡献较小,其适应性范围不能由上确界带的负结果直接判定。共形预测覆盖未来响应,通常是输入分布下的边际事件,也不是本页整条均值函数的同时覆盖。问题对象变了,需要重新说明承诺。
自测。 在较粗糙类上保持95%诚实,却只在若干典型平滑函数上展示窄带,是否证明了式(3)?没有。式(3)对整个平滑类取上确界,且零函数也受式(1)约束;有限演示既不检查统一覆盖,也不检查统一宽度。
自测二。 式(4)若把 L 改成由同一批数据估出的较小值,还能引用原证明吗?不能。原证明需要对所有允许真函数成立的确定偏差上界;一个可能低估的拟合曲率或连续模不是这个上界。可以另构造具有联合错误预算的有效上界,但需要新的保证。
参考资料