从四点小波到诚实置信带
一条曲线可以在小波坐标中很稀疏,估计的均方误差也可以很小。接下来能否给出窄而可靠的置信带?这份练习将三个问题逐个算清:如何重构、怎样评价风险,以及为什么好的点估计仍不解决所有覆盖要求。
核心阅读只需Haar变换理路Haar小波与多分辨率重构Haar wavelet transform · Discrete Haar transform · Haar multiresolution analysis逐层把相邻数据变成平均与差异,给出有限Haar变换的精确逆、能量账本与区间分辨率,并区分采样值和函数系数。、阈值风险理路正交小波阈值与风险Orthogonal wavelet thresholding · Wavelet shrinkage · 小波收缩把固定网格正态去噪变成独立系数估计,计算软阈值风险、通用阈值与oracle比较,并显式保留尺度系数。、SURE选择理路SURE风险估计与阈值选择Stein unbiased risk estimate · SURE threshold selection · Stein无偏风险估计由正态分部积分推导软阈值无偏风险分数,执行有限候选与断点搜索,并计算选择偏差和硬阈值跳跃失效。与诚实带边界理路诚实置信带与适应性边界Honest adaptive confidence bands · Honesty and adaptation · 自适应置信带的不可能性在固定设计正态回归中构造可复算的诚实带,并用局部尖峰与总变差证明未知光滑性下窄带适应的障碍。。若主要关心压缩,可以单独走最后的稀疏逼近理路小波稀疏性与非线性逼近Wavelet sparsity · Best m-term wavelet approximation · Nonlinear wavelet approximation从正交系数的排序和超水平计数推导最佳m项误差,计算非二进跳点的稀疏表示,并辨明Haar衰减与函数光滑性的单向关系。选读。置信带题复用统一覆盖量词理路置信区间Confidence interval · Confidence set以重复抽样覆盖率校准参数区间,并从正态枢轴与二项等尾检验反演算出有限样本端点。与已知偏差界的区间构造理路局部平滑的置信区间Local smoothing confidence intervals · Bias-aware nonparametric confidence intervals从固定设计的加权正态误差构造偏差可控区间,精确展示MSE带宽欠覆盖,并区分单点、网格与连续曲线覆盖。;遇到陌生之处再回看,不必先读完整统计目录。
开始前的两项检查
- 两点向量 在和、差除以 后是什么?答案是 ,能量仍为10。如果得到 ,你用了算术平均而非正交归一化。
- 一次实现的平方损失等于风险吗?不等。风险先固定真值,再对所有可能噪声取期望;不知道真值时,一次损失本身通常也不可观测。
任务一:换一组数据完成整个变换
取 ,观测 。固定左减右的Haar约定,先求 ,再对三个细节使用软阈值1,保留尺度系数。写出恢复向量,并以验证用真值 计算本次平均平方损失。最后说明这里哪些量是实际算法可以使用的。
计算。 第一层平均为 ,细节为 ;第二层产生尺度4与粗细节2。故
由粗到细逆变换得到
真系数为 ,所以无需在原坐标重新展开四个平方,也能核对
算法只需要 、基和预定阈值;用于练习检查,不能用于真实调参。硬阈值1在这份观测中保留全部非零细节,恢复原始 ;这仅是一份数据上的比较。
任务二:把一次损失换成重复抽样风险
沿用任务一的真值,但现在令 反复生成,软阈值仍固定为1。求平均风险,并解释它为什么不等于任务一的数。
答案。 真系数是 。尺度系数不收缩,贡献方差1。令 为标准化单坐标软阈值风险,则
这里 。若要直接复算非零均值一项,令 、、。在 的截断区间中,
将它代入 ,即可得到上面的数。这个恒等式也来自预定软阈值的SURE;它不能把事后选出的阈值当作常数。
迁移检查。 若四个原坐标都有方差1,但相邻噪声相关,能否仍说变换后的四个系数独立标准正态?不能。应计算 。若恰好已知变换后各边际方差相同,预定坐标软阈值的总风险与SURE仍可逐边际求和;这不需要独立性。一般向量估计器或选择后程序则需新的分析。
任务三:执行选择,再识别选择偏差
某层四个系数为 ,已知标准差为1。比较预定候选 和全部非负阈值搜索。
答案。 有限候选SURE依次为 ,选1;全范围只需查断点 ,分数为 ,选0.6。后者恢复的本层系数为 。断点处采用 的置零计数,重复绝对值一起加入;并列分数取较小阈值。
现在考虑单个 ,仅在“输出0”与“输出 ”中按SURE选择。请判断最小分数能否作为整条程序的无偏风险报告。
反例。 两个分数为 与1,故选出的估计是 。最小分数的期望约为 ,真正风险约为 。分别对固定候选无偏,并不阻止最小值追随向下波动。独立重复观测 可评价所选输出,因为条件于训练资料, 对该输出的平方误差无偏;重复使用原来的 不具备这一条件。
另一个失败发生在硬阈值:它在阈值处有跳跃,直接把分段导数塞入普通SURE会漏边界项。在 时,漏项大小为 。这和选择偏差是两个不同机制。
任务四:亲手证明置信带不能任意收窄
在 中,目标是覆盖全部连续位置 。函数类限制 且 。设随机带对整个类至少有95%的同时覆盖。取 ,比较
证明在零函数下,带的最大宽度至少为0.05的概率有一个大于0.8的下界。必须依次检查函数类、观测距离和事件比较,不能只画一个峰。
第一步:两函数确实允许。 写 、,则 。由于 ,其Hölder半范数至多0.2,高度为0.05,均不超过1。
第二步:观测分布仍很接近。 支撑中心是第128点,左右各有15个非零值。自然对数下
因此 。
第三步:同一带要容纳两函数。 记 为整条带覆盖 的事件。诚实性给 。换到 后,,所以
在该交集上, 的同一区间必须同时容纳0和0.05,故所求下界成立。期望最大宽度也至少约为 。这些是程序必须满足的下界,并非某个具体带的精确宽度分布。
把证明迁移到一般样本量。 取 、峰高 ,支撑采样数至多 ,得到 。只要 、、 且 ,零函数下的期望宽度必须至少为常数乘 。对任意 ,更光滑目标率 与这个下界的比趋于零,因此同一程序不能在整个粗糙类上诚实、又在整个光滑类上达到那个宽度。
边界检查。 若只承诺覆盖设计点且 为奇数,不能直接使用中心峰高,必须换成实际采样到的最大高度。若只有逐个固定函数的渐近覆盖,也不能用于随 变化的峰。两个修改分别改变覆盖对象和统一量词。
选读:预算跟随局部变化
对 ,求保留尺度系数和三个最大Haar细节后的平方误差,再比较完整 表示。
答案。 尺度系数为 ,每层唯一非零细节幅度为 ,所以最佳三个细节的尾平方和为 。完整 具有1024个基方向,但本例只用一个尺度和十个非零细节;其误差为 。若已知这些位置,无噪声表示可以省去大量零系数,仍需存位置索引。
若改用含噪观测来挑十个位置,就不能直接说风险等于 加同一逼近尾部:选择会偏爱被噪声抬高的系数。统计阈值分析正是补上这份未知支持的责任。另把跳点改到 ,一个粗细节就精确重构,却依然不连续;Haar稀疏不能单独证明Hölder光滑。
可下载复算与使用范围
下载Python标准库复算程序。保存后运行 python wavelet-inference-reader.py --self-test,可得到变换与逆、两种SURE搜索、精确正态尾公式、选择偏差、局部峰KL和已知光滑界分箱带的半宽。它不需要第三方包,也不读取或写出个人资料。
程序拒绝空向量、非二幂长度、非有限数、负阈值、非正噪声尺度及不满足所述诚实带常数条件的输入。浮点结果的复算容差为 ;它面向本页有限课堂数据,不承诺极端尾部的任意精度。所有检验使用显式异常,Python优化模式不会删除检查。数值复算检验算术一致性,完整覆盖证明仍在上述三个步骤中。