Skip to content

方法Method

正交小波阈值与风险

Orthogonal wavelet thresholding · Wavelet shrinkage · 小波收缩

把固定网格正态去噪变成独立系数估计,计算软阈值风险、通用阈值与oracle比较,并显式保留尺度系数。

形式陈述 ​

小波坐标让局部变化容易描述,但看见小系数后是否应该删掉它?本页以噪声模型和平方风险回答。给定固定网格上的未知均值向量 μ∈Rn,n=2J≥2,观察

Y=μ+σZ,Z∼Nn(0,In),σ>0已知.

取不依赖响应的正交Haar矩阵 W,令 X=WY、θ=Wμ。由多元正态的线性变换,WZ∼Nn(0,In),所以

(1)Xi=θi+σZi′,Zi′相互独立且服从 N(0,1).

首坐标为尺度系数。默认保留 θ^0=X0,对其余 d=n−1个细节坐标施加预定阈值 t≥0,再以 μ^=WTθ^重构。硬阈值和软阈值分别为

(2)Ht(x)=x1{|x|>t},St(x)=sgn(x)(|x|−t)+.

两者在 |x|=t时都返回零。软阈值已经是绝对值惩罚的近端映射;这里新增的是随机观测下的风险与阈值尺度,优化公式沿用原接口。

定义平均设计点风险 R=n−1E‖μ^−μ‖22。正交性给

(3)R=1n[σ2+∑i=1dE{Tt(Xi)−θi}2],

其中 T=H或 S。首项来自未处理尺度系数。风险只评价原网格均值,不包含未来响应自身的额外噪声,也不自动评价网格之间的函数。

直觉

对几乎为零的真系数,保留观测会留下约一个噪声方差;置零可以节省这份风险。对很大的真系数,硬删会付出巨大偏差,所以要让它留下。软阈值让输出跨过阈值时保持连续,却为留下的大信号引入收缩偏差。

阈值还要看同时检查多少坐标。单个纯噪声偶尔超过两倍标准差并不奇怪;在大量坐标中,这种偶然超过会反复发生。控制整组纯噪声与最小化平方风险,是两种不同目标。

例子与边界

四点重构与一次实现的损失 ​

取 Y=(3,1,0,0),有 X=(2,2,2,0)。保留首坐标,对细节取软阈值 t=1,得到

θ^=(2,1,2−1,0),μ^=(52−12,12+12,12,12).

即约 (1.792893,1.207107,0.5,0.5)。若以真值 μ=(2,2,0,0)核对,本次平均平方损失为 1−1/2≈0.292893,原始观测的损失为 1/2。这比较一次噪声实现,不能把该数当作重复抽样风险。

同一阈值下,硬阈值保留 2和 2两个细节,因此原样返回 Y。这个例子没有证明软阈值处处更好;信号与阈值相距不同,会改变两种规则的偏差和波动。

零系数的风险可以精确积分 ​

记标准正态密度为 φ、分布函数为 Φ、Φ―=1−Φ,并写 λ=t/σ、u=θ/σ。单坐标软阈值风险为 σ2r(λ,u),其中

(4)r(λ,u)=∫R[Sλ(u+z)−u]2φ(z)dz.

真系数为零时,利用对称性和 φ′(z)=−zφ(z)分部积分,

(5)r(λ,0)=2∫λ∞(z−λ)2φ(z)dz=2[(1+λ2)Φ―(λ)−λφ(λ)].

取 λ=1,得到约 0.150680。相同零系数下,硬阈值风险为 2[λφ(λ)+Φ―(λ)]≈0.801252,不收缩的风险为1。三个数都要乘 σ2才回到原量纲。

当 |u|→∞,软阈值几乎总从观测中减去一个固定符号的 λ,所以 r(λ,u)→1+λ2;硬阈值风险则趋近1。软阈值对小系数省下的风险,对大系数有相应代价。

同时噪声阈值与通用阈值 ​

若预先希望全部 d个纯噪声细节被置零的概率至少为 1−α,可取

(6)tα=σ2log⁡(2d/α).

正态指数矩给 P(|Z|>v)≤2e−v2/2;再以并集界控制全部坐标,失败概率不超过 2de−tα2/(2σ2)=α。这解释“真细节全部为零”时的全部删除,不能保证非零信号一定留下。

常见通用阈值为 tU=σ2log⁡d(d≥2)。它并不是指定有限样本错误率 α的式(6)。用更细的正态尾界 Φ―(v)≤φ(v)/v,纯噪声至少一个超过它的概率至多为 1/πlog⁡d,随 d→∞趋零。小样本时,“通用”这个名称不能替代实际概率。

推论与应用

和知道真系数的理想选择比较 ​

假想一位知道 θi的选择者,每个细节只允许输出0或输出 Xi,且选择不依赖当前噪声。两种风险为 θi2和 σ2,故这个受限oracle的总风险为 ∑imin(θi2,σ2)。它知道未知真值,不可执行,也不是允许所有估计器时的精确最优风险。

软阈值有一条明确的比较。固定 λ,对式(4)按三个分段求导,边界处平方误差连续使边界项相消,得到

∂r(λ,u)∂u=2uP{|u+Z|≤λ}(u≥0).

所以 r(λ,u)≤r(λ,0)+u2;又由单调性和大信号极限,r(λ,u)≤1+λ2。当 λ=2log⁡d、d≥2,令 v=z−λ≥0,有 φ(v+λ)≤e−λ2/2φ(v),故式(5)的积分至多为 e−λ2/22∫0∞v2φ(v)dv=1/d。合并可得

r(λ,u)≤1d+(1+2log⁡d)min(u2,1).

求和,加回尺度系数,并恢复单位,得到

(7)R(μ^,μ)≤2σ2n+1+2log⁡dn∑i=1dmin(θi2,σ2).

式(7)是在全部均值向量上的上界:算法不知道哪些系数重要,却能以一个对数因子追随理想删留。它不是精确风险,也没有单独证明某个函数类上的完整minimax速率。d=1时式(4)仍适用,但这里的通用阈值比较只对 d≥2陈述。

更换模型时重新记账 ​

噪声协方差若为 Σ,变换后是 WΣWT,通常不再为 σ2I。过完备字典中的系数个数超过 n,也不能直接搬用方阵正交的能量式。估计标准差、由响应选择基或处理相关噪声,都需要重新核验相应步骤。

SURE阈值选择从观测估计预定软阈值的风险,也解释最小分数为何不是选择后风险的无偏报告。系数稀疏与逼近误差的联系见小波稀疏逼近。良好平方风险仍不保证整条函数覆盖,后者进入诚实置信带的适应性边界。

自测。 n=4,σ=1,预先删除全部细节,只保留尺度系数,风险为 [1+θ12+θ22+θ32]/4。常数真向量只有 1/4;含跳跃时必须加上被删真细节的能量。

自测二。 把响应、真值及噪声标准差全部乘以 b>0,希望输出也乘以 b,阈值应怎样改变?取 tnew=bt;因为 Sbt(bx)=bSt(x),重构也随之缩放,平方风险则乘 b2。

参考资料
关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系