Skip to content

方法Method

SURE风险估计与阈值选择

Stein unbiased risk estimate · SURE threshold selection · Stein无偏风险估计

由正态分部积分推导软阈值无偏风险分数,执行有限候选与断点搜索,并计算选择偏差和硬阈值跳跃失效。

形式陈述 ​

不知道真系数,能否只从含噪观测评价阈值?在独立正态系数模型 Xi=θi+τZi、1≤i≤d中,假定 τ>0已知,风险取总平方误差 E‖δ(X)−θ‖2。若要平均风险,整式除以 d。

先给一组足够且易检查的条件。设 δi只依赖 Xi,每个 gi(x)=δi(x)−x局部绝对连续,gi及其几乎处处导数至多多项式增长。这使正态尾部的边界项为零,相关积分有限。于是

(1)R^(X)=dτ2+∑igi(Xi)2+2τ2∑igi′(Xi),EθR^=Eθ‖δ(X)−θ‖2.

这叫Stein无偏风险估计,简称SURE。当前坐标可分版本已足够用于软阈值;一般向量估计器需要相应弱偏导和散度条件。

对事先固定 t≥0,取 δi=St(Xi)。gi中段为 −x,左侧为 t、右侧为 −t,连续且分段线性,符合条件。其导数几乎处处为 −1|x|<t,所以可用

(2)Ut(X)=dτ2+∑imin(Xi2,t2)−2τ2#{i:|Xi|≤t}.

固定 t时,正态变量恰好等于 ±t的概率为零,改变等号约定不影响无偏性。搜索随机阈值时,等号约定会影响断点分数,本页统一采用式(2)的右侧值。

给定非空的预定有限集合 T,输出使 Ut最小的 t^,并列时取较小阈值。这是一条可执行规则;但 Ut^一般不是选择后估计器风险的无偏估计。固定参数与经过最小化的随机参数要分开解释。

直觉

残差 ‖δ(X)−X‖2只比较估计与看过的观测,偏爱贴着噪声的规则。SURE计入噪声,再用输出对输入的局部敏感度修正这份偏爱。原样输出观测时,残差为零但分数为 dτ2;全部输出零时,分数变为 ‖X‖2−dτ2,扣除观测能量中平均属于噪声的一部分。

某次分数可以为负,无偏性不要求每次都像风险一样非负。把负数截为零会改变期望,可以为了展示而这样做,却不能继续声称同一个无偏恒等式。

例子与边界

四个系数选一次阈值 ​

取 d=4,τ=1,观察 X=(0.2,−0.6,1.5,3)。候选集合为 {0,0.5,1,2}。式(2)给

U0=4,U0.5=2.79,U1=2.40,U2=4.65.

例如 t=1时截断平方和为 0.04+0.36+1+1=2.40,两个坐标被置零,故分数为 4+2.40−4=2.40。在当前候选集中选出1,估计为 (0,0,0.5,2)。

若在全部 t≥0搜索,相邻绝对值断点之间,置零数固定,余下项为若干 t2之和,分数不减。到断点时向下跳 2τ2乘以相同绝对值的个数。因此只需检查0和不同的 |Xi|;超过最大绝对值以后分数恒定,并列规则取最左端。

本例断点 0,0.2,0.6,1.5,3的分数依次为 4,2.16,1.12,2.90,7.65。全范围搜索选出 0.6,输出 (0,0,0.9,2.4)。候选限制改变了算法,不能混用两种结果。排序加前缀平方和可以在 O(dlog⁡d)时间完成搜索;重复绝对值需要成组更新计数。

最小分数不再无偏的精确反例 ​

取 X∼N(0,1),候选只有输出零和输出 X,各自SURE为 U0=X2−1和 U1=1。选择最小分数,相当于 X2≤2时输出零,否则保留 X。

最小分数的期望为

Emin(X2−1,1)=−E(X2−2)+<0,

因为 E(X2−1)=0。而选择后实际风险为

E[X21|X|>2]=2[2φ(2)+Φ―(2)]>0.

前者也可写成 2[Φ―(2)−2φ(2)]。二者约为 −0.257808和 0.572407。每个候选单独的分数无偏,取最小值仍会偏爱偶然低估。变化的是整条选择程序,不是固定规则的公式。

硬阈值的跳跃不能省略 ​

硬阈值 Ht(x)=x1|x|>t在 ±t不连续,不满足式(1)。若只在分段内部求导,就会遗漏分部积分的跳跃项。

取 d=1,τ=1,θ=0,t=1。错误代入给 1+X21|X|≤1−21|X|≤1,其期望约为 −0.166631;真实硬阈值风险约为 0.801252。差额恰为 4φ(1)≈0.967883,来自两个跳点的边界项。几乎处处有导数,不能代替绝对连续条件。

推论与应用

分部积分怎样消去未知均值 ​

正态密度满足 pθ′(x)=−(x−θ)pθ(x)/τ2。用绝对连续函数的分部积分和已声明的边界条件,

E[(Xi−θi)gi(Xi)]=−τ2∫gipθ′=τ2E[gi′(Xi)].

把 δi−θi=(Xi−θi)+gi(Xi)平方展开,第一项期望为 τ2,交叉项用刚才的等式替换,对坐标求和就得到式(1)。右侧不再含未知 θ,因此能从数据计算。

软阈值虽然有折角,但连续而绝对连续,分段积分的内部端点相消。硬阈值有真正跳跃,内部端点不相消。二者都分段可导,只有前者直接符合当前证明。

相关噪声究竟影响哪一步 ​

式(1)的逐坐标证明只用了 Xi 的正态边缘,没有用不同坐标的独立性。因此若 X∼Nd(θ,Σ)、所有对角元都为已知 τ2,对预定阈值的坐标软阈值,式(2)仍对总平方风险无偏,即使非对角协方差未知。若各方差已知但不等,第 i 项应改用自己的 τi2。

需要小心的是:原数据中的同方差经过任意相关协方差的正交换基,不保证系数方差仍相等;而依赖多个输入坐标的一般估计器,积分公式会涉及协方差与交叉偏导。相关性也会影响搜索所得阈值的分布。上述固定规则恒等式没有给选择后风险追加一个无偏结论。

调参、评价与覆盖分别核验 ​

SURE可用于调参;选择后风险控制还需研究整个选择规则,或用独立重复测量评价。若确有独立 X′∼Nd(θ,τ2I),则条件于由 X选出的估计向量,‖θ^−X′‖2−dτ2对其平方误差无偏。给同一批系数换名字并不会产生这份独立性。

若小波流程在每层分别选阈值,式(2)应使用本层坐标数及方差,未处理尺度系数另加风险。若把离散系数除以 n表示函数坐标,噪声标准差也要从 σ变为 σ/n,不能只缩放数据。

风险校正不是置信带校正。即使整条选择程序有良好平方风险,也不能根据最小SURE分数直接画95%带。诚实适应性边界研究整个函数类的统一覆盖与带宽能否同时缩小,量词不同。

自测。 X=(0.1,0.1),τ=1,t=1时,SURE为 2+0.02−4=−1.98。这不是负风险,而是风险估计量的一次可能输出。

自测二。 若一层的系数全除以8、改用函数系数单位,原噪声标准差为2,SURE中的方差该是多少?新标准差为 1/4,方差为 1/16。平方风险及每个分数都应变为原来的 1/64,阈值也除以8。

参考资料
关系图谱8 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系