Skip to content

定理Theorem

James–Stein收缩与联合平方风险

James–Stein estimator · James Stein shrinkage · James–Stein支配定理

在已知球形正态噪声下证明径向收缩对每个均值向量降低总平方风险,处理原点奇性,并给出精确minimax下界与子空间维数边界。

形式陈述 ​

同时估计五个均值,为什么不必逐个照抄读数 ​

一个仪器同时给出五个带噪读数,每个读数都无偏。若评价标准是五个误差平方的总和,原样输出这五个数是否已经无法改进?答案有些意外:即使对五个真实均值没有“彼此接近”的限制,也能交出一条规则,在每一个固定均值向量处都有更小的期望总误差。

设

X∼Nd(θ,σ2Id),θ∈Rd,σ2>0 已知.

这里使用多元正态模型,目标是整个向量。风险明确取

(1)R(θ,δ)=Eθ‖δ(X)−θ‖2.

原样输出δ0(X)=X的风险恒为dσ2。对固定常数c>0,定义

(2)δc(x)=(1−c‖x‖2)x(x≠0),δc(0)=0.

c与σ2有相同的平方单位。原点处如何定义不影响风险,因为非退化正态分布恰落在原点的概率为零。

若d≥3,则对每个θ都有

(3)R(θ,δc)=dσ2+{c2−2cσ2(d−2)}Eθ1‖X‖2.

因此0<c<2(d−2)σ2时,δc在每个θ处严格优于δ0。这族规则中使式(3)最小的固定常数是c=(d−2)σ2,得到James–Stein估计量

δJS(x)=(1−(d−2)σ2‖x‖2)x,(4)R(θ,δJS)=dσ2−(d−2)2σ4Eθ1‖X‖2<dσ2.

这里的严格改进是总平方风险,不是每次样本都更准确,也不是每个坐标的风险分别下降。

直觉

收缩强度也要随数据变化 ​

固定收缩δb(x)=bx的风险容易算:

(5)R(θ,δb)=b2dσ2+(1−b)2‖θ‖2.

b≠1时,真实向量足够远离零,第二项就会无界增长。式(2)改用与‖X‖−2成比例的调整:读数整体很大时几乎保留原值,读数靠近原点时才作较大改变。这样的适应并不自动正确,真正保证来自下一段风险恒等式。

“借用其他坐标的信息”也不要求假设各个θi相同。这里固定一个任意的θ再重复抽样;不同坐标只共同决定整条可实施规则的收缩系数。是否值得这样做,由事先选择的总平方损失来评价。

正态分部积分把未知参数消掉 ​

先对足够光滑、增长受控的向量函数g证明

(6)Eθ[(Xi−θi)gi(X)]=σ2Eθ[∂igi(X)].

固定其他坐标,对第i个正态密度作分部积分;密度导数是−(xi−θi)p/σ2,尾部边界项为零。对

δ(X)−θ=(X−θ)+g(X)

展开平方并求和,得到

(7)R(θ,δ)=dσ2+Eθ{‖g(X)‖2+2σ2divg(X)}.

现在取g(x)=−cx/‖x‖2。离开原点时直接求导:

(8)‖g(x)‖2=c2‖x‖2,divg(x)=−c(d−2)‖x‖2.

将它们代入式(7),形式上已经得到式(3)。但g在原点有奇性,不能就此结束证明。

为什么三维开始才可以处理这个奇性 ​

非退化正态密度在原点附近有界。在d维小球中,‖x‖−2的可积性归结为

∫01rd−1r−2dr=∫01rd−3dr<∞⟺d>2.

球外‖x‖−2≤1,所以d>2时式(3)中的期望有限且严格为正。

为把形式推导变成证明,令gε(x)=−cx/(‖x‖2+ε)。每个ε>0都可合法应用式(7),且

divgε=−c{d‖x‖2+ε−2‖x‖2(‖x‖2+ε)2}.

平方项由c2/‖x‖2控制,散度绝对值由c(d+2)/‖x‖2控制,均可积。gε→g还在平方均值下收敛,故相应误差平方的期望收敛。分别用控制收敛定理便把合法的ε公式送到式(3)。这一步正是维数条件的实际责任。

例子与边界

原点风险恰好只有两个噪声方差 ​

若θ=0,S=‖X‖2/σ2服从d自由度的卡方分布。把密度中的幂次降低一阶并用Gamma递推,可得

E(S−1)=1d−2(d>2).

因此

(9)R(0,δJS)=2σ2,

与d无关。比如d=5,σ2=1时,原规则风险为5,而JS风险为2。

若实际观察x=(3,0,0)、d=3,σ2=1,收缩系数为8/9,输出(8/3,0,0)。这是一次输出,不是式(9)的风险;式(9)还要在真实θ=0的重复实验下平均所有可能读数。

固定收缩与径向收缩的风险量词

小读数会被翻转,不能暗中换规则 ​

当‖x‖2<(d−2)σ2时,JS系数为负。例如d=3,σ2=1,x=(1/2,0,0)给出(−3/2,0,0)。总风险定理仍成立;它没有要求每次输出都落在零与读数之间。

实践中常把系数截为非负,得到正部版本。这是另一条规则,本页不以式(3)直接计算它的风险,也不把两者输出混用。原点的单点定义可以任意,整个小球上的截断却会实质改变估计量。

d=1,2时也不能照搬奇性公式。对任意固定c>0,原点附近‖δc(x)−θ‖至少以常数倍‖x‖−1增长,而正态密度有正下界,因此风险为无穷。某个散度项在二维形式上变成零,不能抵消一个根本不可积的平方项。

中心、方差和损失必须事先声明 ​

将零换成事先固定的a,对X−a应用同一定理,再加回a即可。若中心由同一份数据随意挑选,则导数和风险都会变,不能继续引用旧常数。

已知一般正定协方差Σ时,可先白化,应用球形公式,再变回原坐标。这样直接得到的是损失(δ−θ)TΣ−1(δ−θ)下的结论;它不是未经证明的普通欧氏损失支配。

本页也没有把未知σ2替换成样本方差。独立方差估计及其自由度会改变正确系数,需要另行推导。

推论与应用

风险曲线怎样复算 ​

令λ=‖θ‖2/σ2。由非中心卡方的Poisson混合表示,S=‖X‖2/σ2在给定K∼Poisson(λ/2)后是自由度d+2K的中心卡方。因此

(10)Eθσ2‖X‖2=e−λ/2∑k=0∞(λ/2)kk!(d+2k−2).

所有项非负。截到k=K0后,余项不超过未计入的Poisson概率除以d+2K0,所以可以给出上下括界,再代入式(4),而不必用随机模拟把一条平滑线当成精确风险。图中的曲线使用这份公式;公开程序还以有理指数函数括界认证有限输入的数值误差。

点点严格改进仍能保持相同minimax值 ​

本模型的精确极小极大风险是dσ2。上界由δ0=X给出。下界可以用一族正常的先验,而不求一个形式上的平坦先验。

令Θ∼Nd(0,τ2Id)。平方损失的Bayes规则是后验均值,后验每个坐标方差为σ2τ2/(σ2+τ2)。所以任何规则δ都满足

supθR(θ,δ)≥∫R(θ,δ)dΠτ(θ)≥dσ2τ2σ2+τ2.

让τ→∞,下界变成dσ2。JS在每个有限θ处风险更低,却仍有同样的最坏风险下确界,因此也是minimax。一个函数处处小于常数,并不意味着它的上确界严格小于这个常数。

只收缩一个预定子空间 ​

设P是事先固定的正交投影,秩为r,Q=I−P,剩余维数m=d−r≥3。保留PX,只收缩QX:

(11)δP(X)=PX+(1−(m−2)σ2‖QX‖2)QX.

在两个正交子空间内选正交基,PX与QX是独立的球形正态块,平方损失也按两块相加。因此

R(θ,δP)=dσ2−(m−2)2σ4Eθ1‖QX‖2.

若P投影到常数向量方向,就是保留样本坐标平均、收缩坐标间偏离。此时m=d−1,需要d≥4,正确系数是(d−3)σ2。从零中心换成数据里的坐标平均后,还沿用d−2就漏掉了一维。

这也给一个可迁移检查:四维、方差一、观察(2,2,0,0),平均为1,残差为(1,1,−1,−1),残差平方长为4,故输出(7/4,7/4,1/4,1/4)。当真实四个均值相同时,保留块风险为1、残差JS块风险为2,总风险为3,而原规则为4。

参考资料
  • W. James and C. Stein, “Estimation with Quadratic Loss”原文扫描, Proceedings of the Fourth Berkeley Symposium, Vol.1,361–379,1961,§2,特别是印页363–365的式(5)–(9):支配规则、非中心卡方逆矩及原点风险。本文另以平滑正则化的分部积分证明风险恒等式,限定方差已知。
关系图谱21 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系