形式陈述
同时估计五个均值,为什么不必逐个照抄读数
一个仪器同时给出五个带噪读数,每个读数都无偏。若评价标准是五个误差平方的总和,原样输出这五个数是否已经无法改进?答案有些意外:即使对五个真实均值没有“彼此接近”的限制,也能交出一条规则,在每一个固定均值向量处都有更小的期望总误差。
设
已 知 X ∼ N d ( θ , σ 2 I d ) , θ ∈ R d , σ 2 > 0 已知 . 这里使用多元正态模型 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,目标是整个向量。风险 理路 估计量、决策规则与风险 Estimator and decision rule · Statistical risk 从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。 明确取
(1) R ( θ , δ ) = E θ ‖ δ ( X ) − θ ‖ 2 . 原样输出δ 0 ( X ) = X 的风险恒为d σ 2 。对固定常数c > 0 ,定义
(2) δ c ( x ) = ( 1 − c ‖ x ‖ 2 ) x ( x ≠ 0 ) , δ c ( 0 ) = 0. c 与σ 2 有相同的平方单位。原点处如何定义不影响风险,因为非退化正态分布恰落在原点的概率为零。
若d ≥ 3 ,则对每个θ 都有
(3) R ( θ , δ c ) = d σ 2 + { c 2 − 2 c σ 2 ( d − 2 ) } E θ 1 ‖ X ‖ 2 . 因此0 < c < 2 ( d − 2 ) σ 2 时,δ c 在每个θ 处严格优于δ 0 。这族规则中使式(3)最小的固定常数是c = ( d − 2 ) σ 2 ,得到James–Stein估计量
δ J S ( x ) = ( 1 − ( d − 2 ) σ 2 ‖ x ‖ 2 ) x , (4) R ( θ , δ J S ) = d σ 2 − ( d − 2 ) 2 σ 4 E θ 1 ‖ X ‖ 2 < d σ 2 . 这里的严格改进是总平方风险,不是每次样本都更准确,也不是每个坐标的风险分别下降。
直觉
收缩强度也要随数据变化
固定收缩δ b ( x ) = b x 的风险容易算:
(5) R ( θ , δ b ) = b 2 d σ 2 + ( 1 − b ) 2 ‖ θ ‖ 2 . b ≠ 1 时,真实向量足够远离零,第二项就会无界增长。式(2)改用与‖ X ‖ − 2 成比例的调整:读数整体很大时几乎保留原值,读数靠近原点时才作较大改变。这样的适应并不自动正确,真正保证来自下一段风险恒等式。
“借用其他坐标的信息”也不要求假设各个θ i 相同。这里固定一个任意的θ 再重复抽样;不同坐标只共同决定整条可实施规则的收缩系数。是否值得这样做,由事先选择的总平方损失来评价。
正态分部积分把未知参数消掉
先对足够光滑、增长受控的向量函数g 证明
(6) E θ [ ( X i − θ i ) g i ( X ) ] = σ 2 E θ [ ∂ i g i ( X ) ] . 固定其他坐标,对第i 个正态密度作分部积分 理路 绝对连续函数 Absolutely continuous function · Absolute continuity on an interval 把有限组总长度很小的区间送到总振幅很小的函数类,并满足 Lebesgue 版微积分基本定理。 ;密度导数是− ( x i − θ i ) p / σ 2 ,尾部边界项为零。对
δ ( X ) − θ = ( X − θ ) + g ( X ) 展开平方并求和,得到
(7) R ( θ , δ ) = d σ 2 + E θ { ‖ g ( X ) ‖ 2 + 2 σ 2 div g ( X ) } . 现在取g ( x ) = − c x / ‖ x ‖ 2 。离开原点时直接求导:
(8) ‖ g ( x ) ‖ 2 = c 2 ‖ x ‖ 2 , div g ( x ) = − c ( d − 2 ) ‖ x ‖ 2 . 将它们代入式(7),形式上已经得到式(3)。但g 在原点有奇性,不能就此结束证明。
为什么三维开始才可以处理这个奇性
非退化正态密度在原点附近有界。在d 维小球中,‖ x ‖ − 2 的可积性归结为
∫ 0 1 r d − 1 r − 2 d r = ∫ 0 1 r d − 3 d r < ∞ ⟺ d > 2. 球外‖ x ‖ − 2 ≤ 1 ,所以d > 2 时式(3)中的期望有限且严格为正。
为把形式推导变成证明,令g ε ( x ) = − c x / ( ‖ x ‖ 2 + ε ) 。每个ε > 0 都可合法应用式(7),且
div g ε = − c { d ‖ x ‖ 2 + ε − 2 ‖ x ‖ 2 ( ‖ x ‖ 2 + ε ) 2 } . 平方项由c 2 / ‖ x ‖ 2 控制,散度绝对值由c ( d + 2 ) / ‖ x ‖ 2 控制,均可积。g ε → g 还在平方均值下收敛,故相应误差平方的期望收敛。分别用控制收敛定理 理路 控制收敛定理 Dominated convergence theorem 几乎处处收敛且被同一可积函数控制时,可以交换极限与积分。 便把合法的ε 公式送到式(3)。这一步正是维数条件的实际责任。
例子与边界
原点风险恰好只有两个噪声方差
若θ = 0 ,S = ‖ X ‖ 2 / σ 2 服从d 自由度的卡方分布 理路 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 。把密度中的幂次降低一阶并用Gamma递推,可得
E ( S − 1 ) = 1 d − 2 ( d > 2 ) . 因此
(9) R ( 0 , δ J S ) = 2 σ 2 , 与d 无关。比如d = 5 , σ 2 = 1 时,原规则风险为5,而JS风险为2。
若实际观察x = ( 3 , 0 , 0 ) 、d = 3 , σ 2 = 1 ,收缩系数为8 / 9 ,输出( 8 / 3 , 0 , 0 ) 。这是一次输出,不是式(9)的风险;式(9)还要在真实θ = 0 的重复实验下平均所有可能读数。
图片加载失败 固定收缩与径向收缩的风险量词 小读数会被翻转,不能暗中换规则
当‖ x ‖ 2 < ( d − 2 ) σ 2 时,JS系数为负。例如d = 3 , σ 2 = 1 , x = ( 1 / 2 , 0 , 0 ) 给出( − 3 / 2 , 0 , 0 ) 。总风险定理仍成立;它没有要求每次输出都落在零与读数之间。
实践中常把系数截为非负,得到正部版本。这是另一条规则,本页不以式(3)直接计算它的风险,也不把两者输出混用。原点的单点定义可以任意,整个小球上的截断却会实质改变估计量。
d = 1 , 2 时也不能照搬奇性公式。对任意固定c > 0 ,原点附近‖ δ c ( x ) − θ ‖ 至少以常数倍‖ x ‖ − 1 增长,而正态密度有正下界,因此风险为无穷。某个散度项在二维形式上变成零,不能抵消一个根本不可积的平方项。
中心、方差和损失必须事先声明
将零换成事先固定的a ,对X − a 应用同一定理,再加回a 即可。若中心由同一份数据随意挑选,则导数和风险都会变,不能继续引用旧常数。
已知一般正定协方差Σ 时,可先白化,应用球形公式,再变回原坐标。这样直接得到的是损失( δ − θ ) T Σ − 1 ( δ − θ ) 下的结论;它不是未经证明的普通欧氏损失支配。
本页也没有把未知σ 2 替换成样本方差。独立方差估计及其自由度会改变正确系数,需要另行推导。
推论与应用
风险曲线怎样复算
令λ = ‖ θ ‖ 2 / σ 2 。由非中心卡方的Poisson混合表示 理路 非中心χ²、t与F分布 Noncentral distributions · Noncentral chi-square distribution · Noncentral t distribution · Noncentral F distribution · 非中心卡方分布 · 非中心t分布 · 非中心F分布 先移动正态均值再平方或除以独立随机尺度,统一得到非中心χ²、t和F,并用Poisson混合与条件积分计算备择下的功效。 ,S = ‖ X ‖ 2 / σ 2 在给定K ∼ Poisson ( λ / 2 ) 后是自由度d + 2 K 的中心卡方。因此
(10) E θ σ 2 ‖ X ‖ 2 = e − λ / 2 ∑ k = 0 ∞ ( λ / 2 ) k k ! ( d + 2 k − 2 ) . 所有项非负。截到k = K 0 后,余项不超过未计入的Poisson概率除以d + 2 K 0 ,所以可以给出上下括界,再代入式(4),而不必用随机模拟把一条平滑线当成精确风险。图中的曲线使用这份公式;公开程序还以有理指数函数括界认证有限输入的数值误差。
点点严格改进仍能保持相同minimax值
本模型的精确极小极大风险 理路 极小极大风险 Minimax risk 在模型族最坏参数上评价算法风险,再在所有允许算法中寻找最优值。 是d σ 2 。上界由δ 0 = X 给出。下界可以用一族正常的先验,而不求一个形式上的平坦先验。
令Θ ∼ N d ( 0 , τ 2 I d ) 。平方损失的Bayes规则 理路 Bayes 估计量与后验风险 Bayes estimator · Posterior expected loss 给定观测后最小化后验期望损失的行动规则及其条件风险。 是后验均值,后验每个坐标方差为σ 2 τ 2 / ( σ 2 + τ 2 ) 。所以任何规则δ 都满足
sup θ R ( θ , δ ) ≥ ∫ R ( θ , δ ) d Π τ ( θ ) ≥ d σ 2 τ 2 σ 2 + τ 2 . 让τ → ∞ ,下界变成d σ 2 。JS在每个有限θ 处风险更低,却仍有同样的最坏风险下确界,因此也是minimax。一个函数处处小于常数,并不意味着它的上确界严格小于这个常数。
只收缩一个预定子空间
设P 是事先固定的正交投影,秩为r ,Q = I − P ,剩余维数m = d − r ≥ 3 。保留P X ,只收缩Q X :
(11) δ P ( X ) = P X + ( 1 − ( m − 2 ) σ 2 ‖ Q X ‖ 2 ) Q X . 在两个正交子空间内选正交基,P X 与Q X 是独立的球形正态块,平方损失也按两块相加。因此
R ( θ , δ P ) = d σ 2 − ( m − 2 ) 2 σ 4 E θ 1 ‖ Q X ‖ 2 . 若P 投影到常数向量方向,就是保留样本坐标平均、收缩坐标间偏离。此时m = d − 1 ,需要d ≥ 4 ,正确系数是( d − 3 ) σ 2 。从零中心换成数据里的坐标平均后,还沿用d − 2 就漏掉了一维。
这也给一个可迁移检查:四维、方差一、观察( 2 , 2 , 0 , 0 ) ,平均为1,残差为( 1 , 1 , − 1 , − 1 ) ,残差平方长为4,故输出( 7 / 4 , 7 / 4 , 1 / 4 , 1 / 4 ) 。当真实四个均值相同时,保留块风险为1、残差JS块风险为2,总风险为3,而原规则为4。
参考资料
W. James and C. Stein, “Estimation with Quadratic Loss”原文扫描 , Proceedings of the Fourth Berkeley Symposium , Vol.1,361–379,1961,§2,特别是印页363–365的式(5)–(9):支配规则、非中心卡方逆矩及原点风险。本文另以平滑正则化的分部积分证明风险恒等式,限定方差已知。