Skip to content

定理Theorem

Tweedie公式与正态后验矩

Tweedie's formula for normal means · Gaussian posterior score identity · Tweedie后验均值公式

从正态混合边缘密度的导数恢复后验均值和方差,证明后验均值单调,并区分固定先验公式、密度代入和重新拟合的导数。

形式陈述 ​

只知道观测密度,能否恢复去噪后的均值 ​

观察Y时,我们想估计噪声出现以前的Θ。假如已经知道大量同类观测形成的边缘密度m(y),是否仍必须显式求出整份先验,才能计算后验均值?在已知正态噪声下,答案是否定的:边缘密度的斜率已经包含所需信息。

固定σ2>0,设先验G是R上的任意概率分布,并规定

(1)Θ∼G,Y∣Θ=θ∼N(θ,σ2).

记正态密度为

φσ(y−θ)=12πσexp⁡{−(y−θ)22σ2},m(y)=∫φσ(y−θ)dG(θ).

m(y)>0且光滑。令s(y)=(log⁡m)′(y),则对每个实数y,

(2)E(Θ∣Y=y)=y+σ2s(y),(3)Var(Θ∣Y=y)=σ2+σ4s′(y).

式(2)称为Tweedie公式。这里的s对观测位置y求导;它不是在把某个未知参数求导时得到的似然得分。

无需预先假定G具有一阶或二阶矩。即使先验尾部很重,固定y后正态似然仍会压住任意多项式增长,使这里的后验矩有限。G可以离散、连续,或两者混合,但须是正常归一化的概率分布。

直觉

后验均值为什么沿着密度上升方向调整 ​

正态密度满足

∂∂yφσ(y−θ)=θ−yσ2φσ(y−θ).

积分后除以m(y),正好把先验权重变成后验权重:

m′(y)m(y)=E(Θ∣y)−yσ2.

所以在m上升的地方,观察y更可能是某个较大信号向下波动的结果,修正向右;在m下降的地方,修正向左。这个方向解释来自完整模型,不能仅凭一张样本直方图就宣称已经完成去噪。

对二阶导数,

m″(y)m(y)=E[(Θ−y)2∣y]σ4−1σ2.

再用(log⁡m)″=m″/m−(m′/m)2,恰好扣掉后验偏移的平方,得到式(3)。均值需要斜率,方差还需要曲率。

换微分与积分需要什么 ​

对任意固定的有限y区间,正态密度的任意阶y导数都是一个关于y−θ的多项式乘同一正态密度。这类函数在θ∈R及该y区间上有有限的统一上界。

因为G总质量为一,这个常数就是可积控制函数。用控制收敛逐次交换微分与积分,便得到所用的m′和m″。同样,θkφσ(y−θ)在θ上有界,所以每个固定y的后验绝对矩都有限。这样的论证不需要把“先验矩有限”偷偷加回假设。

后验均值必然单调 ​

令δG(y)=E(Θ∣y),对式(2)求导,再用式(3):

(4)δG′(y)=1+σ2(log⁡m)″(y)=Var(Θ∣y)σ2≥0.

较大的读数不会使这个固定模型的后验均值变小。这还给边缘密度一个必要限制:

(5)(log⁡m)″(y)≥−1σ2.

不是任何光滑正密度都能写成方差σ2的正态位置混合。式(5)是必要条件,本页没有声称它本身足以构造一个先验G。

例子与边界

正态先验恢复熟悉的线性收缩 ​

若G=N(μ0,τ2)、τ2>0,则m=N(μ0,τ2+σ2),所以

s(y)=−y−μ0τ2+σ2.

代入得到

δG(y)=τ2τ2+σ2y+σ2τ2+σ2μ0,VG(y)=σ2τ2τ2+σ2.

这与直接配平方得到的后验一致。平方损失下,后验均值是Bayes行动;这里并没有因此证明它对每个固定θ都支配原始读数。

若G退化在μ0,则m=N(μ0,σ2),式(2)恒给μ0、式(3)恒给零。这也是允许的正常先验,不能因后验方差为零就宣布公式失效。

两个信号群体之间,可以向外拉而不是向零缩 ​

取G=12δ−a+12δa,a>0。两种信号的后验赔率为

P(Θ=a∣y)P(Θ=−a∣y)=exp⁡(2ay/σ2).

因此

(6)δG(y)=atanh⁡(ay/σ2),VG(y)=a2sech2(ay/σ2).

若a=2σ,在y=0处后验仍各占一半,方差为4σ2,大于噪声方差;后验均值在零附近的斜率为4。一个小的正读数可能被向正的信号群拉远,不能把Tweedie公式理解为“总是向零缩”。

后验方差大并不与观察有信息矛盾。某个特定数据处的条件方差可以很大;若先验二阶矩有限,全方差公式只保证平均的后验方差不超过先验方差,量词不同。

单调后验均值不等于处处向零收缩

任意密度估计不能直接冒充合法边缘密度 ​

假定真实噪声方差为1,却把一个过窄的密度估计m^=N(0,1/4)代入。其得分为−4y,公式会给

δ^(y)=−3y,V^(y)=−3.

负方差暴露的是代入密度不可能来自声明的噪声模型,不是后验可以有负方差。把V^截为零只能改变一个数,不能把整份错误边缘密度变成合法正态混合。

边缘密度值估计准确,也不自动保证斜率比m^′/m^准确,尤其在m很小的尾部;曲率估计还更敏感。密度拟合、导数误差与后验解释应分别核验。

推论与应用

固定拟合后的先验,与再拟合整条流程的导数 ​

正态混合的非参数似然估计会从许多观测估计一个G^。把这份拟合结果固定后,m^(y)=∫φσ(y−θ)dG^(θ)仍是合法混合,式(2)–(4)对这个拟合模型成立。

但若每移动一次y就重估G^y,对y↦δG^y(y)求的是另一条总导数,包含拟合变化。它不再等于冻结G^时的后验方差除以σ2。

最小例子是一份观测y。其不受限制的混合似然由G^=δy最大化。冻结它后,输入另一个位置z,后验均值恒为y、导数为零、后验方差也为零;每次随着新输入重新拟合,则输出恒为输入,整条映射是y↦y,导数为一。两个导数都算对了,只是固定的对象不同。

这份样本内拟合的零方差也不表示真实信号已被精确知道。它只是所选拟合模型的条件量;若要报告频率覆盖或真实抽样风险,还需分析估计G^的整套程序。

预测新的噪声读数要再加一层方差 ​

若Ynew∣Θ仍为N(Θ,σ2),并与Y在给定Θ后独立,则

(7)E(Ynew∣Y=y)=δG(y),Var(Ynew∣Y=y)=VG(y)+σ2.

第一项来自信号的不确定性,第二项是新一次读数的噪声。用后验信号方差给未来观测画区间,会漏掉后一项。这里只计算均值和方差;两点先验的预测分布仍是正态混合,不能未经理由就当作单个正态分布。

自测。 令σ2=1,a=2,y=(log⁡3)/4。后验赔率为3,所以信号±2的后验概率为3/4,1/4,后验均值为1、方差为3。Tweedie得分应为1−y、对数密度二阶导数应为2,新读数的预测方差为4。它们是同一模型的不同输出。

参考资料
关系图谱13 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系