形式陈述
只知道观测密度,能否恢复去噪后的均值
观察Y 时,我们想估计噪声出现以前的Θ 。假如已经知道大量同类观测形成的边缘密度m ( y ) ,是否仍必须显式求出整份先验,才能计算后验均值?在已知正态噪声下,答案是否定的:边缘密度的斜率已经包含所需信息。
固定σ 2 > 0 ,设先验 理路 Bayesian 统计模型 Bayesian statistical model 以参数先验和条件抽样模型共同定义参数与数据的联合分布,并由观测条件化得到后验。 G 是R 上的任意概率分布,并规定
(1) Θ ∼ G , Y ∣ Θ = θ ∼ N ( θ , σ 2 ) . 记正态密度 理路 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 为
φ σ ( y − θ ) = 1 2 π σ exp { − ( y − θ ) 2 2 σ 2 } , m ( y ) = ∫ φ σ ( y − θ ) d G ( θ ) . m ( y ) > 0 且光滑。令s ( y ) = ( log m ) ′ ( y ) ,则对每个实数y ,
(2) E ( Θ ∣ Y = y ) = y + σ 2 s ( y ) , (3) Var ( Θ ∣ Y = y ) = σ 2 + σ 4 s ′ ( y ) . 式(2)称为Tweedie公式。这里的s 对观测位置y 求导;它不是在把某个未知参数求导时得到的似然得分。
无需预先假定G 具有一阶或二阶矩。即使先验尾部很重,固定y 后正态似然仍会压住任意多项式增长,使这里的后验矩有限。G 可以离散、连续,或两者混合,但须是正常归一化的概率分布。
直觉
后验均值为什么沿着密度上升方向调整
正态密度满足
∂ ∂ y φ σ ( y − θ ) = θ − y σ 2 φ σ ( y − θ ) . 积分后除以m ( y ) ,正好把先验权重变成后验权重:
m ′ ( y ) m ( y ) = E ( Θ ∣ y ) − y σ 2 . 所以在m 上升的地方,观察y 更可能是某个较大信号向下波动的结果,修正向右;在m 下降的地方,修正向左。这个方向解释来自完整模型,不能仅凭一张样本直方图就宣称已经完成去噪。
对二阶导数,
m ″ ( y ) m ( y ) = E [ ( Θ − y ) 2 ∣ y ] σ 4 − 1 σ 2 . 再用( log m ) ″ = m ″ / m − ( m ′ / m ) 2 ,恰好扣掉后验偏移的平方,得到式(3)。均值需要斜率,方差还需要曲率。
换微分与积分需要什么
对任意固定的有限y 区间,正态密度的任意阶y 导数都是一个关于y − θ 的多项式乘同一正态密度。这类函数在θ ∈ R 及该y 区间上有有限的统一上界。
因为G 总质量为一,这个常数就是可积控制函数。用控制收敛 理路 控制收敛定理 Dominated convergence theorem 几乎处处收敛且被同一可积函数控制时,可以交换极限与积分。 逐次交换微分与积分,便得到所用的m ′ 和m ″ 。同样,θ k φ σ ( y − θ ) 在θ 上有界,所以每个固定y 的后验绝对矩都有限。这样的论证不需要把“先验矩有限”偷偷加回假设。
后验均值必然单调
令δ G ( y ) = E ( Θ ∣ y ) ,对式(2)求导,再用式(3):
(4) δ G ′ ( y ) = 1 + σ 2 ( log m ) ″ ( y ) = Var ( Θ ∣ y ) σ 2 ≥ 0. 较大的读数不会使这个固定模型的后验均值变小。这还给边缘密度一个必要限制:
(5) ( log m ) ″ ( y ) ≥ − 1 σ 2 . 不是任何光滑正密度都能写成方差σ 2 的正态位置混合。式(5)是必要条件,本页没有声称它本身足以构造一个先验G 。
例子与边界
正态先验恢复熟悉的线性收缩
若G = N ( μ 0 , τ 2 ) 、τ 2 > 0 ,则m = N ( μ 0 , τ 2 + σ 2 ) ,所以
s ( y ) = − y − μ 0 τ 2 + σ 2 . 代入得到
δ G ( y ) = τ 2 τ 2 + σ 2 y + σ 2 τ 2 + σ 2 μ 0 , V G ( y ) = σ 2 τ 2 τ 2 + σ 2 . 这与直接配平方得到的后验一致。平方损失下,后验均值是Bayes行动 理路 Bayes 估计量与后验风险 Bayes estimator · Posterior expected loss 给定观测后最小化后验期望损失的行动规则及其条件风险。 ;这里并没有因此证明它对每个固定θ 都支配原始读数。
若G 退化在μ 0 ,则m = N ( μ 0 , σ 2 ) ,式(2)恒给μ 0 、式(3)恒给零。这也是允许的正常先验,不能因后验方差为零就宣布公式失效。
两个信号群体之间,可以向外拉而不是向零缩
取G = 1 2 δ − a + 1 2 δ a ,a > 0 。两种信号的后验赔率为
P ( Θ = a ∣ y ) P ( Θ = − a ∣ y ) = exp ( 2 a y / σ 2 ) . 因此
(6) δ G ( y ) = a tanh ( a y / σ 2 ) , V G ( y ) = a 2 sech 2 ( a y / σ 2 ) . 若a = 2 σ ,在y = 0 处后验仍各占一半,方差为4 σ 2 ,大于噪声方差;后验均值在零附近的斜率为4。一个小的正读数可能被向正的信号群拉远,不能把Tweedie公式理解为“总是向零缩”。
后验方差大并不与观察有信息矛盾。某个特定数据处 的条件方差可以很大;若先验二阶矩有限,全方差公式 理路 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 只保证平均的后验方差不超过先验方差,量词不同。
图片加载失败 单调后验均值不等于处处向零收缩 任意密度估计不能直接冒充合法边缘密度
假定真实噪声方差为1,却把一个过窄的密度估计m ^ = N ( 0 , 1 / 4 ) 代入。其得分为− 4 y ,公式会给
δ ^ ( y ) = − 3 y , V ^ ( y ) = − 3. 负方差暴露的是代入密度不可能来自声明的噪声模型,不是后验可以有负方差。把V ^ 截为零只能改变一个数,不能把整份错误边缘密度变成合法正态混合。
边缘密度值估计准确,也不自动保证斜率比m ^ ′ / m ^ 准确,尤其在m 很小的尾部;曲率估计还更敏感。密度拟合、导数误差与后验解释应分别核验。
推论与应用
固定拟合后的先验,与再拟合整条流程的导数
正态混合的非参数似然估计 理路 正态混合的非参数似然与最优性证书 Gaussian location mixture NPMLE · Kiefer–Wolfowitz mixture likelihood · 非参数经验Bayes混合似然 在已知正态方差下对整份混合分布最大化似然,证明有限支持解存在,并用方向导数核全局最优性与网格算法的真实范围。 会从许多观测估计一个G ^ 。把这份拟合结果固定后,m ^ ( y ) = ∫ φ σ ( y − θ ) d G ^ ( θ ) 仍是合法混合,式(2)–(4)对这个拟合模型成立。
但若每移动一次y 就重估G ^ y ,对y ↦ δ G ^ y ( y ) 求的是另一条总导数,包含拟合变化。它不再等于冻结G ^ 时的后验方差除以σ 2 。
最小例子是一份观测y 。其不受限制的混合似然由G ^ = δ y 最大化。冻结它后,输入另一个位置z ,后验均值恒为y 、导数为零、后验方差也为零;每次随着新输入重新拟合,则输出恒为输入,整条映射是y ↦ y ,导数为一。两个导数都算对了,只是固定的对象不同。
这份样本内拟合的零方差也不表示真实信号已被精确知道。它只是所选拟合模型的条件量;若要报告频率覆盖或真实抽样风险,还需分析估计G ^ 的整套程序。
预测新的噪声读数要再加一层方差
若Y n e w ∣ Θ 仍为N ( Θ , σ 2 ) ,并与Y 在给定Θ 后独立,则
(7) E ( Y n e w ∣ Y = y ) = δ G ( y ) , Var ( Y n e w ∣ Y = y ) = V G ( y ) + σ 2 . 第一项来自信号的不确定性,第二项是新一次读数的噪声。用后验信号方差给未来观测画区间,会漏掉后一项。这里只计算均值和方差;两点先验的预测分布仍是正态混合,不能未经理由就当作单个正态分布。
自测。 令σ 2 = 1 , a = 2 , y = ( log 3 ) / 4 。后验赔率为3,所以信号± 2 的后验概率为3 / 4 , 1 / 4 ,后验均值为1、方差为3。Tweedie得分应为1 − y 、对数密度二阶导数应为2,新读数的预测方差为4。它们是同一模型的不同输出。
参考资料