Skip to content

方法Method

正态混合的非参数似然与最优性证书

Gaussian location mixture NPMLE · Kiefer–Wolfowitz mixture likelihood · 非参数经验Bayes混合似然

在已知正态方差下对整份混合分布最大化似然,证明有限支持解存在,并用方向导数核全局最优性与网格算法的真实范围。

形式陈述 ​

要估计的是一份分布,不是预先规定的几个均值 ​

观察实数y1,…,yn,n≥1,假定它们独立同分布于同一正态位置混合:

(1)mG(y)=∫φσ(y−θ)dG(θ),σ2>0 已知.

其中φσ表示均值为零、方差为σ2的正态密度。

G遍历R上的全部概率分布。它若只有有限个原子,就回到有限混合;这里不事先规定原子数、位置或权重。非参数指允许的混合分布不是一个固定维数参数族,不表示没有模型假设。

对数似然为

(2)ℓ(G)=∑i=1nlog⁡fi(G),fi(G)=∫φσ(yi−θ)dG(θ).

至少存在一份最大化分布G^,支持包含于[ymin,ymax],且至多有n个原子。所有最大化解在n个数据位置上的密度向量(f1,…,fn)相同。后一个唯一性不能只凭措辞就升级成任意混合参数表示的唯一性。

给任意候选概率分布H,定义证书函数

(3)DH(θ)=∑i=1nφσ(yi−θ)fi(H).

则H为全局最大化解,当且仅当

(4)DH(θ)≤n对每个 θ∈R.

若成立,DH(θ)=n在H几乎处处成立;对于离散候选,每个正权原子处都须达到等号。本文称式(4)为最优性证书,它检查整个允许的参数域,而不只是几个已选原子。

直觉

似然在密度向量上是凹问题 ​

令

v(θ)=(φσ(y1−θ),…,φσ(yn−θ)).

混合分布只通过f(G)=∫v(θ)dG(θ)进入样本似然。若在两份分布之间混合,其密度向量也按同样比例混合;∑ilog⁡fi是正象限上的严格凹函数。因此这是凸可行集合上的凹最大化问题。

这里并没有说“把固定个数的原子位置和权重一起当成欧氏坐标后,目标仍联合凹”。那份有限参数化会弯曲可行集合,可以给出不同的数值表现。分布层面的凸性和任意坐标下的凸性不能互换。

为什么最大值存在且只需有限个原子 ​

若θ<ymin,把它移动到ymin会缩短它到每个数据点的距离,使所有正态密度值增大;θ>ymax同理。所以将区间外质量投影回K=[ymin,ymax]不会降低似然,寻找最大解可以限制在K。

v(K)是紧集,它的凸包也是紧的。一个直接理由是Carathéodory定理:在Rn中,每个凸包点至多用n+1个点表示;系数单纯形与Kn+1都是紧的,它们的连续像给出整个凸包。

任意概率混合的积分向量属于这个凸包:以有限分割近似连续函数v,得到有限凸组合,再用凸包闭性取极限。反过来每个有限凸组合都对应一个离散混合分布。因K紧且正态密度处处正,每个坐标有正的统一下界,故∑log⁡fi连续,最大值确实达到。严格凹性保证最优密度向量f∗唯一。

把支持数从n+1改进到n,要再用一个最优性条件。设wi=1/f∗,i。在f∗向任意v(θ)移动的方向上,导数不应为正,所以w⋅v(θ)≤n。同时w⋅f∗=n。最优混合只能把质量放在等号集合:若有正质量严格小于n,积分也会严格小于n。

这个等号集合位于一个仿射维数至多n−1的超平面中。再在该面上应用Carathéodory,得到至多n个原子的表示。它证明的是“有一份这么小的解”,不要求把拟合出的每个原子解释成真实总体的一个群体。

证书为什么同时必要和充分 ​

向单点质量移动,写Ht=(1−t)H+tδθ,则

ddtℓ(Ht)|t=0+=DH(θ)−n.

所以最优解必须满足式(4)。另一方面,由对数的凹性,log⁡u≤u−1给出,对任意G,

(5)ℓ(G)−ℓ(H)≤∑i{fi(G)fi(H)−1}=∫DH(θ)dG(θ)−n.

若式(4)成立,右侧不大于零,H就是全局最优。这份证明不要求预先知道正确原子数,也不需要把一个数值迭代停止标记当成最优证据。

更一般地,若能认证supθDH(θ)≤n+ε,式(5)给出整个允许模型上的目标差ℓ(G^)−ℓ(H)≤ε。这是对数似然差,不是后验均值误差或风险差。

例子与边界

两个靠得很近的观察,单点分布就有完整证书 ​

取观察(−a,a),0≤a≤σ,候选H=δ0。除去共同常数后,式(3)为

DH(θ)=2exp⁡{−θ2/(2σ2)}cosh⁡(aθ/σ2).

利用log⁡cosh⁡t≤t2/2,便有

DH(θ)≤2exp⁡{−σ2−a22σ4θ2}≤2.

所用不等式也可直接证明:t≥0时tanh⁡t≤t,因为(tanh⁡t)′=sech2t≤1且两者在零相等;积分并用偶性即可。因此这份全实线证书是完整的,H为不受网格限制的NPMLE。

若a>σ,DH″(0)>0而DH(0)=2,附近便有DH>2。同一候选不再最优,可以加入某个新原子改善似然。这里只拒绝旧候选,没有由此猜测完整最优支持。

一个可以精确验收的三点网格 ​

现在限定原子只能取−a,0,a,观察仍为−a,a,并取σ2=1、a=2log⁡2。省去正态密度的共同因子1/2π,核矩阵为

(6)K=(11/21/161/161/21).

候选权重w=(1/2,0,1/2)给f1=f2=17/32。三列的证书值分别为

D(−a)=2,D(0)=3217<2,D(a)=2.

所以它在这个有限网格上全局最优。正权端点取等号,零权中点允许严格小于n;要求所有列都取等号反而会拒绝正确的边界解。

这份证书没有检查网格外的θ。就算额外检查一个中点θ=a/2,得到

DH(a/2)=40172−1/4<2,

也仍不够;这里的不等式可由(20/17)4<2精确核验。一个新增采样点通过,不能代表整个连续区间通过。

为了给出确切的网格外拒绝证书,考虑原子θ在a附近的方向导数。当前DH在a处等于2,但

DH′(a)=−32172a16=−4a17<0.

向a左侧移动足够小距离,会使DH>2。所以有限网格最优不等于全实线最优。这个局部导数证据不需要指定一个可能选错的有限步长。

EM单调并不等于已经通过最优性检查 ​

固定网格θ1,…,θM、Kij=φσ(yi−θj)>0。EM对权重的更新为

(7)wjnew=1n∑iwjKij∑kwkKik=wjDj(w)n.

若wj=0,以后一直为零。对式(6)从w=(0,1,0)开始,EM会原地不动;但此时端点列的Dj=17/8>2,加入端点质量可以提高似然。一个受限面上的固定点不是全单纯形的最优证书。

即使从严格正权重开始,也应检查所有列的Dj−n或可靠目标差,而不只看两轮权重相差多小。有限精度下,小变化可以来自收敛缓慢或舍入;声明的停止标准应与真正需要的误差量对应。

推论与应用

从拟合分布得到经验Bayes规则 ​

若拟合得到G^=∑jw^jδθ^j,固定这份分布后,对新的输入位置y,

(8)δ^(y)=∑jw^jθ^jφσ(y−θ^j)∑jw^jφσ(y−θ^j).

这是拟合模型的后验均值,也可由Tweedie公式从其边缘密度导数得到。先拟合共同混合分布,再为各个噪声读数计算条件均值,便是一种经验Bayes方法。

在式(6)的网格解下,观察a时两个端点后验概率为16/17和1/17,故后验均值为15a/17、方差为64a2/289。它们是网格拟合模型的精确条件输出;前面的网格外违反已经说明,不能把它们标成全实线NPMLE的结果。

数值成本与可认证范围 ​

固定网格时,一次计算全部fi、Dj及EM更新需O(nM)算术,存整个核矩阵需O(nM)空间,也可逐块重算以减少存储。对数似然应避免因极小正态密度直接下溢;共同的逐行正因子可从核矩阵中除掉,因为它只改变与权重无关的似然常数,且不改变证书比值。

有限网格的全列检查只认证这个有限模型。要认证全实线模型,须控制连续函数DH的全域上界;支持可限制在数据范围,区间外每项都向外递减,但区间内仍不能以稀疏采样代替极值论证。两个近观察的例子有解析上界,三点网格例子则有明确的连续域违反。

已知方差在这里十分重要。如果允许每个成分的方差趋于零,将一个原子均值放在数据上就可能让似然无界;本页的紧凸密度向量证明不覆盖那种模型。

最后,样本似然最优是一项拟合保证。先验是真实总体分布、后验可信区间具有频率覆盖、经验Bayes规则接近某个理想风险,都是另需条件和证明的结论。本页只交付已经证明的存在性、最优密度向量、支持上界和可核验的似然证书。

参考资料
关系图谱18 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系