Skip to content

模型Model

有限混合模型

Finite mixture model · 有限混合分布

先抽取有限个潜在成分之一,再由该成分生成观测,并通过边缘化得到观测分布的统计模型。

形式陈述 ​

当一个总体包含几种未被直接标注的生成机制时,怎样写出观测的分布?有限混合模型引入潜在标签 Z∈{1,…,K},规定

P(Z=k)=πk,X∣Z=k∼Pθk,πk≥0,∑k=1Kπk=1.

这里的 X∣Z=k 按条件概率描述选定成分后的观测分布;若 πk=0,该成分不影响观测分布。这是一个统计模型,参数包括权重及各成分参数。若成分有共同支配测度下的密度 fθk,由全概率公式,观测密度是

fθ(x)=∑k=1Kπkfθk(x),pθ(x,Z=k)=πkfθk(x).

和式是在消去未观测标签。它不表示每个观测同时由所有成分的随机变量做加权平均。给定 fθ(x)>0,Bayes 公式给出责任度

rk(x)=Pθ(Z=k∣X=x)=πkfθk(x)∑jπjfθj(x).

权重 πk 是看见 x 之前的成分概率,责任度 rk(x) 是看见 x 之后的成分概率;两者都归一化为一,却回答不同问题。

直觉

可以把生成过程看作两次抽签:第一次决定从哪个盒子取球,第二次在选中的盒子内取值。只记录数值、擦去盒子标签后,得到的正是混合分布。推断则沿相反方向走:某个数值在哪些盒子中较常出现,又有哪些盒子原本被选中的机会较大?责任度同时考虑这两项。

成分不是数据中天然写好的“真实类别”。若两个成分高度重叠,即使参数已知,也不能由单个 x 确定标签。把最大责任度对应的成分当成硬标签是一项额外决策,会丢掉剩余不确定性。

例子与边界

混合的方差来自两层变化 ​

考虑

X∼14N(0,1)+34N(4,1).

令成分均值 μ1=0,μ2=4,则 E[X]=14⋅0+34⋅4=3。按全方差公式,

Var(X)=E[Var(X∣Z)]+Var(E[X∣Z])=1+14(0−3)2+34(4−3)2=4.

只平均两个成分的方差会得到 1,漏掉盒子之间均值不同造成的 3。若误把混合理解为独立 U∼N(0,1),V∼N(4,1) 的加权和 14U+34V,虽然均值仍为 3,方差却是 1/16+9/16=5/8,得到完全不同的分布。

在 x=2 处,两条正态密度相等,所以 r1(2)=1/4,不是 1/2。在 x=0 处,第二条密度与第一条之比为 e−8,于是

r1(0)=11+3e−8≈0.998995.

即使第一盒只占总体四分之一,它仍几乎完全解释了这个靠近零的观测。

表示与拟合的边界 ​

交换成分编号不会改变 fθ;两个成分重合时,还可能出现权重冗余。统计模型的可识别性据此区分有序参数、标签置换后的等价类与观测分布。本页的边缘化公式不承诺成分表示唯一,也不把多个拟合峰自动解释为多个科学群体。

若拟合高斯混合时允许某成分方差无限趋近零,把它的均值放在一个观测上就可能让样本似然无界。增加成分数、换初值或运行更久不会修复这个模型边界;方差约束或先验会改变允许的模型或目标,必须明示。

推论与应用

对独立样本,观测对数似然为 ∑ilog⁡∑kπkfθk(xi)。困难来自对数里的和,而完整标签已知时,目标是各成分对数密度的加权和。EM 算法利用责任度把潜标签的指示量替换为条件期望,再更新参数。

混合也可用于预测密度,而无须为每个成分命名。要从观测分布恢复成分,先查可识别条件;要做参数计算,再查似然是否有有限最优值。若标签确实缺失且缺失概率依赖数据,还须额外分析缺失机制,不能仅因为模型包含潜变量就认定可以忽略观测过程。

自测 ​

把上述权重改成各 1/2,成分均值仍为 0,4、方差仍为 1,求总体均值、方差及 r1(2)。检验答案是 2,5,1/2;方差中的 4 必须来自成分均值间的变化。

参考资料
关系图谱9 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系