“拟合两成分高斯混合,两方差固定为 $1$。数据为 $(0,1,3)$,初值 $\pi^{(0)}=1/2,\mu 1^{(0)}=0,\mu 2^{(0)}=2$。记 $r i=P(Z i=…”
形式陈述
当一个总体包含几种未被直接标注的生成机制时,怎样写出观测的分布?有限混合模型引入潜在标签
这里的
和式是在消去未观测标签。它不表示每个观测同时由所有成分的随机变量做加权平均。给定
权重
直觉
可以把生成过程看作两次抽签:第一次决定从哪个盒子取球,第二次在选中的盒子内取值。只记录数值、擦去盒子标签后,得到的正是混合分布。推断则沿相反方向走:某个数值在哪些盒子中较常出现,又有哪些盒子原本被选中的机会较大?责任度同时考虑这两项。
成分不是数据中天然写好的“真实类别”。若两个成分高度重叠,即使参数已知,也不能由单个
例子与边界
混合的方差来自两层变化
考虑
令成分均值
只平均两个成分的方差会得到
在
即使第一盒只占总体四分之一,它仍几乎完全解释了这个靠近零的观测。
表示与拟合的边界
交换成分编号不会改变
若拟合高斯混合时允许某成分方差无限趋近零,把它的均值放在一个观测上就可能让样本似然无界。增加成分数、换初值或运行更久不会修复这个模型边界;方差约束或先验会改变允许的模型或目标,必须明示。
推论与应用
对独立样本,观测对数似然为
混合也可用于预测密度,而无须为每个成分命名。要从观测分布恢复成分,先查可识别条件;要做参数计算,再查似然是否有有限最优值。若标签确实缺失且缺失概率依赖数据,还须额外分析缺失机制,不能仅因为模型包含潜变量就认定可以忽略观测过程。
自测
把上述权重改成各
混合也会改变生存风险的时间形状。脆弱性生存模型把个体风险乘上潜在随机因子;高风险者较早退出后,幸存者的混合权重随时间改变,所以群体风险可能下降,即使每个人的条件风险都恒定。
量子混态也允许许多不同的混合表示。形成纠缠固定同一个双边密度矩阵,在所有纯态系综分解中最小化平均纠缠熵。某个由 Bell 态组成的分解可以消耗纠缠,而同一密度矩阵也可能具有零纠缠的乘积态分解;因此分解中的成分性质不一定是混合对象独有的性质。
参考资料
- Christopher M. Bishop, Pattern Recognition and Machine Learning, Springer, 2006,§9.2 “Mixtures of Gaussians”,潜标签表示、责任度与高斯混合。
- Geoffrey McLachlan and David Peel, Finite Mixture Models, Wiley, 2000,Ch. 1,有限混合模型及其基本性质。