这里的 按条件概率公理库条件概率Conditional probability在已知正概率事件发生后,把交集概率重新规范到该事件内部。描述选定成分后的观测分布;若 ,该成分不影响观测分布。这是一个统计模型公理库统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。,参数包括权重及各成分参数。若成分有共同支配测度下的密度 ,由全概率公式公理库全概率公式Law of total probability沿有限或可数可测划分分解事件,并按各分块概率加权合并。,观测密度是
交换成分编号不会改变 ;两个成分重合时,还可能出现权重冗余。统计模型的可识别性公理库统计模型的可识别性Identifiability of a statistical model · Parameter identifiability观测分布能否唯一决定参数或目标,以及对称、观测机制与弱识别造成的边界。据此区分有序参数、标签置换后的等价类与观测分布。本页的边缘化公式不承诺成分表示唯一,也不把多个拟合峰自动解释为多个科学群体。
对独立样本,观测对数似然为 。困难来自对数里的和,而完整标签已知时,目标是各成分对数密度的加权和。EM 算法公理库期望最大化算法Expectation-maximization algorithm · EM algorithm · EM 算法交替计算潜变量的条件分布与提高完整数据期望对数似然,以迭代优化观测似然的算法。利用责任度把潜标签的指示量替换为条件期望,再更新参数。
混合也可用于预测密度,而无须为每个成分命名。要从观测分布恢复成分,先查可识别条件;要做参数计算,再查似然是否有有限最优值。若标签确实缺失且缺失概率依赖数据,还须额外分析缺失机制公理库缺失数据机制Missing-data mechanism · MCAR · MAR · MNAR用观测指示变量的条件分布描述哪些数据被保留,并区分完全随机、随机和非随机缺失及忽略机制的条件。,不能仅因为模型包含潜变量就认定可以忽略观测过程。