“混合也可用于预测密度,而无须为每个成分命名。要从观测分布恢复成分,先查可识别条件;要做参数计算,再查似然是否有有限最优值。若标签确实缺失且缺失概率依赖数据,还须额外分析缺失机制,不能仅因为模…”
形式陈述 ​
数据缺失后,能否只分析留下的数值?先把“本来会有的数据”和“实际看到了什么”分开。设完整数据向量为
采用对所有可能掩码和数据取值成立的版本,三类机制为:
- MCAR(完全随机缺失):
,即掩码与完整数据独立。 - MAR(随机缺失): 对每个
,任何满足 的两种完整数据,都有 。给定该掩码下已见的数据,缺失概率不再随未见部分改变。 - MNAR(非随机缺失): 上述 MAR 条件不成立。
这些等式在模型支持上理解,并对允许的机制参数成立。MAR 的“已观测部分”随
直觉
MCAR 像与内容无关的设备随机丢包。MAR 则允许丢失机会取决于已经记录的年龄或组别;例如已知年龄较大的人更愿意回答收入问题,仍可能是 MAR。若在年龄相同的人中,高收入者更不愿透露收入,缺失还依赖未见收入,就可能是 MNAR。
“随机”不是说各记录被等概率保留,也不是说缺失无关紧要。它描述在指定观测信息条件下的概率关系;更换观测变量或改变采集流程,机制分类可能随之改变。
例子与边界
MAR 仍会使完整病例均值偏离总体 ​
设有限总体有
总体结果均值为
偏差来自两组在可见结果中的占比改变。若先在每组计算均值,再按全体已知的组别比例各
何时可以在似然中忽略机制 ​
实际观测为
在 MAR 下,机制项对积分变量不变,因而
要在关于
MNAR 时因子一般不能提出积分。例如只记录收入超过某个未公开门槛的人,看到的收入密度同时受总体分布和选择概率影响。不同的完整数据模型与选择机制可能生成同一个观测律,形成可识别性障碍;仅增加同类观测未必能解开它。
推论与应用
缺失机制应结合数据采集过程、已知设计信息和科学知识说明。一般不能仅从已观测数据验证 MAR,因为其关键条件涉及看不见的值。可检查特定 MCAR 假设与可见数据是否冲突,但未拒绝某项检验也不证明 MAR 或 MCAR 成立。
在可忽略模型下,可用EM处理缺失变量的边缘似然;在机制不可忽略或结论对它敏感时,应显式建模选择过程,比较不同机制假设下的结论,并说明额外识别信息来自哪里。
自测 ​
若上述两组都随机观察
参考资料
- Donald B. Rubin, “Inference and Missing Data”, Biometrika 63(3), 1976, pp. 581–592,§§5、7、8,随机缺失及似然、Bayesian 推断中的忽略性条件。
- Roderick J. A. Little and Donald B. Rubin, Statistical Analysis with Missing Data, 3rd ed., Wiley, 2019,Ch. 1,缺失模式与机制。