MNAR 时因子一般不能提出积分。例如只记录收入超过某个未公开门槛的人,看到的收入密度同时受总体分布和选择概率影响。不同的完整数据模型与选择机制可能生成同一个观测律,形成可识别性理路统计模型的可识别性Identifiability of a statistical model · Parameter identifiability观测分布能否唯一决定参数或目标,以及对称、观测机制与弱识别造成的边界。障碍;仅增加同类观测未必能解开它。
推论与应用
缺失机制应结合数据采集过程、已知设计信息和科学知识说明。一般不能仅从已观测数据验证 MAR,因为其关键条件涉及看不见的值。可检查特定 MCAR 假设与可见数据是否冲突,但未拒绝某项检验也不证明 MAR 或 MCAR 成立。
在可忽略模型下,可用EM理路期望最大化算法Expectation-maximization algorithm · EM algorithm · EM 算法交替计算潜变量的条件分布与提高完整数据期望对数似然,以迭代优化观测似然的算法。处理缺失变量的边缘似然;在机制不可忽略或结论对它敏感时,应显式建模选择过程,比较不同机制假设下的结论,并说明额外识别信息来自哪里。
在协变量全部可见、结果按 MAR 缺失且记录概率为正时,识别完整均值之后还可追问估计精度。半参数效率与有效影响函数理路半参数效率与有效影响函数Semiparametric efficiency · Efficient influence function · Canonical gradient · 典范梯度用可微子模型的得分空间刻画正则估计的首阶方差界,并完整求出随机缺失均值的有效影响函数。把误差分成组间人群波动与组内结果波动,推导缺失增加的首阶方差,并给出有限分层下达到该界的估计方法。