Skip to content

算法Algorithm

多重插补与 Rubin 合并规则

Multiple imputation · Rubin rules

将完整资料方差与插补间方差分别保留,用 Rubin 规则合并参数估计与有限插补误差。

形式陈述 ​

把缺失值补一次再照常分析,为什么常会低估不确定性?多重插补保留多份合理补全,用“每份分析内部的不确定性”和“不同补全之间的差异”共同推断同一个目标参数。

给定已观察资料,从适当的插补模型中独立生成 M≥2 份补全资料。第 m 份给出标量估计 Qm 及其完整资料方差估计 Um。Rubin 合并规则为

Q¯=1M∑mQm,U¯=1M∑mUm,B=1M−1∑m(Qm−Q¯)2,T=U¯+(1+1/M)B.

U¯ 是组内方差,B 是组间方差,B/M 补偿有限插补次数带来的模拟误差。标准误为 T。若完整资料推断近似正态、自由度足够大,可使用 Rubin 的近似自由度

ν=(M−1)[1+U¯(1+1/M)B]2

构造 t 区间;小样本还需适当自由度修正。B=0 的情况按极限和完整资料自由度处理。

直觉

全方差分解把“给定补全后的方差”与“补全改变估计值的方差”相加。多重插补用 U¯ 和 B 分别近似两部分。多做插补能减少 B/M,却不会让资料真正缺失造成的 B 消失。

有效合并依赖适当的随机插补、与分析相容的模型,以及合理的缺失机制假设。常见 MAR 分析需要在插补模型中纳入解释缺失与结果的重要观测信息,并反映模型参数的不确定性。反复填写同一个预测均值,会使 B=0,却没有真实表达缺失的不确定性。

例子与边界

三份补全给出 Q=(10,12,11),各份完整资料方差均为 4。于是 Q¯=11、U¯=4、B=1,总方差为 4+4/3=16/3,标准误约 2.309。

只平均三个标准误,会得到 2,遗漏组间变化。把三份资料堆成一个三倍大的数据集,则会把同一组已观察信息重复当作新样本。正确流程是每份单独拟合、最后合并参数及方差。

对于风险比或优势比,通常先在对数尺度合并,再把估计和区间变回原尺度。多个参数联合检验需要合并方差协方差矩阵;各份 p 值的简单平均不对应 Rubin 规则。

MNAR 情形需要进一步假设或敏感性分析。增加 M 只使计算更稳定,并不修正错误缺失机制。复杂调查还要在每份完整资料中采用正确设计方差,并让插补考虑权重、分层和簇信息。

推论与应用

单元练习:设计、校准与补全分开验收 ​

取总体 y=(2,4,8),两人样本概率为 p12=1/2,p13=3/10,p23=1/5。列出一阶、二阶纳入概率;计算 HT 总量及设计方差;若抽中 {1,3},比较 HT 均值、Hájek 均值与只校准人数的总量。最后合并三份补全给出的 Q=(10,12,11)、U=(4,4,4)。

一阶概率是 (4/5,7/10,1/2),三个非对角二阶概率就是各样本概率。总体总量为 14,HT 的三个可能结果为 115/14,37/2,152/7,设计方差为 243/7。

在 {1,3} 样本中,HT 均值为 (37/2)/3=37/6;Hájek 均值为 74/13。只校准人数为三、并取二次距离中 qi=1 时,所有原权重乘 3/(13/4)=12/13,新权重为 (15/13,24/13),校准总量是 222/13。它恰等于三倍 Hájek 均值,仍与真总量有抽样差异。

合并部分得到 Q¯=11、T=16/3。再说明:若观测来自同一簇,组内相关应先进入每份分析的 Um;B 表达补全之间的差异,不能代替簇抽样方差。验收答案必须把设计随机性、权重约束和缺失不确定性分清,并准确给出上述可复算结果。

参考资料
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系