形式陈述
把缺失值补一次再照常分析,为什么常会低估不确定性?多重插补保留多份合理补全,用“每份分析内部的不确定性”和“不同补全之间的差异”共同推断同一个目标参数。
给定已观察资料,从适当的插补模型中独立生成 M ≥ 2 份补全资料。第 m 份给出标量估计 Q m 及其完整资料方差估计 U m 。Rubin 合并规则为
Q ¯ = 1 M ∑ m Q m , U ¯ = 1 M ∑ m U m , B = 1 M − 1 ∑ m ( Q m − Q ¯ ) 2 , T = U ¯ + ( 1 + 1 / M ) B . U ¯ 是组内方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 ,B 是组间方差,B / M 补偿有限插补次数带来的模拟误差。标准误为 T 。若完整资料推断近似正态、自由度足够大,可使用 Rubin 的近似自由度
ν = ( M − 1 ) [ 1 + U ¯ ( 1 + 1 / M ) B ] 2 构造 t 区间;小样本还需适当自由度修正。B = 0 的情况按极限和完整资料自由度处理。
直觉
全方差分解 公理库 全期望公式与全方差公式 Law of total expectation · Law of total variance · Iterated expectation 借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。 把“给定补全后的方差”与“补全改变估计值的方差”相加。多重插补用 U ¯ 和 B 分别近似两部分。多做插补能减少 B / M ,却不会让资料真正缺失造成的 B 消失。
有效合并依赖适当的随机插补、与分析相容的模型,以及合理的缺失机制 公理库 缺失数据机制 Missing-data mechanism · MCAR · MAR · MNAR 用观测指示变量的条件分布描述哪些数据被保留,并区分完全随机、随机和非随机缺失及忽略机制的条件。 假设。常见 MAR 分析需要在插补模型中纳入解释缺失与结果的重要观测信息,并反映模型参数的不确定性。反复填写同一个预测均值,会使 B = 0 ,却没有真实表达缺失的不确定性。
例子与边界
三份补全给出 Q = ( 10 , 12 , 11 ) ,各份完整资料方差均为 4 。于是 Q ¯ = 11 、U ¯ = 4 、B = 1 ,总方差为 4 + 4 / 3 = 16 / 3 ,标准误约 2.309 。
只平均三个标准误,会得到 2 ,遗漏组间变化。把三份资料堆成一个三倍大的数据集,则会把同一组已观察信息重复当作新样本。正确流程是每份单独拟合、最后合并参数及方差。
对于风险比或优势比,通常先在对数尺度合并,再把估计和区间变回原尺度。多个参数联合检验需要合并方差协方差矩阵;各份 p 值的简单平均不对应 Rubin 规则。
MNAR 情形需要进一步假设或敏感性分析。增加 M 只使计算更稳定,并不修正错误缺失机制。复杂调查还要在每份完整资料中采用正确设计方差,并让插补考虑权重、分层和簇信息。
推论与应用
单元练习:设计、校准与补全分开验收
取总体 y = ( 2 , 4 , 8 ) ,两人样本概率为 p 12 = 1 / 2 , p 13 = 3 / 10 , p 23 = 1 / 5 。列出一阶、二阶纳入概率;计算 HT 总量及设计方差;若抽中 { 1 , 3 } ,比较 HT 均值、Hájek 均值与只校准人数的总量。最后合并三份补全给出的 Q = ( 10 , 12 , 11 ) 、U = ( 4 , 4 , 4 ) 。
一阶概率是 ( 4 / 5 , 7 / 10 , 1 / 2 ) ,三个非对角二阶概率就是各样本概率。总体总量为 14 ,HT 的三个可能结果为 115 / 14 , 37 / 2 , 152 / 7 ,设计方差为 243 / 7 。
在 { 1 , 3 } 样本中,HT 均值为 ( 37 / 2 ) / 3 = 37 / 6 ;Hájek 均值为 74 / 13 。只校准人数为三、并取二次距离中 q i = 1 时,所有原权重乘 3 / ( 13 / 4 ) = 12 / 13 ,新权重为 ( 15 / 13 , 24 / 13 ) ,校准总量是 222 / 13 。它恰等于三倍 Hájek 均值,仍与真总量有抽样差异。
合并部分得到 Q ¯ = 11 、T = 16 / 3 。再说明:若观测来自同一簇,组内相关应先进入每份分析的 U m ;B 表达补全之间的差异,不能代替簇抽样方差。验收答案必须把设计随机性、权重约束和缺失不确定性分清,并准确给出上述可复算结果。
参考资料