形式陈述
怎样让一个不常被抽中的对象代表它在总体中的份额?对有限总体抽样设计公理库有限总体抽样设计Finite population sampling design把有限总体数值固定、样本集合随机,区分一阶纳入机会与决定方差的联合抽取结构。,若所有目标单位都有 ,总量 的 Horvitz–Thompson 估计为
按设计取期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。,每项 ,所以 。这个证明不要求 正态,也不要求样本内对象独立。
由指示变量的协方差公理库协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。展开,精确设计方差为
若有关单位对满足 ,可再作一次逆概率加权,得到无偏方差估计
其中 。总量估计只要求一阶正概率;上述可直接使用的无偏方差估计还需要二阶正概率,这是两种不同条件。
直觉
把 看作平均值为一的放大开关。对象经常缺席,出现时就按缺席频率补偿。这个补偿在所有可能样本的平均意义下准确,并不承诺每一份样本的加权总量恰好等于真值。
方差公式同样在“单位对”层面补偿:两个人是否一起出现会影响估计量一起升高还是相互抵消。只保留单人权重,通常不足以还原这一信息。
例子与边界
列举全部样本验证无偏和方差
总体 。只抽两人,三个样本 的概率分别为 。于是 ,三种估计分别为
按设计平均,,恰为总体总量。继续计算三种估计与 的平方差,得到
这是一份完整的有限样本核验;把 、、 放入协方差公式会得到同样结果。
无偏也可能很不稳定
若一个数值较大的单位只以极小概率入样,它出现时会产生极大的加权贡献。逆概率权重修正代表性,同时可能增加波动。因此设计时常用已知规模信息提高大贡献单位的入样机会,而不是等抽完再希望权重消除一切问题。
若某两人永远不会一起出现,,它们的交叉项无法由同一份样本直接观察。此时应使用适合该设计的其他方差方法、界或额外假设,并标明依据。
推论与应用
已知 时, 是总体均值的无偏估计。Hájek 比率估计公理库Hájek 比率估计量Hajek ratio estimator用随机权重和归一化总量,解释规模波动的抵消、线性化方差及有限样本比率偏差。改用估计的总体规模归一化,牺牲一般的精确无偏性,换取某些资料结构下的稳定性。二者应按估计目标和实际设计比较。
参考资料