形式陈述
为什么除以“估计出来的总体人数”,有时比除以已知人数更稳定?设 ,并用HT 估计公理库Horvitz–Thompson 估计量Horvitz-Thompson estimator以逆纳入概率恢复总体总量,逐项证明设计无偏,并区分总量与方差估计的正概率要求。分别构造 与 。样本非空时,Hájek 均值估计为
若已知总体大小 ,可报告总量估计 。由于权重为正,均值估计落在样本最小值与最大值之间,并对 同时加常数的操作作同样平移。
它一般不是精确设计无偏的。令真均值为 ,将比率在 附近线性化,有
这个线性化有一个精确余项。记 ,则 ,所以
若分母相对误差 趋零,则余项相对于线性主项的尺度可忽略;若还要得出方差近似,仍需相应的矩控制。
因此首阶方差由中心化残差 的 HT 总量决定。常用的充分条件包括分母集中于 、极端权重受到控制及相应的矩条件;一个随机比率没有脱离设计的万能稳定保证。
直觉
HT 总量随样本变化时,有一部分波动可能来自样本“代表了多少人”,另一部分来自这些人的平均数值。分子与分母共同缩放,就能消掉第一部分。特别是所有 时,Hájek 均值恒等于 ,而 仍可能波动。
这个归一化机制与自归一化重要性采样公理库自归一化重要性采样Self-normalized importance sampling · SNIS用未归一化目标与提议的权重和估计未知归一化常数,并以归一化权重形成目标期望的比率估计量。相似,但抽样调查中的随机性来自有限总体设计,方差仍须保留分层、簇和联合纳入结构。
例子与边界
用同一设计看见偏差
沿用 HT 页的三人总体 ,样本概率为 ,设计权重为 。三种样本的 Hájek 均值分别为
例如抽中 ,HT 总量为 ,估计人数为 ,两者相除得到 。若直接除以已知 ,则为 。
把三种 Hájek 结果按设计概率平均,得到 ,真均值为 ,偏差为 。分子和分母分别无偏,并没有使它们的比值无偏。
何时归一化完全消除波动
若把同一设计的总体数值改成所有人均为 ,每份非空样本的分子都等于五倍分母,Hájek 结果恒为 。这个例子说明它消除的是与总体规模共同变化的分子波动,而非对任意 都有同样效果。
设计允许空样本时,需要明确估计量的定义或改用保证非空的设计。极端权重时,归一化结果仍可能几乎由一个对象决定,应同时检查权重集中程度和设计有效信息量。
推论与应用
一般比率估计还可把分母换成辅助变量总量。校准权重公理库调查校准加权Calibration weighting · Generalized regression estimator在匹配已知辅助总量的约束下调整设计权重,推导线性校准解并检查正权可行性。进一步要求多个已知总体总量同时匹配;仅匹配常数变量的校准,正好体现了“权重和应等于总体人数”的约束。
参考资料
- Thomas Lumley, Complex Surveys: A Guide to Analysis Using R, Wiley, 2010, Chapter 5, “Ratios and Linear Regression”,设计权重与比率估计。
- U.S. EPA spsurvey, Technical Details, “Totals, Means, Proportions, and Distribution Functions”,总量与比率估计的实现。