Skip to content

定义Definition

Hájek 比率估计量

Hajek ratio estimator

用随机权重和归一化总量,解释规模波动的抵消、线性化方差及有限样本比率偏差。

形式陈述 ​

为什么除以“估计出来的总体人数”,有时比除以已知人数更稳定?设 di=1/πi,并用HT 估计分别构造 t^y=∑Sdiyi 与 N^=∑Sdi。样本非空时,Hájek 均值估计为

Y¯^H=t^yN^=∑i∈Sdi∑j∈Sdjyi.

若已知总体大小 N,可报告总量估计 NY¯^H。由于权重为正,均值估计落在样本最小值与最大值之间,并对 yi 同时加常数的操作作同样平移。

它一般不是精确设计无偏的。令真均值为 Y¯=ty/N,将比率在 (ty,N) 附近线性化,有

Y¯^H−Y¯≈1N∑i∈U(Iiπi−1)(yi−Y¯).

这个线性化有一个精确余项。记 A=∑i∈U(Ii/πi−1)(yi−Y¯),则 Y¯^H−Y¯=A/N^,所以

Y¯^H−Y¯−AN=−A(N^−N)NN^.

若分母相对误差 N^/N−1 趋零,则余项相对于线性主项的尺度可忽略;若还要得出方差近似,仍需相应的矩控制。

因此首阶方差由中心化残差 yi−Y¯ 的 HT 总量决定。常用的充分条件包括分母集中于 N、极端权重受到控制及相应的矩条件;一个随机比率没有脱离设计的万能稳定保证。

直觉

HT 总量随样本变化时,有一部分波动可能来自样本“代表了多少人”,另一部分来自这些人的平均数值。分子与分母共同缩放,就能消掉第一部分。特别是所有 yi=c 时,Hájek 均值恒等于 c,而 t^y/N=cN^/N 仍可能波动。

这个归一化机制与自归一化重要性采样相似,但抽样调查中的随机性来自有限总体设计,方差仍须保留分层、簇和联合纳入结构。

例子与边界

用同一设计看见偏差 ​

沿用 HT 页的三人总体 (2,4,8),样本概率为 p12=1/2,p13=3/10,p23=1/5,设计权重为 (5/4,10/7,2)。三种样本的 Hájek 均值分别为

Y¯^12=4615,Y¯^13=7413,Y¯^23=193.

例如抽中 {1,3},HT 总量为 18.5,估计人数为 3.25,两者相除得到 74/13≈5.6923。若直接除以已知 N=3,则为 6.1667。

把三种 Hájek 结果按设计概率平均,得到 293/65≈4.5077,真均值为 14/3≈4.6667,偏差为 −31/195≈−0.1590。分子和分母分别无偏,并没有使它们的比值无偏。

何时归一化完全消除波动 ​

若把同一设计的总体数值改成所有人均为 5,每份非空样本的分子都等于五倍分母,Hájek 结果恒为 5。这个例子说明它消除的是与总体规模共同变化的分子波动,而非对任意 y 都有同样效果。

设计允许空样本时,需要明确估计量的定义或改用保证非空的设计。极端权重时,归一化结果仍可能几乎由一个对象决定,应同时检查权重集中程度和设计有效信息量。

推论与应用

一般比率估计还可把分母换成辅助变量总量。校准权重进一步要求多个已知总体总量同时匹配;仅匹配常数变量的校准,正好体现了“权重和应等于总体人数”的约束。

参考资料
  • Thomas Lumley, Complex Surveys: A Guide to Analysis Using R, Wiley, 2010, Chapter 5, “Ratios and Linear Regression”,设计权重与比率估计。
  • U.S. EPA spsurvey, Technical Details, “Totals, Means, Proportions, and Distribution Functions”,总量与比率估计的实现。
关系图谱7 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系