Skip to content

定理Theorem

Horvitz–Thompson 估计量

Horvitz-Thompson estimator

以逆纳入概率恢复总体总量,逐项证明设计无偏,并区分总量与方差估计的正概率要求。

形式陈述 ​

怎样让一个不常被抽中的对象代表它在总体中的份额?对有限总体抽样设计,若所有目标单位都有 πi>0,总量 ty=∑i∈Uyi 的 Horvitz–Thompson 估计为

t^HT=∑i∈Syiπi=∑i∈UIiyiπi.

按设计取期望,每项 Ep[Iiyi/πi]=yi,所以 Ept^HT=ty。这个证明不要求 yi 正态,也不要求样本内对象独立。

由指示变量的协方差展开,精确设计方差为

Vp(t^HT)=∑i,j∈U(πij−πiπj)yiπiyjπj.

若有关单位对满足 πij>0,可再作一次逆概率加权,得到无偏方差估计

V^=∑i,j∈Sπij−πiπjπijyiπiyjπj.

其中 πii=πi。总量估计只要求一阶正概率;上述可直接使用的无偏方差估计还需要二阶正概率,这是两种不同条件。

直觉

把 Ii/πi 看作平均值为一的放大开关。对象经常缺席,出现时就按缺席频率补偿。这个补偿在所有可能样本的平均意义下准确,并不承诺每一份样本的加权总量恰好等于真值。

方差公式同样在“单位对”层面补偿:两个人是否一起出现会影响估计量一起升高还是相互抵消。只保留单人权重,通常不足以还原这一信息。

例子与边界

列举全部样本验证无偏和方差 ​

总体 y=(2,4,8)。只抽两人,三个样本 {1,2},{1,3},{2,3} 的概率分别为 1/2,3/10,1/5。于是 π=(4/5,7/10,1/2),三种估计分别为

t^12=11514,t^13=372,t^23=1527.

按设计平均,12(115/14)+310(37/2)+15(152/7)=14,恰为总体总量。继续计算三种估计与 14 的平方差,得到

Vp(t^HT)=2437≈34.7143.

这是一份完整的有限样本核验;把 π12=1/2、π13=3/10、π23=1/5 放入协方差公式会得到同样结果。

无偏也可能很不稳定 ​

若一个数值较大的单位只以极小概率入样,它出现时会产生极大的加权贡献。逆概率权重修正代表性,同时可能增加波动。因此设计时常用已知规模信息提高大贡献单位的入样机会,而不是等抽完再希望权重消除一切问题。

优先级抽样在固定容量下按w/U挑选记录,以第k+1优先级为随机阈值,入选贡献取原权重与阈值的较大者。无偏性先条件于其它记录的随机键,不能把实现读出的随机阈值直接当成已知无条件纳入概率;容量一的无穷方差也说明无偏不等于稳定。

若某两人永远不会一起出现,πij=0,它们的交叉项无法由同一份样本直接观察。此时应使用适合该设计的其他方差方法、界或额外假设,并标明依据。

推论与应用

已知 N 时,t^HT/N 是总体均值的无偏估计。Hájek 比率估计改用估计的总体规模归一化,牺牲一般的精确无偏性,换取某些资料结构下的稳定性。二者应按估计目标和实际设计比较。

选择性标注后的固定模型风险审计 ​

把每个有限总体单位的 yi换成已经冻结模型的损失 Li,同一HT公式就能评价一个没有全部标签的资料池。冻结包括模型参数、阈值、校准映射和损失定义;抽样前每个 Li虽未被查看,但已由固定模型和池内真值确定。模型若看过审计标签后继续改进,就不是当前这份设计无偏证明所评价的固定对象。

设池内8个输入全部可见,分成各4人的低分与高分层。为便于复算,完整损失暂写为低分层 (0,0,0,1)、高分层 (0,1,1,1),真实池平均损失为 1/2。实施时只在低分层均匀不放回标注1人,高分层均匀不放回标注3人,两个抽样独立。各层纳入概率分别为 1/4,3/4,故

R^HT=18(4∑i∈SlowLi+43∑i∈ShighLi).

未经校正的4个已标注损失均值,其期望为 (1⋅1/4+3⋅3/4)/4=5/8;困难层被过度访问,报告会偏高。HT平均的期望仍为 1/2。一次实际样本若低分层抽到唯一损失1,高分层抽到 (0,1,1),则HT结果为 5/6,朴素均值为 3/4;单次HT更远不违反设计无偏。

两层有限总体样本方差都为 1/4。简单随机不放回的层总量方差分别为 42(1−1/4)(1/4)/1=3与 42(1−3/4)(1/4)/3=1/3,所以

Var(R^HT)=3+1/382=596.

也可枚举低分4种、高分4种,共16个等可能样本直接验证。低分层永远只抽1人,其不同单位对的二阶纳入概率为零;上述真实设计方差可在教学中用完整损失算出,却不能从一份只标注1人的低分样本直接得到前文那种无偏二阶方差估计。总体无偏、理论方差可写、样本能否无偏估计方差仍是三件事。

如果只给高分层标注,低分层纳入概率为零,池平均不能由已见损失唯一确定:高分总损失若已知为3,未见四人的总损失可以从0到4,池均值范围为 [3/8,7/8]。增加同一高分层的标注次数也不会识别低分层。

这解释了主动学习的查询效率与最终风险评价为什么应分开。真正随机且正概率的审计子样本有设计依据;对于历史非随机缺失标签,则还需缺失机制、覆盖和可能的模型假设,不能把任意拟合的“被看见概率”直接称作已知抽样设计。

参考资料
关系图谱16 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系

使用的工具

被这些条目使用

并列辨析