形式陈述
怎样让一个不常被抽中的对象代表它在总体中的份额?对有限总体抽样设计理路有限总体抽样设计Finite population sampling design把有限总体数值固定、样本集合随机,区分一阶纳入机会与决定方差的联合抽取结构。,若所有目标单位都有 ,总量 的 Horvitz–Thompson 估计为
按设计取期望理路期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。,每项 ,所以 。这个证明不要求 正态,也不要求样本内对象独立。
由指示变量的协方差理路协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。展开,精确设计方差为
若有关单位对满足 ,可再作一次逆概率加权,得到无偏方差估计
其中 。总量估计只要求一阶正概率;上述可直接使用的无偏方差估计还需要二阶正概率,这是两种不同条件。
直觉
把 看作平均值为一的放大开关。对象经常缺席,出现时就按缺席频率补偿。这个补偿在所有可能样本的平均意义下准确,并不承诺每一份样本的加权总量恰好等于真值。
方差公式同样在“单位对”层面补偿:两个人是否一起出现会影响估计量一起升高还是相互抵消。只保留单人权重,通常不足以还原这一信息。
例子与边界
列举全部样本验证无偏和方差
总体 。只抽两人,三个样本 的概率分别为 。于是 ,三种估计分别为
按设计平均,,恰为总体总量。继续计算三种估计与 的平方差,得到
这是一份完整的有限样本核验;把 、、 放入协方差公式会得到同样结果。
无偏也可能很不稳定
若一个数值较大的单位只以极小概率入样,它出现时会产生极大的加权贡献。逆概率权重修正代表性,同时可能增加波动。因此设计时常用已知规模信息提高大贡献单位的入样机会,而不是等抽完再希望权重消除一切问题。
优先级抽样理路优先级抽样Priority sampling以权重除以独立随机数构造优先级,保存k个样本和额外阈值,证明固定子集总量无偏及k≥2时的方差估计。在固定容量下按w/U挑选记录,以第k+1优先级为随机阈值,入选贡献取原权重与阈值的较大者。无偏性先条件于其它记录的随机键,不能把实现读出的随机阈值直接当成已知无条件纳入概率;容量一的无穷方差也说明无偏不等于稳定。
若某两人永远不会一起出现,,它们的交叉项无法由同一份样本直接观察。此时应使用适合该设计的其他方差方法、界或额外假设,并标明依据。
推论与应用
已知 时, 是总体均值的无偏估计。Hájek 比率估计理路Hájek 比率估计量Hajek ratio estimator用随机权重和归一化总量,解释规模波动的抵消、线性化方差及有限样本比率偏差。改用估计的总体规模归一化,牺牲一般的精确无偏性,换取某些资料结构下的稳定性。二者应按估计目标和实际设计比较。
选择性标注后的固定模型风险审计
把每个有限总体单位的 换成已经冻结模型的损失 ,同一HT公式就能评价一个没有全部标签的资料池。冻结包括模型参数、阈值、校准映射和损失定义;抽样前每个 虽未被查看,但已由固定模型和池内真值确定。模型若看过审计标签后继续改进,就不是当前这份设计无偏证明所评价的固定对象。
设池内8个输入全部可见,分成各4人的低分与高分层。为便于复算,完整损失暂写为低分层 、高分层 ,真实池平均损失为 。实施时只在低分层均匀不放回标注1人,高分层均匀不放回标注3人,两个抽样独立。各层纳入概率分别为 ,故
未经校正的4个已标注损失均值,其期望为 ;困难层被过度访问,报告会偏高。HT平均的期望仍为 。一次实际样本若低分层抽到唯一损失1,高分层抽到 ,则HT结果为 ,朴素均值为 ;单次HT更远不违反设计无偏。
两层有限总体样本方差都为 。简单随机不放回的层总量方差分别为 与 ,所以
也可枚举低分4种、高分4种,共16个等可能样本直接验证。低分层永远只抽1人,其不同单位对的二阶纳入概率为零;上述真实设计方差可在教学中用完整损失算出,却不能从一份只标注1人的低分样本直接得到前文那种无偏二阶方差估计。总体无偏、理论方差可写、样本能否无偏估计方差仍是三件事。
如果只给高分层标注,低分层纳入概率为零,池平均不能由已见损失唯一确定:高分总损失若已知为3,未见四人的总损失可以从0到4,池均值范围为 。增加同一高分层的标注次数也不会识别低分层。
这解释了主动学习理路主动学习与分歧系数Active learning · Disagreement coefficient · 主动学习在二分类中只为有信息的输入请求标签,并以 version space 分歧区域随半径收缩的速度刻画标签复杂度。的查询效率与最终风险评价为什么应分开。真正随机且正概率的审计子样本有设计依据;对于历史非随机缺失标签,则还需缺失机制理路缺失数据机制Missing-data mechanism · MCAR · MAR · MNAR用观测指示变量的条件分布描述哪些数据被保留,并区分完全随机、随机和非随机缺失及忽略机制的条件。、覆盖和可能的模型假设,不能把任意拟合的“被看见概率”直接称作已知抽样设计。
参考资料