“调查抽样还常采用另一种随机性约定:总体数值固定,只让样本集合随机。有限总体抽样设计用一阶和二阶纳入概率描述这种随机性,并展示相同单人权重仍可对应完全不同的样本均值方差。”
形式陈述
本页回答:总体里的数值已经固定,抽样推断中的概率究竟对什么取?设有限总体为
令
于是
若样本量恒等于
直觉
把一份完整名册视作固定的一盒卡片,设计规定每次怎样从中挑出一叠。总体均值是盒子本身的属性;估计量随着抽到哪一叠而变化。设计无偏的意思是:把所有可能样本按设计概率平均后,估计量恰好落回总体目标。
这个视角与把人看作某个无限分布独立生成的模型不同。两种视角可以同时使用,但每次写方差时都要说清是哪一种随机性。已知抽样设计使一些推断不必先假设总体数值服从正态分布。
例子与边界
相同的一阶概率,不同的信息
总体有四人,数值为
设计 A 的样本均值为
抽样框与概率样本的边界
假设目标总体有五人,但名册遗漏了第五人。前四人无论怎样随机抽,遗漏者的纳入概率都是零。抽样随机性支撑的是名册覆盖的人群;要推广到第五人,需要补充名册或额外模型信息。
“现场选了看起来典型的人”没有给出可计算的设计概率。样本可能碰巧接近总体,也可能远离;设计无偏与设计方差需要一个真实的随机抽取规则作为依据。
推论与应用
Horvitz–Thompson 估计用一阶概率恢复总量,用二阶概率表达方差。分层、整群和多阶段设计都可以放进同一框架:先识别真正被随机选择的单位,再记录相关概率。
分析前的最小设计说明应包括目标总体、抽样框、各阶段抽取单位、放回方式、纳入概率及非应答处理。这些信息决定结果可以推到哪里,也决定标准误怎样计算。
参考资料
- U.S. EPA spsurvey, Technical Details, “Design-Based Inference” and “Inclusion Probabilities and Design Weights”,设计随机性与纳入概率。
- Mark S. Handcock, Sample Survey Techniques, STAT 529, learning objectives,有限总体与超总体推断的课程区分。
- Sharon L. Lohr, Sampling: Design and Analysis, 3rd ed., CRC Press, 2022, Chapters 1–2,概率抽样基础。