Skip to content

定义Definition

有限总体抽样设计

Finite population sampling design

把有限总体数值固定、样本集合随机,区分一阶纳入机会与决定方差的联合抽取结构。

形式陈述 ​

本页回答:总体里的数值已经固定,抽样推断中的概率究竟对什么取?设有限总体为 U={1,…,N},其中 N≥1,其数值 y1,…,yN 固定。抽样设计是在可选样本集合上的概率分布 p(s),满足 p(s)≥0、∑s⊆Up(s)=1。随机对象是样本 S,而非此刻总体中的 yi。

令 Ii=1{i∈S}。一阶与二阶纳入概率分别为

πi=Pp(i∈S),πij=Pp(i,j∈S),πii=πi.

于是 EpIi=πi,Covp(Ii,Ij)=πij−πiπj。下标 p 提醒读者,均值与方差按同一总体上的重复抽样计算。

若样本量恒等于 n,则 ∑iπi=n;对固定 i 还有 ∑jπij=nπi,其中求和包含 j=i。若每个大小为 n 的子集等概率,才是简单随机不放回抽样,此时 πi=n/N、πij=n(n−1)/[N(N−1)](i≠j)。

直觉

把一份完整名册视作固定的一盒卡片,设计规定每次怎样从中挑出一叠。总体均值是盒子本身的属性;估计量随着抽到哪一叠而变化。设计无偏的意思是:把所有可能样本按设计概率平均后,估计量恰好落回总体目标。

这个视角与把人看作某个无限分布独立生成的模型不同。两种视角可以同时使用,但每次写方差时都要说清是哪一种随机性。已知抽样设计使一些推断不必先假设总体数值服从正态分布。

例子与边界

相同的一阶概率,不同的信息 ​

总体有四人,数值为 (0,0,10,10)。设计 A 以各 1/2 的概率抽取 {1,2} 或 {3,4};设计 B 以各 1/2 的概率抽取 {1,3} 或 {2,4}。两个设计中,每个人的 πi 都是 1/2,样本量都为二。

设计 A 的样本均值为 0 或 10,其设计均值为 5、方差为 25。设计 B 的样本均值总是 5,方差为零。只保存每人的抽样权重 1/πi=2,会丢掉造成这项差异的联合结构。比如 π12 在 A 中是 1/2,在 B 中是零。

抽样框与概率样本的边界 ​

假设目标总体有五人,但名册遗漏了第五人。前四人无论怎样随机抽,遗漏者的纳入概率都是零。抽样随机性支撑的是名册覆盖的人群;要推广到第五人,需要补充名册或额外模型信息。

“现场选了看起来典型的人”没有给出可计算的设计概率。样本可能碰巧接近总体,也可能远离;设计无偏与设计方差需要一个真实的随机抽取规则作为依据。

推论与应用

Horvitz–Thompson 估计用一阶概率恢复总量,用二阶概率表达方差。分层、整群和多阶段设计都可以放进同一框架:先识别真正被随机选择的单位,再记录相关概率。

分析前的最小设计说明应包括目标总体、抽样框、各阶段抽取单位、放回方式、纳入概率及非应答处理。这些信息决定结果可以推到哪里,也决定标准误怎样计算。

参考资料
  • U.S. EPA spsurvey, Technical Details, “Design-Based Inference” and “Inclusion Probabilities and Design Weights”,设计随机性与纳入概率。
  • Mark S. Handcock, Sample Survey Techniques, STAT 529, learning objectives,有限总体与超总体推断的课程区分。
  • Sharon L. Lohr, Sampling: Design and Analysis, 3rd ed., CRC Press, 2022, Chapters 1–2,概率抽样基础。
关系图谱17 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。