形式陈述
固定预算时,样本应该更多分给人数多的层,还是差异大的层?把总体划分为互不重叠且穷尽的 H 层,第 h 层大小为 N h 。在各层独立作简单随机不放回抽样,抽取 1 ≤ n h ≤ N h 人。先设各层 N h ≥ 2 ,定义总体层内方差 S h 2 = ∑ i ∈ U h ( y i − Y ¯ h ) 2 / ( N h − 1 ) ,其中 Y ¯ h 是该层总体均值。总量估计及其设计方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 为
t ^ = ∑ h N h y ¯ h , V p ( t ^ ) = ∑ h N h 2 ( 1 − n h N h ) S h 2 n h . 若每人的成本相同、总样本量固定为 n ,暂时把 n h 当连续变量,各层 S h > 0 ,且最优解未触及各层人数上下限,则 Neyman 分配是
n h = n N h S h ∑ g N g S g . 若各层单位成本为 c h > 0 ,在 ∑ h c h n h = C 下,最优比例改为 n h ∝ N h S h / c h 。这两个约束不同,应先说明固定的是人数还是费用。
直觉
分层先确保每类总体都有计划地被代表;分配再决定每层测得多精细。层越大,它的均值误差对总体总量影响越大;层内波动越大,估计同样精度需要更多样本。
在方差公式中,有限总体修正对应的 − ∑ h N h S h 2 不随分配变化。最小化只需考虑 ∑ h N h 2 S h 2 / n h 。使用Lagrange 乘子法 公理库 拉格朗日乘子法 Lagrange multiplier method 约束极值处目标梯度位于约束梯度张成空间中的必要条件。 ,加上约束的乘子项 λ ( ∑ h n h − n ) ,求导得到 − N h 2 S h 2 / n h 2 + λ = 0 ,即 n h ∝ N h S h 。成本约束同样给出分母的 c h 。
乘子方程先给出候选点,全局最优性还可由Cauchy–Schwarz 不等式 公理库 Cauchy–Schwarz 不等式 Cauchy–Schwarz inequality · 柯西–施瓦茨不等式 内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。 直接认证:
( ∑ h N h 2 S h 2 n h ) ( ∑ h n h ) ≥ ( ∑ h N h S h ) 2 . 等号恰在 n h ∝ N h S h 时成立。对成本约束,改用两组向量 N h S h / n h 与 c h n h ,同样得到等号条件 n h ∝ N h S h / c h 。这证明的是所述连续内点问题;人数上下限生效时还须重新求解。
例子与边界
比例分配与最优分配的实算
两层大小为 100 , 300 ,层内标准差为 10 , 20 ,总样本量 80 。按人数比例分配得到 ( 20 , 60 ) ;Neyman 连续解为 ( 80 / 7 , 480 / 7 ) ≈ ( 11.43 , 68.57 ) ,可取邻近整数 ( 11 , 69 ) 后比较方差。
比例分配的总量方差是
100 2 ( 1 − 20 / 100 ) 10 2 20 + 300 2 ( 1 − 60 / 300 ) 20 2 60 = 520000. 整数分配 ( 11 , 69 ) 给出约 482648 ,更小。第二层的总体规模和内部波动都较大,因此即使已经人数较多,仍值得分配更高比例的测量资源。
若第二层每人的成本变成第一层的四倍,则成本最优的样本数比例为 100 ⋅ 10 : 300 ⋅ 20 / 2 = 1 : 3 。最终人数还要用实际总预算缩放,不能沿用固定 80 人的约束。
必要的设计边界
实际规划中的 S h 通常来自历史资料或先导调查。若它估得不准,声称的最优性也随之改变。多目标调查还要照顾多个指标,而非只优化一个变量的方差。
若公式要求 n h > N h ,该层应全查,再对剩余预算重新分配。需要估计层内方差时,通常也须设置每层至少两个样本单位等下限。单人层直接全查,贡献零设计方差;零方差层按所需覆盖和最低样本量约束单独安排。整数、全查、最低样本量和访问成本都应进入最后的可执行方案。
推论与应用
这是设计阶段 公理库 有限总体抽样设计 Finite population sampling design 把有限总体数值固定、样本集合随机,区分一阶纳入机会与决定方差的联合抽取结构。 的优化:分层和分配在观察结果之前确定。事后按样本结果随意重组层,再套原设计方差,会改变随机性结构。若辅助变量已知总体总量,则分析阶段还可用校准进一步提高精度。
参考资料