Skip to content

算法Algorithm

调查校准加权

Calibration weighting · Generalized regression estimator

在匹配已知辅助总量的约束下调整设计权重,推导线性校准解并检查正权可行性。

形式陈述 ​

已有设计权重,却知道加权样本的年龄组人数与真实人口不符,怎样利用这份已知信息?校准选择尽量接近原权重 di=1/πi 的新权重 wi,同时精确匹配辅助变量总体总量 tx=∑Uxi:

∑i∈Swixi=tx.

一种具体选择是最小化二次距离

12∑i∈S(wi−di)2diqi,qi>0.

对线性独立的约束使用Lagrange 乘子法,得到 wi=di(1+qixiTλ)。代回校准方程可得线性方程组

(∑SdiqixixiT)λ=tx−∑Sdixi.

矩阵可逆时解唯一。若矩阵奇异,应先检验 tx 是否属于样本辅助向量的线性张成;不属于便无解,属于时可删去冗余约束再求解。可行时权重仍唯一,即使乘子表示不唯一:记二次目标为 Q(w),对满足乘子方程的可行 w∗ 和任意另一可行 w,交叉项由校准约束消去,故

Q(w)−Q(w∗)=12∑i∈S(wi−wi∗)2diqi≥0,

等号只在 w=w∗ 时成立。

估计总量为 t^cal=∑Swiyi。若 xi 含常数一,则校准同时令权重和等于已知总体人数。

直觉

原始HT 权重来自实际抽取机会,校准再用总体已知信息调整其代表份额。调整力求小,约束则必须精确满足;这是一个带约束的估计构造。

当上述加权 Gram 矩阵可逆时,定义加权回归系数 B^=(∑SdiqixixiT)−1∑Sdiqixiyi,代数整理给出

t^cal=t^HT+(tx−t^x,HT)TB^.

辅助变量总量误差通过预测关系转成结果总量的修正。若总体上恰有 yi=xiTB,校准约束立即给出 t^cal=txTB=ty。一般资料中仍有残差,方差主要由那些残差的抽样波动决定。

例子与边界

总体四人的辅助值为 1,2,3,4,故人数为 4、辅助总量为 10。简单随机抽二人,恰抽到 x=1,3,原权重均为二。对常数项与 x 同时校准,方程为

w1+w3=4,w1+3w3=10,

解为 w1=1,w3=3。若观察到的结果分别为 4,8,原 HT 总量是 24,校准总量是 1×4+3×8=28。若全体结果确实满足 y=2+2x,总体总量就是 2×4+2×10=28,本例恰被校准完全恢复。

再考虑另一个四人总体,辅助值为 (1,3,4,6),总量为 14,抽中的两人仍为 x=1,3。方程解变为 (−1,5)。目标辅助均值 3.5 超出样本辅助值的凸包 [1,3],所以不存在满足约束的非负权重。二次距离允许负权重;若应用要求正权重,应检查可行性并选择相应距离、界或更合适的约束。

推论与应用

计算流程是:检查总体总量与样本辅助变量定义一致及约束相容,删除冗余约束,求解权重,再核对约束残差、权重范围和设计方差。稠密线性校准对 n 人、p 个辅助变量约需 O(np2+p3)。

校准是利用已知信息的估计调整,一般不保持有限样本精确无偏。方差应使用残差线性化或在每份复制权重中重新校准。若辅助总量本身也是估计值,其误差也要进入推断。

参考资料
  • Deville and Särndal, Calibration Estimators in Survey Sampling, JASA 87, 1992, pp. 376–382,距离最小化与校准方程。
  • Lumley, Complex Surveys, Wiley, 2010, Chapter 7,校准、回归估计及实际权重检查。
关系图谱15 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系