形式陈述
已有设计权重,却知道加权样本的年龄组人数与真实人口不符,怎样利用这份已知信息?校准选择尽量接近原权重 d i = 1 / π i 的新权重 w i ,同时精确匹配辅助变量总体总量 t x = ∑ U x i :
∑ i ∈ S w i x i = t x . 一种具体选择是最小化二次距离
1 2 ∑ i ∈ S ( w i − d i ) 2 d i q i , q i > 0. 对线性独立的约束使用Lagrange 乘子法 公理库 拉格朗日乘子法 Lagrange multiplier method 约束极值处目标梯度位于约束梯度张成空间中的必要条件。 ,得到 w i = d i ( 1 + q i x i T λ ) 。代回校准方程可得线性方程组 公理库 线性方程组 System of linear equations 可写为矩阵方程 Ax=b 的有限个一次方程系统。
( ∑ S d i q i x i x i T ) λ = t x − ∑ S d i x i . 矩阵可逆时解唯一。若矩阵奇异,应先检验 t x 是否属于样本辅助向量的线性张成;不属于便无解,属于时可删去冗余约束再求解。可行时权重仍唯一,即使乘子表示不唯一:记二次目标为 Q ( w ) ,对满足乘子方程的可行 w ∗ 和任意另一可行 w ,交叉项由校准约束消去,故
Q ( w ) − Q ( w ∗ ) = 1 2 ∑ i ∈ S ( w i − w i ∗ ) 2 d i q i ≥ 0 , 等号只在 w = w ∗ 时成立。
估计总量为 t ^ c a l = ∑ S w i y i 。若 x i 含常数一,则校准同时令权重和等于已知总体人数。
直觉
原始HT 权重 公理库 Horvitz–Thompson 估计量 Horvitz-Thompson estimator 以逆纳入概率恢复总体总量,逐项证明设计无偏,并区分总量与方差估计的正概率要求。 来自实际抽取机会,校准再用总体已知信息调整其代表份额。调整力求小,约束则必须精确满足;这是一个带约束的估计构造。
当上述加权 Gram 矩阵可逆时,定义加权回归系数 B ^ = ( ∑ S d i q i x i x i T ) − 1 ∑ S d i q i x i y i ,代数整理给出
t ^ c a l = t ^ H T + ( t x − t ^ x , H T ) T B ^ . 辅助变量总量误差通过预测关系转成结果总量的修正。若总体上恰有 y i = x i T B ,校准约束立即给出 t ^ c a l = t x T B = t y 。一般资料中仍有残差,方差主要由那些残差的抽样波动决定。
例子与边界
总体四人的辅助值为 1 , 2 , 3 , 4 ,故人数为 4 、辅助总量为 10 。简单随机抽二人,恰抽到 x = 1 , 3 ,原权重均为二。对常数项与 x 同时校准,方程为
w 1 + w 3 = 4 , w 1 + 3 w 3 = 10 , 解为 w 1 = 1 , w 3 = 3 。若观察到的结果分别为 4 , 8 ,原 HT 总量是 24 ,校准总量是 1 × 4 + 3 × 8 = 28 。若全体结果确实满足 y = 2 + 2 x ,总体总量就是 2 × 4 + 2 × 10 = 28 ,本例恰被校准完全恢复。
再考虑另一个四人总体,辅助值为 ( 1 , 3 , 4 , 6 ) ,总量为 14 ,抽中的两人仍为 x = 1 , 3 。方程解变为 ( − 1 , 5 ) 。目标辅助均值 3.5 超出样本辅助值的凸包 [ 1 , 3 ] ,所以不存在满足约束的非负权重。二次距离允许负权重;若应用要求正权重,应检查可行性并选择相应距离、界或更合适的约束。
推论与应用
计算流程是:检查总体总量与样本辅助变量定义一致及约束相容,删除冗余约束,求解权重,再核对约束残差、权重范围和设计方差。稠密线性校准对 n 人、p 个辅助变量约需 O ( n p 2 + p 3 ) 。
校准是利用已知信息的估计调整,一般不保持有限样本精确无偏。方差应使用残差线性化或在每份复制权重中重新校准。若辅助总量本身也是估计值,其误差也要进入推断。
参考资料