形式陈述
设数据分成 G 个独立群,群内观测可以相关。第 g 群有响应向量 Y g 、设计矩阵 X g ∈ R n g × p ,总行数为 N = ∑ g n g 。拟合普通最小二乘
β ^ = H − 1 ∑ g X g T Y g , H = ∑ g X g T X g , 要求 H 可逆。令残差 u ^ g = Y g − X g β ^ ,群总得分 s ^ g = X g T u ^ g 。未作小样本修正的聚类稳健协方差 CR0 为
C ^ CR 0 = H − 1 ( ∑ g = 1 G s ^ g s ^ g T ) H − 1 . 这是sandwich 协方差 理路 Sandwich 协方差估计 Sandwich covariance estimation 从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。 应用于“每个独立群为一条观测”的具体计算。这里 H 和中间矩阵均采用求和约定;式子已经是 β ^ 的协方差估计,不能再随意除以 N 或 G 。若改用群平均 A ^ G = − H / G 、B ^ G = G − 1 ∑ g s ^ g s ^ g T ,则同一式子恰为 A ^ G − 1 B ^ G A ^ G − T / G 。
一组完整的充分条件
为避免把“独立群”误当成全部渐近假设,下面只证明一个较窄版本。设整个群资料 W g = ( n g , X g , Y g ) IID,维数 p 固定,群大小 1 ≤ n g ≤ m 且 m 固定。令 u g = Y g − X g β 0 ,s g = X g T u g 、H g = X g T X g 。假设
正 定 E s g = 0 , Q = E H g 正定 , E ‖ H g ‖ 2 < ∞ , E ‖ s g ‖ 2 < ∞ . 记 B = E ( s g s g T ) 。当 G → ∞ 时,
G ( β ^ − β 0 ) ⇒ N p ( 0 , Q − 1 B Q − 1 ) , G C ^ CR 0 → P Q − 1 B Q − 1 . 有限 G 的随机设计仍可能使 H 奇异。为陈述处处定义的渐近序列,可以在奇异事件上将估计量及协方差设为固定有限值;H / G → P Q 正定使该事件概率趋零,故这种延拓不改变极限。实际遇到奇异矩阵时,程序应报告无法拟合或无法构造该协方差,而不是返回延拓值充当成功结果。
群大小有界是这里的便捷充分设定,不是聚类稳健方法的普遍必要条件。群越来越大、群分布不同、少数群支配全部信息时,需要相应的三角阵列矩条件与非支配性证明,不能直接引用本版本。
为什么群总得分提供正确尺度
精确误差等式为
β ^ − β 0 = ( G − 1 ∑ g H g ) − 1 ( G − 1 ∑ g s g ) . 对 IID 群应用大数律 理路 强大数定律 Law of large numbers · Strong law of large numbers · SLLN 独立同分布且可积时,样本均值沿几乎每条无限样本路径收敛到共同期望。 ,第一项趋于 Q − 1 ,第二项趋零,先得一致性;对 s g 应用有限二阶矩的中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 ,得到正态极限。至于方差插件,s ^ g = s g − H g ( β ^ − β 0 ) 。外积差的群平均由常数倍的
‖ β ^ − β 0 ‖ G − 1 ∑ g ‖ H g ‖ ‖ s g ‖ + ‖ β ^ − β 0 ‖ 2 G − 1 ∑ g ‖ H g ‖ 2 控制,并依概率趋零。Cauchy–Schwarz 保证第一项的平均可积;再对固定 s g s g T 用大数律,即完成 G C ^ CR 0 的一致性。
直觉
一群人的残差可能一起偏高。应先把这一群对系数的推力加起来,再求外积;这样群内的交叉协方差被保留下来。若先对每行求平方再相加,就把这些交叉项删掉了。
这不是把群内相关性估计得非常准确。每个群往往只有一份资料,单群外积本来很粗糙;一致性来自很多独立群的平均。群内增加一千行,并不能替代增加独立群。
例子与边界
三个重复观测群的完整计算
只拟合截距。三个群各有两行,数据为 ( 0 , 0 ) 、( 2 , 2 ) 、( 4 , 4 ) 。共有六行,估计均值为2,H = 6 。各群残差和为 s ^ = ( − 4 , 0 , 4 ) ,所以
C ^ CR 0 = ( − 4 ) 2 + 0 2 + 4 2 6 2 = 8 9 . 若把六行误当独立,HC0 使用逐行残差平方和 4 + 4 + 0 + 0 + 4 + 4 = 16 ,方差变成 16 / 36 = 4 / 9 ,标准误少了一个 2 因子。此例只有三个群,计算CR0不表示渐近区间已经有可靠的小样本覆盖。
从总体看,若每群只是把独立的 U g 精确复制两次,均值等于 G − 1 ∑ g U g ,真实方差为 Var ( U g ) / G 。复制行没有增加信息。整群抽样与设计效应 理路 整群抽样与设计效应 Cluster sampling · Design effect 用簇内协方差解释整群抽样的精度,区分常用设计效应近似与有限总体精确比较。 讨论均值方差中的相同协方差机制;本页进一步把它落实为任意固定维回归的群得分外积和插件计算。
不等群大小先确定目标
纯截距的行加权OLS为 ∑ g ∑ i Y g i / ∑ g n g 。在上述IID群及矩条件下,它估计 E ( ∑ i Y g i ) / E ( n g ) ,未必等于等权群均值的期望 E ( n g − 1 ∑ i Y g i ) 。例如两类群各占一半:一类大小1、结局恒为0,另一类大小2、结局都为10。行加权目标为 10 / ( 3 / 2 ) = 20 / 3 ,等权群目标为5。采用哪种权重改变了科学目标,方差修正不能替你作这个选择。
聚类方差不必更大
若同一群两条标量残差为 ( a , − a ) ,在纯截距问题中该群总得分为零,对CR0没有贡献;逐行平方却给 2 a 2 。因此群内负相关可以降低均值方差,不能把“稳健”解释成“每次都保守地放大标准误”。
把所有行合成一个群会得到零
OLS 正规方程使 ∑ g s ^ g = X T u ^ = 0 。若不加依据地把所有行当成一个群,中间矩阵就是 0 ⋅ 0 T ,软件可能给出零协方差。这个零来自只有一个群时失去可重复的群间变化,不是参数被精确估计。
更一般地,G 个群得分向量之和为零,因此它们的线性张成空间至多为 G − 1 维,故
rank ( C ^ CR 0 ) ≤ min ( p , G − 1 ) . 即使 X 满列秩,只要 G ≤ p ,这个协方差矩阵也必奇异。点估计可识别与现有独立群能否支持某个多参数 Wald 反演,是两个不同检查。
推论与应用
执行时先依据抽样或误差结构确定群标识,再拟合模型并保留每行残差;逐群累积 X g T u ^ g ,随后累计外积。已给定拟合系数时,形成群得分约需 O ( N p ) ,形成群外积需 O ( G p 2 ) ,累积 H 需 O ( N p 2 ) ,最后矩阵分解需 O ( p 3 ) ;可以逐群处理,存储不必随 N 增长。
报告须包括总行数 N 、独立群数 G 、群大小分布、分组理由、方差修正及分位数约定。自由度乘子或使用 t G − 1 是额外校准选择,不因用了 CR0 就具有有限样本精确性;群数很少时应采用有依据的专门分析,不能给一个万能“足够群数”阈值。
本页是随机独立群的模型型推断。有限总体的分层、多阶段或不放回抽样还要保留设计权重与纳入概率;已有调查重复权重方差估计 理路 调查重复权重方差估计 Replicate weights · Survey replication variance 让替代权重重现复杂抽样的随机结构,完整重算估计并按方案规定汇总方差。 并不等于无权回归上简单添加一个群标签。若群间还有时间或空间依赖,本页条件也未覆盖。
自测与答案
每群仅有一行时,CR0变成什么?答案:群得分就是行得分,公式恰变成HC0。
p = 5 、G = 4 ,设计矩阵满列秩,能否反演完整五维CR0做普通Wald椭球?答案:不能,协方差秩至多3。广义逆选出一个数不等于五维正态校准成立。
非线性均值还需要先定义簇得分
若响应是重复二元回答或计数,本页的 X g T ( Y g − X g β ) 不再自动是所需方程。广义估计方程 理路 广义估计方程 Generalized estimating equations · GEE · Fixed-working-correlation GEE 在独立重复观测簇上解固定工作相关的非线性边际均值方程,区分期望敏感度、观测导数与稳健协方差。 用均值导数与预定工作协方差形成 D g T V g − 1 ( Y g − μ g ) ,先重新求非线性根,再按独立簇累计外积。它还区分期望敏感度与观测 Jacobian;只给已有 OLS 协方差换一个名称,并没有完成这个接口。
参考资料