Skip to content

方法Method

聚类稳健协方差估计

Cluster-robust covariance estimation · CR0 covariance

把独立群的总得分作为方差单位,计算回归 CR0 并识别少群、错误分组和秩不足的边界。

形式陈述 ​

设数据分成 G 个独立群,群内观测可以相关。第 g 群有响应向量 Yg、设计矩阵 Xg∈Rng×p,总行数为 N=∑gng。拟合普通最小二乘

β^=H−1∑gXgTYg,H=∑gXgTXg,

要求 H 可逆。令残差 u^g=Yg−Xgβ^,群总得分 s^g=XgTu^g。未作小样本修正的聚类稳健协方差 CR0 为

C^CR0=H−1(∑g=1Gs^gs^gT)H−1.

这是sandwich 协方差应用于“每个独立群为一条观测”的具体计算。这里 H 和中间矩阵均采用求和约定;式子已经是 β^ 的协方差估计,不能再随意除以 N 或 G。若改用群平均 A^G=−H/G、B^G=G−1∑gs^gs^gT,则同一式子恰为 A^G−1B^GA^G−T/G。

一组完整的充分条件 ​

为避免把“独立群”误当成全部渐近假设,下面只证明一个较窄版本。设整个群资料 Wg=(ng,Xg,Yg) IID,维数 p 固定,群大小 1≤ng≤m 且 m 固定。令 ug=Yg−Xgβ0,sg=XgTug、Hg=XgTXg。假设

Esg=0,Q=EHg 正定,E‖Hg‖2<∞,E‖sg‖2<∞.

记 B=E(sgsgT)。当 G→∞ 时,

G(β^−β0)⇒Np(0,Q−1BQ−1),GC^CR0→PQ−1BQ−1.

有限 G 的随机设计仍可能使 H 奇异。为陈述处处定义的渐近序列,可以在奇异事件上将估计量及协方差设为固定有限值;H/G→PQ 正定使该事件概率趋零,故这种延拓不改变极限。实际遇到奇异矩阵时,程序应报告无法拟合或无法构造该协方差,而不是返回延拓值充当成功结果。

群大小有界是这里的便捷充分设定,不是聚类稳健方法的普遍必要条件。群越来越大、群分布不同、少数群支配全部信息时,需要相应的三角阵列矩条件与非支配性证明,不能直接引用本版本。

为什么群总得分提供正确尺度 ​

精确误差等式为

β^−β0=(G−1∑gHg)−1(G−1∑gsg).

对 IID 群应用大数律,第一项趋于 Q−1,第二项趋零,先得一致性;对 sg 应用有限二阶矩的中心极限定理,得到正态极限。至于方差插件,s^g=sg−Hg(β^−β0)。外积差的群平均由常数倍的

‖β^−β0‖G−1∑g‖Hg‖‖sg‖+‖β^−β0‖2G−1∑g‖Hg‖2

控制,并依概率趋零。Cauchy–Schwarz 保证第一项的平均可积;再对固定 sgsgT 用大数律,即完成 GC^CR0 的一致性。

直觉

一群人的残差可能一起偏高。应先把这一群对系数的推力加起来,再求外积;这样群内的交叉协方差被保留下来。若先对每行求平方再相加,就把这些交叉项删掉了。

这不是把群内相关性估计得非常准确。每个群往往只有一份资料,单群外积本来很粗糙;一致性来自很多独立群的平均。群内增加一千行,并不能替代增加独立群。

例子与边界

三个重复观测群的完整计算 ​

只拟合截距。三个群各有两行,数据为 (0,0)、(2,2)、(4,4)。共有六行,估计均值为2,H=6。各群残差和为 s^=(−4,0,4),所以

C^CR0=(−4)2+02+4262=89.

若把六行误当独立,HC0 使用逐行残差平方和 4+4+0+0+4+4=16,方差变成 16/36=4/9,标准误少了一个 2 因子。此例只有三个群,计算CR0不表示渐近区间已经有可靠的小样本覆盖。

从总体看,若每群只是把独立的 Ug 精确复制两次,均值等于 G−1∑gUg,真实方差为 Var(Ug)/G。复制行没有增加信息。整群抽样与设计效应讨论均值方差中的相同协方差机制;本页进一步把它落实为任意固定维回归的群得分外积和插件计算。

不等群大小先确定目标 ​

纯截距的行加权OLS为 ∑g∑iYgi/∑gng。在上述IID群及矩条件下,它估计 E(∑iYgi)/E(ng),未必等于等权群均值的期望 E(ng−1∑iYgi)。例如两类群各占一半:一类大小1、结局恒为0,另一类大小2、结局都为10。行加权目标为 10/(3/2)=20/3,等权群目标为5。采用哪种权重改变了科学目标,方差修正不能替你作这个选择。

聚类方差不必更大 ​

若同一群两条标量残差为 (a,−a),在纯截距问题中该群总得分为零,对CR0没有贡献;逐行平方却给 2a2。因此群内负相关可以降低均值方差,不能把“稳健”解释成“每次都保守地放大标准误”。

把所有行合成一个群会得到零 ​

OLS 正规方程使 ∑gs^g=XTu^=0。若不加依据地把所有行当成一个群,中间矩阵就是 0⋅0T,软件可能给出零协方差。这个零来自只有一个群时失去可重复的群间变化,不是参数被精确估计。

更一般地,G 个群得分向量之和为零,因此它们的线性张成空间至多为 G−1 维,故

rank(C^CR0)≤min(p,G−1).

即使 X 满列秩,只要 G≤p,这个协方差矩阵也必奇异。点估计可识别与现有独立群能否支持某个多参数 Wald 反演,是两个不同检查。

推论与应用

执行时先依据抽样或误差结构确定群标识,再拟合模型并保留每行残差;逐群累积 XgTu^g,随后累计外积。已给定拟合系数时,形成群得分约需 O(Np),形成群外积需 O(Gp2),累积 H 需 O(Np2),最后矩阵分解需 O(p3);可以逐群处理,存储不必随 N 增长。

报告须包括总行数 N、独立群数 G、群大小分布、分组理由、方差修正及分位数约定。自由度乘子或使用 tG−1 是额外校准选择,不因用了 CR0 就具有有限样本精确性;群数很少时应采用有依据的专门分析,不能给一个万能“足够群数”阈值。

本页是随机独立群的模型型推断。有限总体的分层、多阶段或不放回抽样还要保留设计权重与纳入概率;已有调查重复权重方差估计并不等于无权回归上简单添加一个群标签。若群间还有时间或空间依赖,本页条件也未覆盖。

自测与答案 ​

  1. 每群仅有一行时,CR0变成什么?答案:群得分就是行得分,公式恰变成HC0。
  2. p=5、G=4,设计矩阵满列秩,能否反演完整五维CR0做普通Wald椭球?答案:不能,协方差秩至多3。广义逆选出一个数不等于五维正态校准成立。

非线性均值还需要先定义簇得分 ​

若响应是重复二元回答或计数,本页的 XgT(Yg−Xgβ) 不再自动是所需方程。广义估计方程用均值导数与预定工作协方差形成 DgTVg−1(Yg−μg),先重新求非线性根,再按独立簇累计外积。它还区分期望敏感度与观测 Jacobian;只给已有 OLS 协方差换一个名称,并没有完成这个接口。

参考资料
  • A. Colin Cameron 与 Douglas L. Miller,A Practitioner’s Guide to Cluster-Robust Inference,2015,§II.A、§II.C,式(7)–(11),印刷第323–324页(PDF第7–8页):群得分外积协方差;§VI讨论少群问题。本文以有界群大小的IID群给出自包含充分条件和证明,不调用长面板推广。
关系图谱9 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系