形式陈述
一个解释变量可能同时受到未观测结果原因的影响。例如价格和销量共同响应需求冲击,此时把销量直接对价格回归,未必能得到结构需求斜率。两阶段最小二乘先从解释变量中提取工具能够线性预测的部分,再用这部分变化拟合结果。计算上的两次最小二乘 理路 最小二乘与正规方程 Least squares · Normal equations 将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。 有明确闭式;工具为什么可信,则仍需另给模型依据。
确定资料上的算法定义
给定Y ∈ R n 、结构设计X ∈ R n × p 与工具设计Z ∈ R n × q 。以下要求q ≥ p ≥ 1 、rank Z = q 以及rank ( Z T X ) = p 。需要截距时应明确放进设计;算法不会偷偷中心化资料。
第一阶段把X 的每一列对同一个Z 回归,得到
X ^ = P Z X , P Z = Z ( Z T Z ) − 1 Z T . 第二阶段把Y 对X ^ 回归。由投影 理路 正交投影 Orthogonal projection 把向量映到子空间上最近点并使误差与子空间正交的线性算子。 的对称与幂等性,
(1) β ^ 2 SLS = ( X ^ T X ^ ) − 1 X ^ T Y = ( X T P Z X ) − 1 X T P Z Y . 秩条件保证X ^ 满列秩,因而系数唯一。式(1)也唯一最小化
(2) ‖ P Z ( Y − X b ) ‖ 2 = ( Y − X b ) T P Z ( Y − X b ) . 这拟合的是结构残差在工具空间中的分量;剩余正交分量不在该准则内。若q = p ,方阵Z T X 可逆,式(1)简化为( Z T X ) − 1 Z T Y ,使全部样本工具矩归零。q > p 时通常只能使它们的加权组合归零。
结构矩模型与渐近协方差
现在另外规定抽样模型。行资料( Y i , X i , Z i ) 独立同分布,固定p , q ,其中X i ∈ R p 、Z i ∈ R q 是列向量,
(3) Y i = X i T β 0 + u i , E ( Z i u i ) = 0. 允许E ( X i u i ) ≠ 0 ,也不要求E ( u i ∣ X i ) = 0 。因此这里的结构方程不能不加条件地当成普通回归的条件均值模型。工具条件只是已声明的矩限制,不能由数据里有一列名为“工具”的变量获得。
令Q Z Z = E ( Z i Z i T ) 正定 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 ,Q Z X = E ( Z i X i T ) 满列秩。要求这些矩有限,Ω = E ( Z i Z i T u i 2 ) 有限;为直接保证下述协方差插件一致,再要求E ( ‖ Z i ‖ 2 ‖ X i ‖ 2 ) < ∞ 。记
H = Q Z X T Q Z Z − 1 Q Z X , A = H − 1 Q Z X T Q Z Z − 1 . 在秩失败的有限样本上任意定义一个有限延拓,可使估计成为随机序列;实际程序仍应报告该失败,不能当作有效估计。由于样本矩阵趋于上述满秩极限,失败概率趋零,并且
(4) n ( β ^ 2 SLS − β 0 ) ⇒ N p ( 0 , A Ω A T ) . 这是一条分布收敛 理路 依分布收敛 Convergence in distribution · Weak convergence 分布函数在极限分布连续点处收敛的随机变量收敛概念。 结论,极限为p 维多元正态分布 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ;不把有限样本系数的分布同时断言为正态。
证明可以直接使用线性GMM 理路 广义矩估计 Generalized method of moments · GMM · 广义矩方法 在多于参数的矩约束之间作有尺度的最小距离折中,证明权重效率并用剩余投影方向构造过度识别检验。 。取g i ( b ) = Z i ( Y i − X i T b ) 以及W n = ( Z T Z / n ) − 1 ,则GMM准则恰为式(2)除以n ;两者在每份合法资料上相同。具体地,若A n 由相应样本平均代入A ,就有精确等式
β ^ − β 0 = A n 1 n ∑ i Z i u i . 大数律使A n → P A ,工具矩的有限二阶矩给中心极限定理,便得到式(4)。这个线性证明无需先把参数域压到紧集。
标准误要回到原结构残差
计算u ^ i = Y i − X i T β ^ ,令B n = X T P Z X 。按求和约定,HC0型夹心协方差 理路 Sandwich 协方差估计 Sandwich covariance estimation 从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。 为
(5) C ^ = B n − 1 X T Z ( Z T Z ) − 1 ( ∑ i Z i Z i T u ^ i 2 ) ( Z T Z ) − 1 Z T X B n − 1 . 它估计β ^ 的协方差,已经含有1 / n 尺度,不能再除一次n 。等价地,用第一阶段拟合行X ^ i 写作B n − 1 ∑ i X ^ i X ^ i T u ^ i 2 B n − 1 。
插件一致性仍要处理拟合参数。写d = ‖ β ^ − β 0 ‖ ,则中间矩阵除以n 后与真误差版本的差,范数不超过
2 d P n ( ‖ Z ‖ 2 | u | ‖ X ‖ ) + d 2 P n ( ‖ Z ‖ 2 ‖ X ‖ 2 ) . 由给出的矩条件和Cauchy–Schwarz,两项平均稳定,d → P 0 ,故差趋零。因此n C ^ → P A Ω A T ;具有正极限方差的预定线性对比可渐近学生化。
第二阶段软件默认使用的残差却是
(6) v ^ = Y − X ^ β ^ = u ^ + ( X − X ^ ) β ^ . 后项是未被工具预测的结构信号,不是原模型的误差。仅把两阶段软件打印的普通标准误抄下来,通常并不等于式(5)。
例子与边界
同样的系数,两种残差相差很大
取四行资料
X = ( 1 0 0 − 1 0 0 1 1 ) , Z = ( 1 / 2 0 − 1 1 / 2 0 0 1 / 2 1 0 1 / 2 1 1 ) , Y = ( 3 / 2 − 5 / 2 − 3 / 2 9 / 2 ) . 以下四个列向量组成正交规范基:
e 1 = 1 2 ( 1 , 1 , 1 , 1 ) T , e 2 = 1 2 ( − 1 , − 1 , 1 , 1 ) T , e 3 = 1 2 ( − 1 , 1 , − 1 , 1 ) T , e 4 = 1 2 ( 1 , − 1 , − 1 , 1 ) T . 工具列为e 1 , e 1 + e 2 , e 2 + e 3 ,所以它们虽不正交,仍张成前三个方向。结构列为e 1 + e 4 , e 2 + e 4 ,结果为e 1 + 2 e 2 + e 3 + 5 e 4 。投影以后X ^ = ( e 1 , e 2 ) ,故B n = I 2 、β ^ = ( 1 , 2 ) T ;直接OLS却给( 5 / 3 , 8 / 3 ) T 。
结构残差与第二阶段残差分别是
u ^ = e 3 + 2 e 4 = ( 1 / 2 , − 1 / 2 , − 3 / 2 , 3 / 2 ) T , v ^ = e 3 + 5 e 4 = ( 2 , − 2 , − 3 , 3 ) T . 以X ^ 为两侧设计,正确使用u ^ i 2 得到
C ^ = ( 5 / 4 1 1 5 / 4 ) , 若误把v ^ i 2 塞入同一HC0式,则得到( 13 / 2 5 / 2 5 / 2 13 / 2 ) 。差别不是舍入造成的,而是估计了不同残差的二阶量。四行小表验证公式;它没有提供四行就能得到可靠正态区间的保证。
同方差只简化一部分责任
如果另有E ( u i 2 ∣ Z i ) = σ 2 ,则Ω = σ 2 Q Z Z ,式(4)化为σ 2 H − 1 。还需例如E X i X i T 有限和E u i 2 < ∞ 来保证结构残差平方平均一致估计σ 2 ;相应协方差近似为σ ^ 2 B n − 1 。
这仍通常是渐近推断。内生X 可能透露u ,所以“误差在总体中正态”不等于“给定X 后仍独立同方差正态”。要作未知尺度的精确高斯反演,可读Anderson–Rubin检验 理路 Anderson–Rubin检验与反演 Anderson–Rubin test · Anderson-Rubin confidence set · AR test inversion 把候选结构系数移到响应左边,在固定高斯工具实验中作精确F检验,并保留全部未拒绝系数而不除以首阶段。 ,它在真值处直接处理Y − b X ,不以2SLS系数条件正态为依据。
秩与模型解释
如果Z T X 失去列秩,式(2)沿某些系数方向完全不变,无法返回唯一系数。可逆但很病态也不是成功的统计诊断:固定总体极限满秩的式(4)不保证弱工具序列上的正态近似。
二元工具的LATE定理 理路 工具变量识别 Instrumental variable identification · IV identification · LATE identification 在随机工具、排除限制、单调性与相关性条件下,由 Wald 比率识别服从者局部平均效应。 另外要求潜在结果独立、排除限制、单调性等,并确定特定顺从者人群。式(1)单独没有这些因果内容,也不把任何多工具或异质效应模型自动变成同一个ATE。
推论与应用
工具换基不改变估计
对可逆q × q 矩阵C ,Z C 与Z 张成同一列空间,直接代入也得到P Z C = P Z 。所以X ^ 、系数、结构残差、式(5)与投影准则都不变。反过来,增加一个不在原空间内的工具确实会改变投影;新增列是否满足矩条件必须重查。
若工具列有重复,可先用秩揭示分解选出同一空间的独立基,再应用本页。删除冗余列是明确的预处理,不能在报告中一面声称满列秩、一面悄悄用广义逆跳过检查。
实施顺序与成本
先核对资料行对齐、截距和工具角色;对Z 作薄QR得到正交基Q Z ,再计算Q Z T X 与Q Z T Y 并解最小二乘,无需显式形成n × n 的P Z 。最后回原X 计算u ^ 并形成式(5)。密集实现的主要算术成本为O ( n q 2 + n q p + q p 2 + p 3 ) ,形成HC0中项再需O ( n p 2 ) ;储存薄设计约O ( n ( q + p ) ) 。这是固定矩阵求解成本,不包括工具选择和模型验证。
矩约束与反演的迁移验收 要求以两套工具基独立复算此例,同时报告原结构残差、投影残差及两种错误标准误的来源。最终交付应让读者分清:哪些等式对这一张表精确成立,哪些推断还需要重复抽样条件。