Skip to content

方法Method

两阶段最小二乘

Two-stage least squares · 2SLS · TSLS

先用工具变量投影解释变量,再估计结构系数,区分两阶段相同的点估计与必须使用原结构残差的推断。

形式陈述 ​

一个解释变量可能同时受到未观测结果原因的影响。例如价格和销量共同响应需求冲击,此时把销量直接对价格回归,未必能得到结构需求斜率。两阶段最小二乘先从解释变量中提取工具能够线性预测的部分,再用这部分变化拟合结果。计算上的两次最小二乘有明确闭式;工具为什么可信,则仍需另给模型依据。

确定资料上的算法定义 ​

给定Y∈Rn、结构设计X∈Rn×p与工具设计Z∈Rn×q。以下要求q≥p≥1、rankZ=q以及rank(ZTX)=p。需要截距时应明确放进设计;算法不会偷偷中心化资料。

第一阶段把X的每一列对同一个Z回归,得到

X^=PZX,PZ=Z(ZTZ)−1ZT.

第二阶段把Y对X^回归。由投影的对称与幂等性,

(1)β^2SLS=(X^TX^)−1X^TY=(XTPZX)−1XTPZY.

秩条件保证X^满列秩,因而系数唯一。式(1)也唯一最小化

(2)‖PZ(Y−Xb)‖2=(Y−Xb)TPZ(Y−Xb).

这拟合的是结构残差在工具空间中的分量;剩余正交分量不在该准则内。若q=p,方阵ZTX可逆,式(1)简化为(ZTX)−1ZTY,使全部样本工具矩归零。q>p时通常只能使它们的加权组合归零。

结构矩模型与渐近协方差 ​

现在另外规定抽样模型。行资料(Yi,Xi,Zi)独立同分布,固定p,q,其中Xi∈Rp、Zi∈Rq是列向量,

(3)Yi=XiTβ0+ui,E(Ziui)=0.

允许E(Xiui)≠0,也不要求E(ui∣Xi)=0。因此这里的结构方程不能不加条件地当成普通回归的条件均值模型。工具条件只是已声明的矩限制,不能由数据里有一列名为“工具”的变量获得。

令QZZ=E(ZiZiT)正定,QZX=E(ZiXiT)满列秩。要求这些矩有限,Ω=E(ZiZiTui2)有限;为直接保证下述协方差插件一致,再要求E(‖Zi‖2‖Xi‖2)<∞。记

H=QZXTQZZ−1QZX,A=H−1QZXTQZZ−1.

在秩失败的有限样本上任意定义一个有限延拓,可使估计成为随机序列;实际程序仍应报告该失败,不能当作有效估计。由于样本矩阵趋于上述满秩极限,失败概率趋零,并且

(4)n(β^2SLS−β0)⇒Np(0,AΩAT).

这是一条分布收敛结论,极限为p维多元正态分布;不把有限样本系数的分布同时断言为正态。

证明可以直接使用线性GMM。取gi(b)=Zi(Yi−XiTb)以及Wn=(ZTZ/n)−1,则GMM准则恰为式(2)除以n;两者在每份合法资料上相同。具体地,若An由相应样本平均代入A,就有精确等式

β^−β0=An1n∑iZiui.

大数律使An→PA,工具矩的有限二阶矩给中心极限定理,便得到式(4)。这个线性证明无需先把参数域压到紧集。

标准误要回到原结构残差 ​

计算u^i=Yi−XiTβ^,令Bn=XTPZX。按求和约定,HC0型夹心协方差为

(5)C^=Bn−1XTZ(ZTZ)−1(∑iZiZiTu^i2)(ZTZ)−1ZTXBn−1.

它估计β^的协方差,已经含有1/n尺度,不能再除一次n。等价地,用第一阶段拟合行X^i写作Bn−1∑iX^iX^iTu^i2Bn−1。

插件一致性仍要处理拟合参数。写d=‖β^−β0‖,则中间矩阵除以n后与真误差版本的差,范数不超过

2dPn(‖Z‖2|u|‖X‖)+d2Pn(‖Z‖2‖X‖2).

由给出的矩条件和Cauchy–Schwarz,两项平均稳定,d→P0,故差趋零。因此nC^→PAΩAT;具有正极限方差的预定线性对比可渐近学生化。

第二阶段软件默认使用的残差却是

(6)v^=Y−X^β^=u^+(X−X^)β^.

后项是未被工具预测的结构信号,不是原模型的误差。仅把两阶段软件打印的普通标准误抄下来,通常并不等于式(5)。

直觉

第一阶段留下的是工具空间内的变化,第二阶段据此解系数。两阶段的分工是计算方法,不是两份独立样本:X^也由同一份资料估计,不能把它当成外部固定的无噪声解释变量,然后自动套普通回归全部条件分布。

工具有效性保护的是E(Zu)=0;工具相关性保证QZX能区分参数。两者缺一不可。大量有效却完全不预测结构变量的工具,不能靠列数制造识别;预测很强但直接受结构误差影响的工具,则可能稳定估计错误目标。

例子与边界

同样的系数,两种残差相差很大 ​

取四行资料

X=(100−10011),Z=(1/20−11/2001/2101/211),Y=(3/2−5/2−3/29/2).

以下四个列向量组成正交规范基:

e1=12(1,1,1,1)T,e2=12(−1,−1,1,1)T,e3=12(−1,1,−1,1)T,e4=12(1,−1,−1,1)T.

工具列为e1,e1+e2,e2+e3,所以它们虽不正交,仍张成前三个方向。结构列为e1+e4,e2+e4,结果为e1+2e2+e3+5e4。投影以后X^=(e1,e2),故Bn=I2、β^=(1,2)T;直接OLS却给(5/3,8/3)T。

结构残差与第二阶段残差分别是

u^=e3+2e4=(1/2,−1/2,−3/2,3/2)T,v^=e3+5e4=(2,−2,−3,3)T.

以X^为两侧设计,正确使用u^i2得到

C^=(5/4115/4),

若误把v^i2塞入同一HC0式,则得到(13/25/25/213/2)。差别不是舍入造成的,而是估计了不同残差的二阶量。四行小表验证公式;它没有提供四行就能得到可靠正态区间的保证。

同方差只简化一部分责任 ​

如果另有E(ui2∣Zi)=σ2,则Ω=σ2QZZ,式(4)化为σ2H−1。还需例如EXiXiT有限和Eui2<∞来保证结构残差平方平均一致估计σ2;相应协方差近似为σ^2Bn−1。

这仍通常是渐近推断。内生X可能透露u,所以“误差在总体中正态”不等于“给定X后仍独立同方差正态”。要作未知尺度的精确高斯反演,可读Anderson–Rubin检验,它在真值处直接处理Y−bX,不以2SLS系数条件正态为依据。

秩与模型解释 ​

如果ZTX失去列秩,式(2)沿某些系数方向完全不变,无法返回唯一系数。可逆但很病态也不是成功的统计诊断:固定总体极限满秩的式(4)不保证弱工具序列上的正态近似。

二元工具的LATE定理另外要求潜在结果独立、排除限制、单调性等,并确定特定顺从者人群。式(1)单独没有这些因果内容,也不把任何多工具或异质效应模型自动变成同一个ATE。

推论与应用

工具换基不改变估计 ​

对可逆q×q矩阵C,ZC与Z张成同一列空间,直接代入也得到PZC=PZ。所以X^、系数、结构残差、式(5)与投影准则都不变。反过来,增加一个不在原空间内的工具确实会改变投影;新增列是否满足矩条件必须重查。

若工具列有重复,可先用秩揭示分解选出同一空间的独立基,再应用本页。删除冗余列是明确的预处理,不能在报告中一面声称满列秩、一面悄悄用广义逆跳过检查。

实施顺序与成本 ​

先核对资料行对齐、截距和工具角色;对Z作薄QR得到正交基QZ,再计算QZTX与QZTY并解最小二乘,无需显式形成n×n的PZ。最后回原X计算u^并形成式(5)。密集实现的主要算术成本为O(nq2+nqp+qp2+p3),形成HC0中项再需O(np2);储存薄设计约O(n(q+p))。这是固定矩阵求解成本,不包括工具选择和模型验证。

矩约束与反演的迁移验收要求以两套工具基独立复算此例,同时报告原结构残差、投影残差及两种错误标准误的来源。最终交付应让读者分清:哪些等式对这一张表精确成立,哪些推断还需要重复抽样条件。

参考资料
  • Victor Chernozhukov与Iván Fernández-Val,Structural Equations Models and GMM,MIT14.382,2017,§4和§5.1,PDF pp.10–14。线性矩展开及典范工具权重产生2SLS;一般异方差下它不一定是最优GMM。
  • 同作者,Structural Equations Models and IV, Take 1,§2,PDF pp.4–9。结构参数、投影系数与弱首阶段的区别。本文的四行反例、结构残差插件界和全部矩阵由所列资料直接推导。
关系图谱25 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系