矩约束与反演:从拟合方向到接受集合
返回学习路线 。本页在GMM 理路 广义矩估计 Generalized method of moments · GMM · 广义矩方法 在多于参数的矩约束之间作有尺度的最小距离折中,证明权重效率并用剩余投影方向构造过度识别检验。 、2SLS 理路 两阶段最小二乘 Two-stage least squares · 2SLS · TSLS 先用工具变量投影解释变量,再估计结构系数,区分两阶段相同的点估计与必须使用原结构残差的推断。 、均值经验似然 理路 均值的经验似然 Empirical likelihood for a mean · Mean empirical likelihood · 均值经验似然 把概率质量放在已观察到的点上,以均值约束优化似然比,证明乘子唯一性、有限方差卡方极限及经验支持造成的小样本边界。 与AR反演 理路 Anderson–Rubin检验与反演 Anderson–Rubin test · Anderson-Rubin confidence set · AR test inversion 把候选结构系数移到响应左边,在固定高斯工具实验中作精确F检验,并保留全部未拒绝系数而不除以首阶段。 的条件之内完成四项迁移。先写模型允许什么,再计算系数或集合;最后分别标注有限表恒等式、有限样本分布与渐近保证。
下载标准库复算程序 与精确结果 。程序使用有理算术检查矩阵、有限表和不等式;渐近定理与高斯投影律仍由正文证明。
任务一、二的矩阵条件使用正定性 ,系数的大样本结论则用分布收敛 趋向多元正态分布 ;这不要求原始资料本身正态。
任务三的经验似然采用卡方极限 。
任务四不同:其精确AR校准把联合正态误差作为模型输入,并使用F分布 的临界分位数;需要这些概念时可先沿链接复习,再分别核对有限样本与渐近保证。
任务一:矩换坐标以后,哪个权重才是同一个问题?
设三维IID观测的均值为D θ ,D 的三行为( 1 , 0 ) , ( 0 , 1 ) , ( 1 , 1 ) ,协方差Σ = diag ( 1 , 4 , 1 ) 。当前样本均值为y = ( 1 , 2 , 4 ) T 。将观测统一变换为T ′ = C T ,其中
C = ( 1 1 0 0 1 1 0 0 1 ) . 求新均值设计、协方差及有效权重。核对有效估计和方差是否改变;若错误地继续使用单位权重,算出另一系数。然后判断:真实均值多出D ( 1 , − 1 ) T 时,J检验能发现这份偏移吗?
完整答案
变换后
y ′ = ( 3 , 6 , 4 ) T , D ′ = ( 1 1 1 2 1 1 ) , Σ ′ = ( 5 4 0 4 5 1 0 1 1 ) . 新协方差不再对角,逆矩阵为
( Σ ′ ) − 1 = ( 1 − 1 1 − 1 5 / 4 − 5 / 4 1 − 5 / 4 9 / 4 ) = C − T Σ − 1 C − 1 . 对每个b ,新旧加权残差平方严格相等。故两边都给
θ ^ ∗ = ( 7 / 6 , 8 / 3 ) T , V ∗ = ( D T Σ − 1 D ) − 1 = ( 5 / 6 − 2 / 3 − 2 / 3 4 / 3 ) , J n = n / 6. 这是同一组资料的坐标不变性。若在新坐标中误用I 3 ,系数变成( 1 , 5 / 2 ) T ;原坐标的单位权重系数则为( 4 / 3 , 7 / 3 ) T 。两者都不是有效估计,且彼此也不相同,因为所谓“各矩同权”依赖矩的坐标。
原单位权重的n 倍协方差为V I = ( 1 − 1 − 1 2 ) 。对任意对比v = ( v 1 , v 2 ) ,
v T ( V I − V ∗ ) v = ( v 1 − 2 v 2 ) 2 / 6 ≥ 0. 只有与( 1 , − 2 ) 正交的对比在这组比较中方差不变。这里比较的是抽样协方差,不能凭这张表宣布有效估计离未知真值更近。
偏移D ( 1 , − 1 ) T = ( 1 , − 1 , 0 ) T 仍在模型列空间内。它完全等价于把参数改为θ + ( 1 , − 1 ) ,因此J的残余投影不变,无法检出。与之相对,v = ( − 1 , − 4 , 1 ) T 满足D T Σ − 1 v = 0 ,其有效残差平方为v T Σ − 1 v = 6 ;固定总体偏移v 会留下这份不能拟合的冲突,使J n / n → 6 。这说明J检验只检查剩余矩方向。
任务二:可逆换工具基与删除工具,为什么结果不同?
使用正文的四行X , Z , Y :
X = ( 1 0 0 − 1 0 0 1 1 ) , Z = ( 1 / 2 0 − 1 1 / 2 0 0 1 / 2 1 0 1 / 2 1 1 ) , Y = ( 3 / 2 , − 5 / 2 , − 3 / 2 , 9 / 2 ) T . 先令Z ′ = Z C ,C 取任务一的可逆矩阵,复算点估计与HC0。再比较两种删除:仅保留原Z 的第1、2列;仅保留第1、3列。哪个操作只换坐标,哪个操作改变实际信息?
完整答案
令e 1 , e 2 , e 3 , e 4 为2SLS页给出的四维正交规范基。原Z 的三列为e 1 , e 1 + e 2 , e 2 + e 3 ,所以P Z 保留前三个方向。结构设计列为e 1 + e 4 , e 2 + e 4 ,而Y = e 1 + 2 e 2 + e 3 + 5 e 4 。
可逆换基不改变列空间,所以P Z ′ = P Z 。两套工具基均给β ^ = ( 1 , 2 ) 、u ^ = ( 1 / 2 , − 1 / 2 , − 3 / 2 , 3 / 2 ) 与
C ^ = ( 5 / 4 1 1 5 / 4 ) . 第二阶段残差为( 2 , − 2 , − 3 , 3 ) ,误把它代入会得到( 13 / 2 5 / 2 5 / 2 13 / 2 ) 。换工具基不应改变这种错误的数值,但不变性本身不能把错误残差变正确。
只保留第1、2列时,工具空间变成span ( e 1 , e 2 ) 。X 原本在工具空间内的两列仍是e 1 , e 2 ,所以系数和结构残差保持不变。减少的e 3 方向只承载额外拟合冲突,这次删除并未改变点估计。此时q = p = 2 ,已没有GMM中的额外检验自由度。
只保留第1、3列时,空间变成span ( e 1 , e 2 + e 3 ) 。第二结构列的投影是( e 2 + e 3 ) / 2 ,Y 在该方向的投影是3 ( e 2 + e 3 ) / 2 ,因此系数改成( 1 , 3 ) 。结构残差为
Y − X ( 1 , 3 ) T = ( 1 / 2 , 1 / 2 , − 3 / 2 , 1 / 2 ) T . 投影准则此时能把两个工具矩都归零,却改变了最终系数。这并不与原三工具估计矛盾;它们在同一小样本中最小化不同投影准则。删除工具是否改善总体推断,还需要有效性、识别与抽样方差的理论,不能由一次系数变化判断。
任务三:真均值本身是一个原子,会怎样改变经验支持失败?
总体取值与概率为
P ( X = − 1 ) = 1 / 2 , P ( X = 0 ) = 1 / 4 , P ( X = 2 ) = 1 / 4. 独立观察三次。真均值为0、方差为3 / 2 。对每张表计算均值0的经验似然,并求通常95%卡方校准的精确覆盖。全零表应不应该与“只见到正侧或负侧”的表一起拒绝?
完整答案
记− 1 , 0 , 2 的出现次数为a , b , c ,a + b + c = 3 。若a > 0 , c > 0 ,根方程为
− a 1 − λ + 2 c 1 + 2 λ = 0 , λ ^ = 2 c − a 2 ( a + c ) . 每条负、零、正记录的权重分别为
2 ( a + c ) 3 n a , 1 n , a + c 3 n c , n = 3. 因此
R 3 ( 0 ) = ( 2 ( a + c ) 3 a ) a ( a + c 3 c ) c . 三种混合计数及其全部排列的概率为:( a , b , c ) = ( 1 , 1 , 1 ) ,R = 8 / 9 ,概率12 / 64 ;( 2 , 0 , 1 ) ,R = 1 ,概率12 / 64 ;( 1 , 0 , 2 ) ,R = 1 / 2 ,概率6 / 64 。它们最大的− 2 log R 为2 log 2 ≈ 1.3863 ,都通过95%临界值。
全零表( 0 , 3 , 0 ) 的经验支持恰是目标0,此时R = 1 ,也接受,概率为1 / 64 。其他未跨过零的表则不接受:若全在非零一侧,目标不可行;若含零及同一侧非零记录,只能把非零记录权重降为零,乘积仍为0。
所以精确覆盖是
12 + 12 + 6 + 1 64 = 31 64 . 也可直接按事件核对:同时看到负值和正值的概率为1 − ( 1 / 2 ) 3 − ( 3 / 4 ) 3 + ( 1 / 4 ) 3 = 30 / 64 ,再加全零事件1 / 64 。这份分布满足有限正方差定理,但n = 3 仍远没有95%覆盖。不能把全零表误判为不可行,也不能把“包含真均值的闭凸包”直接等同于正经验似然。
这项精确枚举只评价所给总体和样本量,没有构造适用于全部未知总体的有限样本修正。若要更换校准规则,应先写出新的概率保证,再谈如何计算。
任务四:加入未知控制系数以后,先消掉哪个空间?
在五维正交坐标中,e 1 , … , e 5 是标准正交基。现在模型为
Y = β X + γ W + u , W = e 5 , u ∼ N 5 ( 0 , σ 2 I 5 ) , γ 未知。原工具列为Z 1 = e 1 + e 5 、Z 2 = e 2 − e 5 ;观察到X = e 1 / 2 + e 3 + 2 e 5 、Y = 3 e 1 + e 4 + 7 e 5 。构造80%的AR集合,说明自由度为什么不是F 2 , 3 ,并检查直接忽略控制项会对b = 0 作出什么错误决定。
完整答案
先令M W = I − e 5 e 5 T ,对响应、结构变量与工具都作同一次投影:
Y ~ = M W Y = 3 e 1 + e 4 , X ~ = M W X = e 1 / 2 + e 3 , Z ~ = ( M W Z 1 , M W Z 2 ) = ( e 1 , e 2 ) . 真值处M W ( Y − β X ) = M W u ,控制系数γ 消失。该误差在四维子空间W ⊥ 上是各向同性高斯;前两个方向用于检验,另两个方向估计公共尺度。故分子自由度为2,分母为5 − 1 − 2 = 2 ,而不是3。这里额外用一维拟合未知控制;投影以后的误差虽有五个坐标,其协方差只有秩4。
于是
F W ( b ) = ( 3 − b / 2 ) 2 / 2 ( b 2 + 1 ) / 2 , c = 4 , 完整接受集合仍为( − ∞ , b − ] ∪ [ b + , ∞ ) ,b ± = ( − 6 ± 4 21 ) / 15 。可以用有理端点认证
− 1.623 < b − < − 1.622 , 0.822 < b + < 0.823 . 代入两端的二次多项式并用其在根附近的单调性,就能复算这些严格括界。
忽略控制项却使用已净化的工具( e 1 , e 2 ) 时,b = 0 的工具平方和仍为9,但所谓残差平方和变成1 + 49 = 50 ,多出来的49其实是未知控制信号。若错误按n − q = 3 自由度计算,统计量为( 9 / 2 ) / ( 50 / 3 ) = 27 / 100 。F 2 , 3 的80%临界值大于27 / 100 ,因此错误接受0;正确统计量F W ( 0 ) = 9 > 4 则拒绝。要看出前一个严格比较,可用F 2 , 3 的CDF 1 − ( 3 / ( 3 + 2 x ) ) 3 / 2 :在x = 27 / 100 时小于1 − ( 50 / 59 ) 2 < 0.3 ,远低于0.8。
若连原始工具里的e 5 分量也不消掉,又是另一个错误投影;不能用单独“中心化响应”替代整个控制空间的残差化。本任务从高斯正交分解重新证明含控制版本,而不是把无控制页的n − q 原样照抄。覆盖仍是原实验的无条件覆盖,按观察到的集合类型筛选后不自动保留同一概率。
交付检查
最终结果应同时包含:矩与权重的坐标约定、用于标准误的结构残差、经验支持的退化分支、AR两个平方和各自的维数。有限表数值通过只是算术证据;工具外生性、固定总体的矩条件与高斯误差合同都必须在应用前独立核验。