Skip to content

方法Method

广义矩估计

Generalized method of moments · GMM · 广义矩方法

在多于参数的矩约束之间作有尺度的最小距离折中,证明权重效率并用剩余投影方向构造过度识别检验。

形式陈述 ​

两项未知参数可能有三项可测的平均关系。总体中三项关系可以同时成立,样本中却会因抽样波动而互相冲突。矩估计已经说明怎样把理论平均换成样本平均;广义矩估计接着回答:无法同时归零时,怎样衡量这些偏差,怎样确定系数的波动,剩下的偏差又能检验什么?

输入矩、参数和权重 ​

设观测 T1,…,Tn 独立同分布,参数 θ∈Θ⊂Rp,已指定矩函数 g(T,θ)∈Rq,q≥p≥1。记

μ(θ)=Eg(T,θ),g¯n(θ)=1n∑i=1ng(Ti,θ),μ(θ0)=0.

权重 Wn 是由整份资料决定的对称正定 q×q 矩阵;在一次最小化中,它不随候选 θ 改变。准则与估计为

(1)Qn(θ)=g¯n(θ)TWng¯n(θ),θ^n∈argminθ∈ΘQn(θ).

多解时须规定可测选择,近似求解时须报告准则差。本构造是M-估计:准则先取样本平均再平方,一般并不是逐条观测损失的平均。q>p称过度识别的矩系统,但仅数方程个数不能证明参数真的可识别。

一套固定维的大样本条件 ​

下面给出足以逐项核对的一组条件,p,q与总体分布均固定。

  1. Θ紧,θ0在其内部。μ连续,且μ(θ)=0在Θ内只有θ0;Wn→PW,W正定。样本矩满足supΘ‖g¯n−μ‖→P0。
  2. 返回点在Θ内,且Qn(θ^n)≤infΘQn+oP(1)。这负责全局定位,不能用“小梯度”替代。
  3. 在真值附近的一个开球,g(T,θ)几乎处处连续可微。样本Jacobian Dn(θ)=∂θg¯n(θ)一致趋于连续函数D(θ)=∂θμ(θ)。D=D(θ0)满列秩。返回点还满足
(2)Dn(θ^n)TWng¯n(θ^n)=oP(n−1/2).
  1. E‖g(T,θ0)‖2<∞,且Σ=E[g(T,θ0)g(T,θ0)T]正定。

式(2)是数值误差相对于统计尺度的条件;精确内部极小点自动满足零残差。固定的机器容差只描述一次计算,不能单独保证沿n→∞的式(2)。

一致逼近并非无法检查的黑箱。例如在紧凸Θ上,矩函数有可积锚点和共同可积随机Lipschitz界时,逐分量应用参数化一致大数律得到条件1。对导数再提供可积锚点与共同可积Lipschitz界,并用可积导数包络允许交换微分和期望,便得到条件3的Jacobian一致收敛。原矩可积并不会自动让其导数也可积。

从定位到线性表示 ​

连续μ在紧集上有界,所以条件1给出supΘ|Qn−Q|→P0,其中Q=μTWμ。W正定和唯一零点使Q的极小点分离。Argmin一致性定理因此给出θ^n→Pθ0。

令Δn=θ^n−θ0。在概率趋于一的事件上,连接两点的线段位于局部开球内。沿该线段积分得

g¯n(θ^n)=g¯n(θ0)+D~nΔn,D~n=∫01Dn(θ0+tΔn)dt→PD.

将这个精确等式代入式(2)。矩阵Dn(θ^n)TWnD~n趋于可逆的DTWD,故

(3)nΔn=−AWng¯n(θ0)+oP(1),AW=(DTWD)−1DTW.

这里先解方程才得到根号n速率,没有预先假定该速率以抹掉余项。由有限维中心极限定理,

(4)n(θ^n−θ0)⇒Np(0,VW),VW=AWΣAWT.

这里的箭头是分布收敛,极限为p维多元正态分布,不要求原观测本身服从正态。

为什么逆协方差是有效权重 ​

取W∗=Σ−1,记A∗=AW∗,则V∗=(DTΣ−1D)−1。对任意上述正定W,有AWD=A∗D=Ip。又有A∗Σ=V∗DT,因此两个交叉项消失:

(5)VW−V∗=(AW−A∗)Σ(AW−A∗)T⪰0.

这比较同一组矩、同一个正则总体下的渐近协方差。它不声称增加错误矩仍有效,也不声称有限样本的估计误差每次更小;若使用更多模型信息,还可能获得本矩系统之外的估计方法。

实践中先用固定正定权重得到一致初值θ~n,再算

Σ^n=1n∑ig(Ti,θ~n)g(Ti,θ~n)T,Wn=Σ^n−1,

并重新最小化。需要另证Σ^n→PΣ。一个充分条件是局部‖g(T,b)−g(T,c)‖≤L(T)‖b−c‖且EL2<∞;外积差平均由2dPn[L‖g0‖]+d2PnL2控制,其中d=‖θ~n−θ0‖。有限二阶矩与Cauchy–Schwarz使这个界趋零。若样本矩阵仍奇异,应报告失败;渐近正定不等于每份小样本都能求逆。

剩余方向的J统计量 ​

当第二步使用Wn=Σ^n−1→PΣ−1时,定义

Jn=ng¯n(θ^n)TΣ^n−1g¯n(θ^n).

令B=Σ−1/2D,P=B(BTB)−1BT。它是秩p的正交投影。由式(3)和矩的积分展开,白化后的拟合残差满足

nΣ−1/2g¯n(θ^n)=(Iq−P)nΣ−1/2g¯n(θ0)+oP(1).

右边的极限是标准高斯向量在q−p维正交补中的投影。取正交规范基后,平方范数就是q−p个独立标准正态平方之和。因此q>p时Jn⇒χq−p2;q=p时Jn→P0,没有剩余方向可作这项检验。任意权重下的最小准则值不能直接乘n就按同一自由度查表。

直觉

矩偏差的数值大小受单位影响。例如把某个测量从米换成毫米,平方偏差放大一百万倍;如果仍给所有分量相同权重,算法会被换单位的那一项牵走。有效权重先按抽样协方差白化,再找最接近模型矩曲面的点。参数的切向方向负责拟合,正交补负责留下可检验的冲突。

白化还处理相关性。两个几乎相同的测量不能算成两份独立证据;只按各自方差缩放而忽略协方差,会重复使用相同噪声。式(5)正是把这种直觉写成每个线性对比都成立的方差比较。

从两个矩看到权重的作用 ​

下图左侧单独用两个矩估一个共同均值:样本矩为(1,3)、模型矩为(θ,θ),协方差为diag(1,4)。单位权重投到(2,2);有效权重最小化(1−θ)2+(3−θ)2/4,得到θ=7/5。右图则使用下节三矩两参数例的两份协方差,画出单位二次型椭圆;蓝色包含于灰色,表示同一真值处每个对比的渐近方差不增。

矩权重与拟合方向

椭圆的单位等高线只是比较尺度,没有指定置信概率;左侧与右侧的参数维数也不同。

例子与边界

三个平均关系只估两个数 ​

设Ti∈R3,ETi=Dθ,矩取g(T,θ)=T−Dθ,其中

D=(100111),Σ=diag(1,4,1),T¯=(1,2,4)T.

第三个平均应等于前两个之和,但当前4≠1+2。单位权重给

θ^I=(4/3,7/3)T,T¯−Dθ^I=(−1/3,−1/3,1/3)T,QI=1/3.

使用Σ−1后,第二个测量较不精确,允许它承担更大的偏差:

θ^∗=(7/6,8/3)T,T¯−Dθ^∗=(−1/6,−2/3,1/6)T,Q∗=1/6.

两项n倍渐近协方差为

VI=(1−1−12),V∗=(5/6−2/3−2/34/3).

它们的差等于(1/6)(1,−2)T(1,−2),所以半正定且秩一。若另外规定Ti为协方差恰为已知Σ的正态向量,上述线性估计的正态律及Jn=n/6对应的χ12零假设律才是有限样本精确结论。只给均值和协方差时,仍只有相应渐近保证。此例中的D是均值设计矩阵,矩函数的Jacobian实际为−D,不影响所列协方差与投影。

哪些错误能躲过J检验 ​

仍用线性例。若真实均值变成Dθ0+Dδ,算法会估计θ0+δ。这份偏移完全在模型列空间内,拟合后没有额外残差,J无法辨认它究竟是参数改变还是科学模型被污染。反之,不能被任何Dθ吸收的固定偏移会留下非零总体残差;在一致条件下,Jn随n增大而发散。

所以不拒绝只说明没有检出该矩系统的残余冲突,不能证明所有工具有效,更不能证明因果排除限制。估计方向和检验方向承担的是不同问题。

不能省掉的模型边界 ​

非线性矩可能有多个零点,即使每个零点的Jacobian都满秩,也不保证全局识别。比如μ(θ)=θ2−1在±1都有非零导数。若D的最小奇异值随n趋零,式(3)中的逆矩阵不再受固定总体定理控制;弱工具问题正会触及这条边界。数据有序列依赖时Σ还应包含跨期协方差,本页IID外积不能替代它。

若让Wn(θ)在候选参数之间连续更新,求导会出现权重导数项。这样的连续更新估计有自己的理论,不能沿用本页的一阶条件而漏掉该项。

推论与应用

换矩坐标必须一起换权重 ​

对任意可逆q×q矩阵C,令g′=Cg,Wn′=C−TWnC−1。则对每个候选参数,g¯′TWn′g¯′=g¯TWng¯,所以全局极小集合与准则差完全相同。这是有限样本代数恒等式。若只换g而保留W=I,通常就是改变了问题。

计算时交付什么 ​

输入应明确矩函数、参数域、初始权重、根选择或全局优化规则、停止预算。每次评估需形成q个平均矩及q×p的导数;具体成本取决于这些函数。已有矩值后,形成稠密外积协方差需O(nq2),分解它需O(q3);局部正规方程的矩阵乘法约O(q2p+qp2),解p维系统需O(p3)。这些是一次评估或线性代数步骤的成本,不是任意非线性全局优化的多项式保证。

返回系数时同时报告矩偏差、权重、秩诊断、准则值和式(2)残差。系数协方差插件是V^W/n;若报告J,还需说明采用有效权重、正确中心和q−p自由度的依据。可在矩约束与反演的迁移验收复算坐标变换与无法被J发现的偏移。

参考资料
关系图谱28 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

类型化关系