形式陈述
两项未知参数可能有三项可测的平均关系。总体中三项关系可以同时成立,样本中却会因抽样波动而互相冲突。矩估计 理路 矩估计 Method of moments estimation 通过令样本矩等于模型理论矩并求解参数而构造估计量的方法。 已经说明怎样把理论平均换成样本平均;广义矩估计接着回答:无法同时归零时,怎样衡量这些偏差,怎样确定系数的波动,剩下的偏差又能检验什么?
输入矩、参数和权重
设观测 T 1 , … , T n 独立同分布,参数 θ ∈ Θ ⊂ R p ,已指定矩函数 g ( T , θ ) ∈ R q ,q ≥ p ≥ 1 。记
μ ( θ ) = E g ( T , θ ) , g ¯ n ( θ ) = 1 n ∑ i = 1 n g ( T i , θ ) , μ ( θ 0 ) = 0. 权重 W n 是由整份资料决定的对称正定 理路 正定与半正定矩阵 Positive definite matrix · Positive semidefinite matrix · PSD matrix 由二次能量严格为正或非负定义的实对称与复 Hermitian 矩阵。 q × q 矩阵;在一次最小化中,它不随候选 θ 改变。准则与估计为
(1) Q n ( θ ) = g ¯ n ( θ ) T W n g ¯ n ( θ ) , θ ^ n ∈ argmin θ ∈ Θ Q n ( θ ) . 多解时须规定可测选择,近似求解时须报告准则差。本构造是M-估计 理路 M-估计 M-estimation · M-estimator 通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。 :准则先取样本平均再平方,一般并不是逐条观测损失的平均。q > p 称过度识别的矩系统,但仅数方程个数不能证明参数真的可识别。
一套固定维的大样本条件
下面给出足以逐项核对的一组条件,p , q 与总体分布均固定。
Θ 紧,θ 0 在其内部。μ 连续,且μ ( θ ) = 0 在Θ 内只有θ 0 ;W n → P W ,W 正定。样本矩满足sup Θ ‖ g ¯ n − μ ‖ → P 0 。
返回点在Θ 内,且Q n ( θ ^ n ) ≤ inf Θ Q n + o P ( 1 ) 。这负责全局定位,不能用“小梯度”替代。
在真值附近的一个开球,g ( T , θ ) 几乎处处连续可微。样本Jacobian D n ( θ ) = ∂ θ g ¯ n ( θ ) 一致趋于连续函数D ( θ ) = ∂ θ μ ( θ ) 。D = D ( θ 0 ) 满列秩。返回点还满足
(2) D n ( θ ^ n ) T W n g ¯ n ( θ ^ n ) = o P ( n − 1 / 2 ) .
E ‖ g ( T , θ 0 ) ‖ 2 < ∞ ,且Σ = E [ g ( T , θ 0 ) g ( T , θ 0 ) T ] 正定。
式(2)是数值误差相对于统计尺度的条件;精确内部极小点自动满足零残差。固定的机器容差只描述一次计算,不能单独保证沿n → ∞ 的式(2)。
一致逼近并非无法检查的黑箱。例如在紧凸Θ 上,矩函数有可积锚点和共同可积随机Lipschitz界时,逐分量应用参数化一致大数律 理路 参数化一致大数律 Parametric uniform law of large numbers 用紧参数集和可积随机 Lipschitz 界,把逐点大数律提升为同一样本上的全参数控制。 得到条件1。对导数再提供可积锚点与共同可积Lipschitz界,并用可积导数包络允许交换微分和期望,便得到条件3的Jacobian一致收敛。原矩可积并不会自动让其导数也可积。
从定位到线性表示
连续μ 在紧集上有界,所以条件1给出sup Θ | Q n − Q | → P 0 ,其中Q = μ T W μ 。W 正定和唯一零点使Q 的极小点分离。Argmin一致性定理 理路 Argmin 一致性定理 Argmin consistency theorem 用总体分离、随机一致逼近和近似求解容差,把样本准则的极小点定位到总体目标。 因此给出θ ^ n → P θ 0 。
令Δ n = θ ^ n − θ 0 。在概率趋于一的事件上,连接两点的线段位于局部开球内。沿该线段积分得
g ¯ n ( θ ^ n ) = g ¯ n ( θ 0 ) + D ~ n Δ n , D ~ n = ∫ 0 1 D n ( θ 0 + t Δ n ) d t → P D . 将这个精确等式代入式(2)。矩阵D n ( θ ^ n ) T W n D ~ n 趋于可逆的D T W D ,故
(3) n Δ n = − A W n g ¯ n ( θ 0 ) + o P ( 1 ) , A W = ( D T W D ) − 1 D T W . 这里先解方程才得到根号n 速率,没有预先假定该速率以抹掉余项。由有限维中心极限定理 理路 中心极限定理 Central limit theorem 适当归一化的独立随机变量和在分布上趋于正态分布。 ,
(4) n ( θ ^ n − θ 0 ) ⇒ N p ( 0 , V W ) , V W = A W Σ A W T . 这里的箭头是分布收敛 理路 依分布收敛 Convergence in distribution · Weak convergence 分布函数在极限分布连续点处收敛的随机变量收敛概念。 ,极限为p 维多元正态分布 理路 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,不要求原观测本身服从正态。
为什么逆协方差是有效权重
取W ∗ = Σ − 1 ,记A ∗ = A W ∗ ,则V ∗ = ( D T Σ − 1 D ) − 1 。对任意上述正定W ,有A W D = A ∗ D = I p 。又有A ∗ Σ = V ∗ D T ,因此两个交叉项消失:
(5) V W − V ∗ = ( A W − A ∗ ) Σ ( A W − A ∗ ) T ⪰ 0. 这比较同一组矩、同一个正则总体下的渐近协方差。它不声称增加错误矩仍有效,也不声称有限样本的估计误差每次更小;若使用更多模型信息,还可能获得本矩系统之外的估计方法。
实践中先用固定正定权重得到一致初值θ ~ n ,再算
Σ ^ n = 1 n ∑ i g ( T i , θ ~ n ) g ( T i , θ ~ n ) T , W n = Σ ^ n − 1 , 并重新最小化。需要另证Σ ^ n → P Σ 。一个充分条件是局部‖ g ( T , b ) − g ( T , c ) ‖ ≤ L ( T ) ‖ b − c ‖ 且E L 2 < ∞ ;外积差平均由2 d P n [ L ‖ g 0 ‖ ] + d 2 P n L 2 控制,其中d = ‖ θ ~ n − θ 0 ‖ 。有限二阶矩与Cauchy–Schwarz使这个界趋零。若样本矩阵仍奇异,应报告失败;渐近正定不等于每份小样本都能求逆。
剩余方向的J统计量
当第二步使用W n = Σ ^ n − 1 → P Σ − 1 时,定义
J n = n g ¯ n ( θ ^ n ) T Σ ^ n − 1 g ¯ n ( θ ^ n ) . 令B = Σ − 1 / 2 D ,P = B ( B T B ) − 1 B T 。它是秩p 的正交投影 理路 正交投影 Orthogonal projection 把向量映到子空间上最近点并使误差与子空间正交的线性算子。 。由式(3)和矩的积分展开,白化后的拟合残差满足
n Σ − 1 / 2 g ¯ n ( θ ^ n ) = ( I q − P ) n Σ − 1 / 2 g ¯ n ( θ 0 ) + o P ( 1 ) . 右边的极限是标准高斯向量在q − p 维正交补中的投影。取正交规范基后,平方范数就是q − p 个独立标准正态平方之和。因此q > p 时J n ⇒ χ q − p 2 ;q = p 时J n → P 0 ,没有剩余方向可作这项检验。任意权重下的最小准则值不能直接乘n 就按同一自由度查表。
直觉
矩偏差的数值大小受单位影响。例如把某个测量从米换成毫米,平方偏差放大一百万倍;如果仍给所有分量相同权重,算法会被换单位的那一项牵走。有效权重先按抽样协方差白化,再找最接近模型矩曲面的点。参数的切向方向负责拟合,正交补负责留下可检验的冲突。
白化还处理相关性。两个几乎相同的测量不能算成两份独立证据;只按各自方差缩放而忽略协方差,会重复使用相同噪声。式(5)正是把这种直觉写成每个线性对比都成立的方差比较。
从两个矩看到权重的作用
下图左侧单独用两个矩估一个共同均值:样本矩为( 1 , 3 ) 、模型矩为( θ , θ ) ,协方差为diag ( 1 , 4 ) 。单位权重投到( 2 , 2 ) ;有效权重最小化( 1 − θ ) 2 + ( 3 − θ ) 2 / 4 ,得到θ = 7 / 5 。右图则使用下节三矩两参数例的两份协方差,画出单位二次型椭圆;蓝色包含于灰色,表示同一真值处每个对比的渐近方差不增。
图片加载失败 矩权重与拟合方向 椭圆的单位等高线只是比较尺度,没有指定置信概率;左侧与右侧的参数维数也不同。
例子与边界
三个平均关系只估两个数
设T i ∈ R 3 ,E T i = D θ ,矩取g ( T , θ ) = T − D θ ,其中
D = ( 1 0 0 1 1 1 ) , Σ = diag ( 1 , 4 , 1 ) , T ¯ = ( 1 , 2 , 4 ) T . 第三个平均应等于前两个之和,但当前4 ≠ 1 + 2 。单位权重给
θ ^ I = ( 4 / 3 , 7 / 3 ) T , T ¯ − D θ ^ I = ( − 1 / 3 , − 1 / 3 , 1 / 3 ) T , Q I = 1 / 3. 使用Σ − 1 后,第二个测量较不精确,允许它承担更大的偏差:
θ ^ ∗ = ( 7 / 6 , 8 / 3 ) T , T ¯ − D θ ^ ∗ = ( − 1 / 6 , − 2 / 3 , 1 / 6 ) T , Q ∗ = 1 / 6. 两项n 倍渐近协方差为
V I = ( 1 − 1 − 1 2 ) , V ∗ = ( 5 / 6 − 2 / 3 − 2 / 3 4 / 3 ) . 它们的差等于( 1 / 6 ) ( 1 , − 2 ) T ( 1 , − 2 ) ,所以半正定且秩一。若另外规定T i 为协方差恰为已知Σ 的正态向量,上述线性估计的正态律及J n = n / 6 对应的χ 1 2 零假设律才是有限样本精确结论。只给均值和协方差时,仍只有相应渐近保证。此例中的D 是均值设计矩阵,矩函数的Jacobian实际为− D ,不影响所列协方差与投影。
哪些错误能躲过J检验
仍用线性例。若真实均值变成D θ 0 + D δ ,算法会估计θ 0 + δ 。这份偏移完全在模型列空间内,拟合后没有额外残差,J无法辨认它究竟是参数改变还是科学模型被污染。反之,不能被任何D θ 吸收的固定偏移会留下非零总体残差;在一致条件下,J n 随n 增大而发散。
所以不拒绝只说明没有检出该矩系统的残余冲突,不能证明所有工具有效,更不能证明因果排除限制。估计方向和检验方向承担的是不同问题。
不能省掉的模型边界
非线性矩可能有多个零点,即使每个零点的Jacobian都满秩,也不保证全局识别。比如μ ( θ ) = θ 2 − 1 在± 1 都有非零导数。若D 的最小奇异值随n 趋零,式(3)中的逆矩阵不再受固定总体定理控制;弱工具问题正会触及这条边界。数据有序列依赖时Σ 还应包含跨期协方差,本页IID外积不能替代它。
若让W n ( θ ) 在候选参数之间连续更新,求导会出现权重导数项。这样的连续更新估计有自己的理论,不能沿用本页的一阶条件而漏掉该项。