Skip to content

矩估计

Method of moments estimation

通过令样本矩等于模型理论矩并求解参数而构造估计量的方法。

方法定义

设模型参数 θΘRk,选择 k 个可积函数 h1,,hk,定义理论矩映射

m(θ)=(Eθ[h1(X)],,Eθ[hk(X)]).

给定独立同分布样本,作为统计量的样本矩为

m^n=(1ni=1nh1(Xi),,1ni=1nhk(Xi)).

矩估计量是方程

m(θ^n)=m^n

的可测解。若精确方程无解或矩的数量多于参数维数,可最小化加权距离

θ^nargminθΘ(m^nm(θ))TWn(m^nm(θ)),

这进入广义矩估计框架;权重、解选择和参数约束必须明确。

操作轨迹

方法依次完成四步:选择存在且能区分参数的理论矩;计算其模型表达;用样本平均替换期望;在参数空间内求解并规定多解规则。大数定律只负责第三步收敛,参数一致性还需要 m 在真值处可识别且逆映射连续。

低阶矩容易计算却可能浪费信息,高阶矩可能更能区分参数却对尾部和异常值敏感。矩的选择是估计设计的一部分,不由定义自动决定。

例子与计算

XiGamma(a,b),采用形状 a>0、尺度 b>0 参数化。理论均值与方差为

E[X]=ab,Var(X)=ab2.

用样本一阶、二阶中心矩 X¯

M2,n=1ni(XiX¯)2

匹配,解得

a^MM=X¯2M2,n,b^MM=M2,nX¯,

前提是 X¯>0M2,n>0。状态轨迹是:数据先压成 (X¯,M2,n),再通过理论矩映射的逆恢复 (a,b)

对 Uniform(0,θ),均值为 θ/2,故矩估计 θ^=2X¯。它与最大似然的样本最大值不同,展示同一模型可有不同构造原则。

该估计量有限样本方差为 4Var(X)/n=θ2/(3n),且无偏。相比之下,样本最大值的 MLE 有偏但误差尺度为 1/n,快于矩估计的 1/n。所以“矩估计解出了正确期望方程”不意味着它利用了模型中所有可用信息。

边界与失败情形

矩可能不存在。Cauchy 位置族没有有限一阶矩,用样本均值“匹配理论均值”没有定义;样本均值仍可算,但不存在它声称匹配的总体量。

矩映射可能不可识别。若只用 E[X2]=θ2+1 估计正态均值 θ,则 θθ 给出同一矩,方程有两个解;添加一阶矩或限制参数空间才可区分。

有限样本矩可能落在 m(Θ) 之外。例如由均值、方差反解某些受约束分布时会得到负形状参数。必须说明投影、边界解或失败,而不能输出不属于参数空间的数字。

多解规则必须可重复且不能窥视未知参数。选择“最接近真值的根”不是估计量;可以规定最小非负根、由独立初值决定的局部根,或把整个解集作为输出,再分别分析其统计性质。

矩估计不自动无偏、有效或唯一。大数定律给样本矩收敛,也只有在所需绝对矩有限时成立;高阶矩估计在重尾下可能波动巨大。

性质与应用

m^nm(θ0) 依概率,mθ0 附近一一且逆连续,则连续映射定理给出 θ^nθ0。进一步的渐近正态性需要矩向量中心极限定理和逆映射 Jacobian 非奇异。

标量情形若 m(θ0)0Varθ0(h(X))=v<,Delta 方法给 n(θ^nθ0)N(0,v/m(θ0)2)。导数接近零会放大样本矩噪声;等于零时常规 n 正态近似失效,即使矩方程仍有唯一解。

矩估计常提供封闭形式初值,再交给似然优化精化。它的价值是计算透明,不是普遍最优。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§7.2。
  • Lars Peter Hansen, “Large Sample Properties of Generalized Method of Moments Estimators,” Econometrica 50(4), 1982。