Skip to content

最大似然估计

Maximum likelihood estimation · MLE

在参数空间内选择使已观测数据似然达到上确界的参数估计方法。

方法定义

给定模型似然 Ln(θ;x),最大似然估计的解集为

MLE(x)=argmaxθΘLn(θ;x).

任何从该集合中可测选取的 θ^n 都称为 MLE。若只存在参数序列使似然趋近上确界而无参数达到它,则 MLE 不存在;若极大点多个,必须报告集合或规定选择规则。

当似然为正时,可等价最大化对数似然

n(θ)=logLn(θ;x).

内部可微极大点满足 score 方程 n(θ^)=0,但这是必要条件而非定义;边界解、不可微点和鞍点都不能仅靠解方程排除。

g 是一一参数变换,则 MLE 具有不变性:

η^=g(θ^)

η=g(θ) 的 MLE。非一一目标 ψ(θ) 的 profile likelihood 则需对纤维 {θ:ψ(θ)=u} 取上确界。

直觉

MLE 把观测固定,寻找最能提高这份数据相对密度或质量的模型成员。它利用完整似然形状,而不是只匹配若干矩;求解却是优化问题,统计定义和数值算法要分开。

最大化是相对比较。似然的共同数据因子可删除,参数因子不可删除;把目标函数缩放为单调变换不会改变极大点,但近似、惩罚或截断会定义新的估计规则。

例子与计算

XiPoisson(λ)λ0,则

n(λ)=nλ+(ixi)logλilog(xi!).

ixi>0,导数为 n+(ixi)/λ,二阶导数为 (ixi)/λ2<0,故唯一极大点

λ^=X¯.

若所有观测为零,内部 score 公式含 0/λ,但似然 enλ 在边界 λ=0 达到最大;检查参数边界恢复正确解。

对 Uniform(0,θ),似然

L(θ;x)=θn1{θx(n)}

在可行区间随 θ 递减,所以 MLE 是 X(n)。它有有限样本负偏差 θ/(n+1),说明 MLE 不自动无偏。

MLE 的有限样本状态还可由 likelihood profile 追踪。对正态均值、方差同时未知的模型,先固定 μ 最大化 σ2n1i(xiμ)2,再对 μ 最小化残差平方得到 x¯;最终方差 MLE 使用分母 n,不是无偏修正 n1。profile 操作保持同一原始似然目标,和先随意替换估计公式不同。

边界与失败情形

在完全分离的 logistic 回归中,系数沿某方向趋于无穷时似然不断上升但无有限极大点。优化器返回很大的有限数不等于 MLE 存在;正则化会产生有解的新目标,却已不是原始 MLE。

混合模型似然可多峰,甚至因某成分方差趋零并包住一个观测而无界。局部优化收敛只证明找到驻点,不证明全局最大,更不解决模型奇异性。

MLE 不是 MAP。MAP 最大化似然乘先验密度,结果依赖先验和参数坐标;MLE 的一一变换不变性不需要 Jacobian。

一致性与渐近正态性需要可识别、统一大数律、真参数内部、似然正则等条件。有限样本中 MLE 可能有偏、风险较大或不存在。

参数空间是否闭合直接影响存在性。例如 Bernoulli 参数若错误限制为开区间 (0,1),全成功样本的似然上确界在 p1 时逼近,却没有任何允许参数达到;把边界纳入模型会得到 MLE p=1,但相应渐近理论仍是边界问题。

性质与应用

在常规正则模型中,归一化对数似然趋近其期望,真参数因 Kullback–Leibler 对比唯一最大而得到一致性。Taylor 展开 score 再给出 Fisher 信息尺度的渐近正态性;这些是另需证明的定理链。

数值实现应报告初值、收敛准则、约束和目标值,并用梯度、Hessian 或多起点检查解,而不是把软件的 success 标记当统计保证。

似然乘任意只依赖数据的正因子或取严格递增变换都不改变 MLE;乘含参数惩罚项则产生 penalized likelihood。后者可能改善有限样本风险并保证存在,但应以新规则名称分析,不能把惩罚造成的偏差藏在原始 MLE 定义中。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 6。
  • Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 16。