Skip to content

方法Method

最大似然估计

Maximum likelihood estimation · MLE

在参数空间内选择使已观测数据似然达到上确界的参数估计方法。

形式陈述 ​

给定模型似然 Ln(θ;x),最大似然估计的解集为

MLE(x)=argmaxθ∈ΘLn(θ;x).

任何从该集合中可测选取的 θ^n 都称为 MLE。若只存在参数序列使似然趋近上确界而无参数达到它,则 MLE 不存在;若极大点多个,必须报告集合或规定选择规则。

当似然为正时,可等价最大化对数似然

ℓn(θ)=log⁡Ln(θ;x).

在似然逐点有限的通常情形,取负对数似然 Mn(θ)=−ℓn(θ),就把最大化改写成同一随机准则的最小化;零似然对应 +∞,支持约束仍须保留。独立样本的乘积还会变成可相加的准则。因此,最大似然是M-估计的特例。这项归类不依赖样本独立性,也没有指定求解算法。

若密度版本允许某些候选点的似然为 +∞,可改用有界准则 Mn(θ)=1/(1+Ln(θ;x)),约定 1/(1+∞)=0。它严格反转非负似然的大小顺序,仍保持全部极大点与极小点的对应,而无需把负无穷作为准则值。

内部可微极大点满足 score 方程 ∇ℓn(θ^)=0,但这是必要条件而非定义;边界解、不可微点和鞍点都不能仅靠解方程排除。

若 g 是一一参数变换,则 MLE 具有不变性:

η^=g(θ^)

是 η=g(θ) 的 MLE。非一一目标 ψ(θ) 的 profile likelihood 则需对纤维 {θ:ψ(θ)=u} 取上确界。

直觉

MLE 把观测固定,寻找最能提高这份数据相对密度或质量的模型成员。它利用完整似然形状,而不是只匹配若干矩;求解却是优化问题,统计定义和数值算法要分开。

最大化是相对比较。似然的共同数据因子可删除,参数因子不可删除;对目标作严格递增变换不会改变极大点,但近似、惩罚或截断会定义新的估计规则。

样本似然汇成全局极大点
例子与边界

最大似然通过最大化整份样本在参数下的联合似然选参数;矩估计把若干样本矩与理论矩配平。MLE 更直接利用分布形状,矩估计常更易计算;二者在有限样本偏差、效率和可识别条件上不必一致。

若 X1,…,Xn 是 n≥1 个独立同分布的 Poisson(λ) 观测,λ≥0,则

ℓn(λ)=−nλ+(∑ixi)log⁡λ−∑ilog⁡(xi!).

当 ∑ixi>0,导数为 −n+(∑ixi)/λ,二阶导数为 −(∑ixi)/λ2<0,故唯一极大点

λ^=X¯.

若所有观测为零,内部 score 公式含 0/λ,但似然 e−nλ 在边界 λ=0 达到最大;检查参数边界恢复正确解。

对 n≥1 个独立同分布的 Uniform(0,θ) 观测,θ>0,似然

L(θ;x)=θ−n1{θ≥x(n)}

在可行区间随 θ 递减,所以 MLE 是 X(n)。它有有限样本负偏差 −θ/(n+1),说明 MLE 不自动无偏。

MLE 的有限样本状态还可由 likelihood profile 追踪。对独立 N(μ,σ2) 样本,参数空间取 μ∈R,σ2>0。固定 μ 且 ∑i(xi−μ)2>0 时,方差的最大化解为 n−1∑i(xi−μ)2。若样本不全相等,再优化均值得 μ^=x¯、σ^2=n−1∑i(xi−x¯)2>0;分母是 n,不是无偏修正 n−1。

若所有观测都等于 a,包括只有一个观测的情形,固定 μ=a 后令 σ2↓0,似然无界增大,正方差参数空间中没有 MLE。零残差对应的是这个边界失效,而不是一个允许的零方差估计。profile 操作必须保留原参数空间和极大点的存在条件。

边界与失败情形 ​

在完全分离的 logistic 回归中,系数沿某方向趋于无穷时似然不断上升但无有限极大点。优化器返回很大的有限数不等于 MLE 存在;正则化会产生有解的新目标,却已不是原始 MLE。

有限混合模型的似然可多峰,甚至因某成分方差趋零并包住一个观测而无界。EM 算法在精确 E 步及提高辅助目标的 M 步下保证似然不降;这不保证参数收敛、驻点或全局最大,更不解决模型奇异性。

MLE 不是 MAP。MAP 最大化似然乘先验密度,结果依赖先验和参数坐标;MLE 的一一变换不变性不需要 Jacobian。

一致性与渐近正态性需要可识别、统一大数律、真参数内部、似然正则等条件。有限样本中 MLE 可能有偏、风险较大或不存在。

参数空间是否闭合直接影响存在性。例如 Bernoulli 参数若错误限制为开区间 (0,1),全成功样本的似然上确界在 p↑1 时逼近,却没有任何允许参数达到;把边界纳入模型会得到 MLE p=1,但相应渐近理论仍是边界问题。

推论与应用

在常规正则模型中,归一化对数似然趋近其期望,真参数因 Kullback–Leibler 对比唯一最大而得到一致性。Taylor 展开Score 与 Fisher 信息再给出渐近正态性;这些是另需证明的定理链。

Hill 尾指数估计从 Pareto 对数超额的似然得到简单公式,但一般重尾下还要让所用极端次序数 k 满足 k→∞、k/n→0;渐近正态的中心还可能带二阶尾偏差,不能只移用固定正则模型的标准误。

数值实现应报告初值、收敛准则、约束和目标值,并用梯度、Hessian 或多起点检查解,而不是把软件的 success 标记当统计保证。

似然乘任意只依赖数据的正因子或取严格递增变换都不改变 MLE;乘含参数惩罚项则产生 penalized likelihood。后者可能改善有限样本风险并保证存在,但应以新规则名称分析,不能把惩罚造成的偏差藏在原始 MLE 定义中。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 6。
  • Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 16。
关系图谱16 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系