形式陈述
给定模型似然 理路 似然函数 Likelihood function 固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。 L n ( θ ; x ) ,最大似然估计的解集为
MLE ( x ) = argmax θ ∈ Θ L n ( θ ; x ) . 任何从该集合中可测选取的 θ ^ n 都称为 MLE。若只存在参数序列使似然趋近上确界而无参数达到它,则 MLE 不存在;若极大点多个,必须报告集合或规定选择规则。
当似然为正时,可等价最大化对数似然
ℓ n ( θ ) = log L n ( θ ; x ) . 在似然逐点有限的通常情形,取负对数似然 M n ( θ ) = − ℓ n ( θ ) ,就把最大化改写成同一随机准则的最小化;零似然对应 + ∞ ,支持约束仍须保留。独立样本的乘积还会变成可相加的准则。因此,最大似然是M-估计 理路 M-估计 M-estimation · M-estimator 通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。 的特例。这项归类不依赖样本独立性,也没有指定求解算法。
若密度版本允许某些候选点的似然为 + ∞ ,可改用有界准则 M n ( θ ) = 1 / ( 1 + L n ( θ ; x ) ) ,约定 1 / ( 1 + ∞ ) = 0 。它严格反转非负似然的大小顺序,仍保持全部极大点与极小点的对应,而无需把负无穷作为准则值。
内部可微极大点满足 score 方程 ∇ ℓ n ( θ ^ ) = 0 ,但这是必要条件而非定义;边界解、不可微点和鞍点都不能仅靠解方程排除。
若 g 是一一参数变换,则 MLE 具有不变性:
η ^ = g ( θ ^ ) 是 η = g ( θ ) 的 MLE。非一一目标 ψ ( θ ) 的 profile likelihood 则需对纤维 { θ : ψ ( θ ) = u } 取上确界。
直觉
MLE 把观测固定,寻找最能提高这份数据相对密度或质量的模型成员。它利用完整似然形状,而不是只匹配若干矩;求解却是优化问题 理路 优化问题 Optimization problem 在可行解集合上最小化或最大化目标函数的计算问题。 ,统计定义和数值算法要分开。
最大化是相对比较。似然的共同数据因子可删除,参数因子不可删除;对目标作严格递增变换不会改变极大点,但近似、惩罚或截断会定义新的估计规则。
图片加载失败 样本似然汇成全局极大点
例子与边界
最大似然通过最大化整份样本在参数下的联合似然选参数;矩估计 理路 矩估计 Method of moments estimation 通过令样本矩等于模型理论矩并求解参数而构造估计量的方法。 把若干样本矩与理论矩配平。MLE 更直接利用分布形状,矩估计常更易计算;二者在有限样本偏差、效率和可识别条件上不必一致。
若 X 1 , … , X n 是 n ≥ 1 个独立同分布的 Poisson( λ ) 观测,λ ≥ 0 ,则
ℓ n ( λ ) = − n λ + ( ∑ i x i ) log λ − ∑ i log ( x i ! ) . 当 ∑ i x i > 0 ,导数为 − n + ( ∑ i x i ) / λ ,二阶导数为 − ( ∑ i x i ) / λ 2 < 0 ,故唯一极大点
λ ^ = X ¯ . 若所有观测为零,内部 score 公式含 0 / λ ,但似然 e − n λ 在边界 λ = 0 达到最大;检查参数边界恢复正确解。
对 n ≥ 1 个独立同分布的 Uniform( 0 , θ ) 观测,θ > 0 ,似然
L ( θ ; x ) = θ − n 1 { θ ≥ x ( n ) } 在可行区间随 θ 递减,所以 MLE 是 X ( n ) 。它有有限样本负偏差 − θ / ( n + 1 ) ,说明 MLE 不自动无偏。
MLE 的有限样本状态还可由 likelihood profile 追踪。对独立 N ( μ , σ 2 ) 样本,参数空间取 μ ∈ R , σ 2 > 0 。固定 μ 且 ∑ i ( x i − μ ) 2 > 0 时,方差的最大化解为 n − 1 ∑ i ( x i − μ ) 2 。若样本不全相等,再优化均值得 μ ^ = x ¯ 、σ ^ 2 = n − 1 ∑ i ( x i − x ¯ ) 2 > 0 ;分母是 n ,不是无偏修正 n − 1 。
若所有观测都等于 a ,包括只有一个观测的情形,固定 μ = a 后令 σ 2 ↓ 0 ,似然无界增大,正方差参数空间中没有 MLE。零残差对应的是这个边界失效,而不是一个允许的零方差估计。profile 操作必须保留原参数空间和极大点的存在条件。
边界与失败情形
在完全分离的 logistic 回归中,系数沿某方向趋于无穷时似然不断上升但无有限极大点。优化器返回很大的有限数不等于 MLE 存在;正则化会产生有解的新目标,却已不是原始 MLE。
有限混合模型 理路 有限混合模型 Finite mixture model · 有限混合分布 先抽取有限个潜在成分之一,再由该成分生成观测,并通过边缘化得到观测分布的统计模型。 的似然可多峰,甚至因某成分方差趋零并包住一个观测而无界。EM 算法 理路 期望最大化算法 Expectation-maximization algorithm · EM algorithm · EM 算法 交替计算潜变量的条件分布与提高完整数据期望对数似然,以迭代优化观测似然的算法。 在精确 E 步及提高辅助目标的 M 步下保证似然不降;这不保证参数收敛、驻点或全局最大,更不解决模型奇异性。
MLE 不是 MAP。MAP 最大化似然乘先验密度,结果依赖先验和参数坐标;MLE 的一一变换不变性不需要 Jacobian。
一致性与渐近正态性需要可识别、统一大数律、真参数内部、似然正则等条件。有限样本中 MLE 可能有偏、风险较大或不存在。
参数空间是否闭合直接影响存在性。例如 Bernoulli 参数若错误限制为开区间 ( 0 , 1 ) ,全成功样本的似然上确界在 p ↑ 1 时逼近,却没有任何允许参数达到;把边界纳入模型会得到 MLE p = 1 ,但相应渐近理论仍是边界问题。
推论与应用
在常规正则模型中,归一化对数似然趋近其期望,真参数因 Kullback–Leibler 对比唯一最大而得到一致性 理路 估计量的一致性 Consistency of estimators · Consistent estimator 估计误差随实验规模增长而消失的点态、统一、弱与强收敛性质及其证明边界。 。Taylor 展开Score 与 Fisher 信息 理路 Score 与 Fisher 信息 Score function · Fisher information 对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 再给出渐近正态性 理路 估计量的渐近正态性 Asymptotic normality of estimators 估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。 ;这些是另需证明的定理链。
Hill 尾指数估计 理路 Hill 尾指数估计量 Hill estimator · Hill tail-index estimator Hill 估计量平均最大的若干观测相对于随机门槛的对数比,估计正则变化重尾的形状,并显式面对门槛偏差。 从 Pareto 对数超额的似然得到简单公式,但一般重尾下还要让所用极端次序数 k 满足 k → ∞ 、k / n → 0 ;渐近正态的中心还可能带二阶尾偏差,不能只移用固定正则模型的标准误。
数值实现应报告初值、收敛准则、约束和目标值,并用梯度、Hessian 或多起点检查解,而不是把软件的 success 标记当统计保证。
似然乘任意只依赖数据的正因子或取严格递增变换都不改变 MLE;乘含参数惩罚项则产生 penalized likelihood。后者可能改善有限样本风险并保证存在,但应以新规则名称分析,不能把惩罚造成的偏差藏在原始 MLE 定义中。
参考资料
A. W. van der Vaart, Asymptotic Statistics , Cambridge University Press, 1998,Ch. 5。
Erich L. Lehmann and George Casella, Theory of Point Estimation , 2nd ed., Springer, 1998,Ch. 6。
Thomas S. Ferguson, A Course in Large Sample Theory , Chapman & Hall, 1996,Ch. 16。