“在熵编码与概率模型评估中,熵给出无法消除的平均码长,KL 散度则量化使用错误分布造成的额外代价;语言模型与密度估计因此用交叉熵度量模型分布下的期望码长。当观测模型和支配测度已经指定时,样本交…”
方法定义 ​
给定模型似然
任何从该集合中可测选取的
当似然为正时,可等价最大化对数似然
内部可微极大点满足 score 方程
若
是
直觉 ​
MLE 把观测固定,寻找最能提高这份数据相对密度或质量的模型成员。它利用完整似然形状,而不是只匹配若干矩;求解却是优化问题,统计定义和数值算法要分开。
最大化是相对比较。似然的共同数据因子可删除,参数因子不可删除;把目标函数缩放为单调变换不会改变极大点,但近似、惩罚或截断会定义新的估计规则。
例子与计算 ​
若
当
若所有观测为零,内部 score 公式含
对 Uniform
在可行区间随
MLE 的有限样本状态还可由 likelihood profile 追踪。对正态均值、方差同时未知的模型,先固定
边界与失败情形 ​
在完全分离的 logistic 回归中,系数沿某方向趋于无穷时似然不断上升但无有限极大点。优化器返回很大的有限数不等于 MLE 存在;正则化会产生有解的新目标,却已不是原始 MLE。
混合模型似然可多峰,甚至因某成分方差趋零并包住一个观测而无界。局部优化收敛只证明找到驻点,不证明全局最大,更不解决模型奇异性。
MLE 不是 MAP。MAP 最大化似然乘先验密度,结果依赖先验和参数坐标;MLE 的一一变换不变性不需要 Jacobian。
一致性与渐近正态性需要可识别、统一大数律、真参数内部、似然正则等条件。有限样本中 MLE 可能有偏、风险较大或不存在。
参数空间是否闭合直接影响存在性。例如 Bernoulli 参数若错误限制为开区间
性质与应用 ​
在常规正则模型中,归一化对数似然趋近其期望,真参数因 Kullback–Leibler 对比唯一最大而得到一致性。Taylor 展开 score 再给出 Fisher 信息尺度的渐近正态性;这些是另需证明的定理链。
数值实现应报告初值、收敛准则、约束和目标值,并用梯度、Hessian 或多起点检查解,而不是把软件的 success 标记当统计保证。
似然乘任意只依赖数据的正因子或取严格递增变换都不改变 MLE;乘含参数惩罚项则产生 penalized likelihood。后者可能改善有限样本风险并保证存在,但应以新规则名称分析,不能把惩罚造成的偏差藏在原始 MLE 定义中。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 6。
- Thomas S. Ferguson, A Course in Large Sample Theory, Chapman & Hall, 1996,Ch. 16。