“共同支配统计模型以 $p \theta=\mathrm dP \theta/\mathrm d\mu$ 定义似然,参数比较只依赖这些导数的相对值。更换支配测度所产生的因子必须与 $\thet…”
形式陈述 ​
先看最常用的两种入口。若
设模型
观测固定为
这里
对数似然为
的参数;最大值可能不存在、不唯一,或落在参数空间边界。
若换共同支配测度为
直觉 ​
似然反转了密度公式的观察角度:模型给定参数时描述数据在哪里常见;数据到手后,则用同一数值比较哪些参数更能解释这次观测。它没有把参数自动变成随机变量,也不要求对
只比较相对高度符合似然的用途。连续模型中单点概率为零,但密度在共同测度下仍能比较邻近小区域概率的一阶比例;这不是把零概率事件重新解释为正概率。
例子与计算 ​
Bernoulli 样本中令
当
解得
对
所以最大化似然等价于最小化平方残差,得到
在一一参数变换
边界与失败情形 ​
不同观测空间或不同支配测度下的裸似然值不可随意横比。允许乘的因子必须与
参数依赖的支持集会破坏许多常规微分论证。例如
极大似然为样本最大值,位于支持边界;把指示函数忽略后求导会得到错误结论。
推论与应用 ​
似然比
似然只编码模型和当前数据提供的相对证据。有限样本偏差、过拟合、不可识别或模型失配不会因“取得最大值”自动消失,仍需风险、惩罚或预测检验评价。
参考资料
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§6.1–6.2。
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
- Anthony W. F. Edwards, Likelihood, expanded ed., Johns Hopkins University Press, 1992,Ch. 1–2。