形式陈述
设可观测数据 的统计模型公理库统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。 被同一个 -有限测度 支配,即每个 。由Radon–Nikodym 定理公理库Radon–Nikodym 定理Radon–Nikodym theorem在标准 σ-有限条件下,把绝对连续测度表示为参考测度的积分密度。可选密度
模型先把 看作固定参数下数据 的质量或密度;观测到 后,似然把同一数值改看成参数的函数:
这里 已固定、 在候选空间内变化。离散模型通常以计数测度为 ,连续模型通常以 Lebesgue 测度为 ;两者的定义由共同支配表述统一。
若 在参数给定后独立,其联合密度分解,似然相应为
对数似然取扩展值 ,约定 ;在独立样本中它把乘积化为和。最大似然估计是任一满足
的参数;最大值可能不存在、不唯一,或落在参数空间边界。
密度版本或共同支配测度改变时,似然可乘以一个依赖数据 、但对所有 相同的正因子 。这不会改变同一观测下的似然比或极大点。因此“似然”严格说是这一比例等价类;它的绝对高度带有测度和单位选择,参数之间的相对高度才稳定。
直觉
可以把似然理解为横切一张密度曲面。生成分布时固定 、让 变化;推断时在已经看到的 处横切曲面、沿 方向比较高度。横切操作没有赋予参数随机性,也没有产生对参数空间归一化的测度。
连续模型中 并不妨碍使用密度:描述邻近微小区域概率相对于参考体积的一阶变化。它承担的是局部相对比较,不会把零概率单点重新解释成正概率事件。
例子与边界
在二元疗效试验中,令 为观察到的有效人数,则 Bernoulli 似然为
当 时,对数似然的内部导数为
解得 。若全部无效或全部有效,极大点落在 或 ;内部 score 方程此时没有合法根,参数空间边界必须纳入优化。
右删失生存数据展示似然必须对应实际观测。设故障时间 ,独立删失后看到 与 。若删失机制独立且其密度不含 ,与 有关的似然部分为
每个已故障个体贡献密度,每个仍在随访者贡献生存概率;把删失者当成在 时发生故障会多乘一项 ,得到错误模型。由上式,若至少观察到一次故障,MLE 为 。若删失分布也含待估参数,被省略的因子便不再是常数,必须写回联合似然。
在一一参数变换 下,似然重新标记为 ,所以 MLE 满足不变性 。这里没有对参数积分,因而不乘 Jacobian;先验密度或参数概率密度换元时才需要 Jacobian。混用两套规则会人为移动似然极大点。
边界与失败情形
对参数通常不积分为一,也没有自带的参数测度;重新参数化还会改变 的体积尺度。只有另行指定先验并用 Bayes 公式归一化,才得到参数的后验概率分布。似然区间与后验可信区间因此有不同的校准含义。
不同数据、不同观测空间或不同测量单位下的裸似然高度不可直接排名。求极大时能删除的项必须与所有待比较参数无关;例如估计正态尺度时删掉 会改变极大点,而删掉纯粹依赖已观测 的常数则安全。
参数依赖的支持集不能藏进“常数”。例如 时
极大似然为样本最大值并位于支持边界。若丢掉指示函数,只对 求导,既看不到可行域,也会误用后续 score 零均值和信息等式。
似然还继承模型的不可识别性:若 ,相容的密度版本会给两参数相同的似然函数几乎处处。有限样本的多峰则未必意味着不可识别,可能只反映观测证据不足;两种情况需要在分布族层面区分。
推论与应用
同一数据下的似然比 比较两个简单假设,是Neyman–Pearson 检验公理库Neyman–Pearson 引理Neyman–Pearson lemma简单零假设对简单备择下,给定显著性约束时似然比阈值检验具有最大功效。的关键统计量。Score 与 Fisher 信息公理库Score 与 Fisher 信息Score function · Fisher information对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。研究对数似然的局部变化,最大似然估计公理库最大似然估计Maximum likelihood estimation · MLE在参数空间内选择使已观测数据似然达到上确界的参数估计方法。寻找全参数空间的最高点;二者都要先检查支持集、可微性与可识别性。
因子分解定理还会追问似然关于数据的参数依赖能否只通过一个充分统计量公理库充分统计量Sufficient statistic以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。表达。无论是否压缩,似然只编码模型与当前数据给出的相对证据;有限样本风险、过拟合、模型失配和计算稳定性仍需各自的评价工具。
参考资料
- George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§6.1–6.2。
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
- Anthony W. F. Edwards, Likelihood, expanded ed., Johns Hopkins University Press, 1992,Ch. 1–2。