Skip to content

似然函数

Likelihood function

固定观测样本后,将共同支配密度视为参数函数所得的相对证据量。

形式陈述

先看最常用的两种入口。若 X 离散,模型给出概率质量 pθ(x)=Pθ(X=x);若 XRd 上有密度,模型给出 pθ(x)。观测到 x 后,两种情形都把同一个公式改看成参数的函数 L(θ;x)=pθ(x)。这个具体版本足以进入 Bernoulli、Poisson、正态等常见模型;下面的共同支配表述则说明为什么两种入口属于同一个定义。

设模型 {Pθ:θΘ} 被同一 σ-有限测度 μ 支配,即 Pθμ。由 Radon–Nikodym 定理可取密度

pθ(x)=dPθdμ(x).

观测固定为 x 后,似然函数定义为

L(θ;x)=pθ(x),θΘ.

这里 x 是已观测常量、θ 是函数自变量。独立样本 x1,,xn 的似然为

L(θ;x1:n)=i=1npθ(xi),

对数似然为 (θ)=ilogpθ(xi),在所有因子为正时把乘积化为和。最大似然估计是任一满足

θ^argmaxθΘL(θ;x)

的参数;最大值可能不存在、不唯一,或落在参数空间边界。

若换共同支配测度为 ν,并且密度转换给似然乘上只依赖 x、不依赖 θ 的正因子,则参数之间的似然比和极大点不变。因而似然作为绝对数值不是坐标自由对象,似然比才携带稳定的相对信息。

直觉

似然反转了密度公式的观察角度:模型给定参数时描述数据在哪里常见;数据到手后,则用同一数值比较哪些参数更能解释这次观测。它没有把参数自动变成随机变量,也不要求对 θ 积分为一。

只比较相对高度符合似然的用途。连续模型中单点概率为零,但密度在共同测度下仍能比较邻近小区域概率的一阶比例;这不是把零概率事件重新解释为正概率。

例子与计算

Bernoulli 样本中令 s=ixi,则

L(θ;x)=θs(1θ)ns,0θ1.

0<s<n,对数似然导数为

(θ)=sθns1θ,

解得 θ^=s/n。若 s=0s=n,极大点分别位于边界 01,不能只套内部一阶条件。

XiN(μ,σ2)σ 已知,

(μ)=C12σ2i=1n(xiμ)2,

所以最大化似然等价于最小化平方残差,得到 μ^=x¯。常数 C 可在求极大时丢弃,因为它不依赖 μ;若比较包含不同 σ 的模型,相应含 σ 的归一化项则不能删。

在一一参数变换 η=g(θ) 下,似然只需重新标记为 Lη(η;x)=L(g1(η);x),所以最大似然估计满足 η^=g(θ^)。这里不乘 Jacobian,因为没有对参数积分;Jacobian 属于先验或参数密度的变量替换。把两种变换规则混用,会凭空改变似然的极大点。

边界与失败情形

L(θ;x) 不是参数的概率密度。一般有 ΘL(θ;x)dθ1,而且重新参数化会引入不同的积分尺度。只有指定先验并通过 Bayes 公式归一化后,才得到后验分布。

不同观测空间或不同支配测度下的裸似然值不可随意横比。允许乘的因子必须与 θ 无关;若删去含参数的项,如正态密度中的 σn,会改变极大点和推断。

参数依赖的支持集会破坏许多常规微分论证。例如 XiUnif[0,θ]

L(θ;x)=θn1{θx(n)},

极大似然为样本最大值,位于支持边界;把指示函数忽略后求导会得到错误结论。

推论与应用

似然比 L(θ1;x)/L(θ0;x) 比较两个简单假设,是 Neyman–Pearson 检验的核心统计量。得分函数、观测信息与 Fisher 信息来自对数似然的一、二阶导数,但需要可交换微分与积分、参数无关支持等正则性。

似然只编码模型和当前数据提供的相对证据。有限样本偏差、过拟合、不可识别或模型失配不会因“取得最大值”自动消失,仍需风险、惩罚或预测检验评价。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§6.1–6.2。
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,Ch. 5。
  • Anthony W. F. Edwards, Likelihood, expanded ed., Johns Hopkins University Press, 1992,Ch. 1–2。