Skip to content

Score 与 Fisher 信息

Score function · Fisher information

对数似然对参数的局部导数,以及该导数在模型下的二阶平均变化尺度。

形式陈述

设支配模型密度 pθ(x)θΘRk 可微,且 pθ(x)>0 的区域适合定义导数。单个观测的 score 向量为

sθ(x)=θlogpθ(x).

样本 score 是对数似然梯度;独立样本下

Sn(θ)=n(θ)=i=1nsθ(Xi).

sθ 二阶可积,Fisher 信息矩阵以期望定义为

I(θ)=Eθ[sθ(X)sθ(X)T].

在可将微分移入积分且支持不随参数变化等正则条件下,

Eθ[sθ(X)]=0,

并有信息等式

I(θ)=Eθ[θ2logpθ(X)].

独立样本信息相加:In(θ)=nI(θ)。观测信息 2n(θ) 是数据依赖矩阵,不等于其期望 Fisher 信息。

推导

由归一化 pθ(x)dμ(x)=1,若允许交换导数与积分,则

0=θpθdμ=pθθlogpθdμ=Eθ[sθ(X)].

再对该零均值求导,乘积法则产生 score 外积与 log 密度 Hessian,移项即得两种信息公式。每一步都依赖支配、可微和可积包络,而非纯符号恒等式。

例子与计算

XN(μ,σ2)σ 已知,

sμ(X)=Xμσ2,

所以

I(μ)=Eμ[(Xμ)2σ4]=1σ2.

n 个观测,score 方程为 i(Xiμ)/σ2=0,解为 X¯;信息 n/σ2 的逆恰是 X¯ 的方差 σ2/n

Bernoulli(p)

sp(X)=Xp1X1p=Xpp(1p),

I(p)=1/[p(1p)]。参数接近边界时该坐标中的信息发散,反映概率坐标尺度压缩;改用 logit 参数后信息按 Jacobian 变换。

对 logit 参数 η=logp/(1p),链式法则给 dp/dη=p(1p),所以

Iη(η)=Ip(p)(dpdη)2=p(1p).

两个公式一个在边界发散、一个趋零,却描述同一分布族的不同坐标。真正不变的是信息二次型,而不是矩阵元素的裸数值。

边界与失败情形

Uniform(0,θ) 的支持依赖参数。若忽略边界指示,只对 logθ 求导,会得到 score 1/θ,其期望不为零;归一化积分的导数还有移动边界项,常规等式失效。

信息矩阵奇异可来自不可识别或冗余参数。奇异时不能直接取 I1 作为协方差,常规 Cramér–Rao 与渐近正态公式也需修改。

Fisher 信息是模型内局部曲率,不是样本中“信息量”的通用语义度量。模型失配时 score 方差与负期望 Hessian可能不同,产生 sandwich 协方差。

有限信息不保证 MLE 存在或无偏;信息下界还需要估计量和模型的正则条件。

样本 score 在真参数处通常是随机的,不应逐样本等于零;等于零的是正则条件下的模型期望。MLE 处 score 为零则是优化一阶条件,两种“零”分别关于抽样平均和参数极值,不能相互证明。

标量正则模型中,对无偏估计量 T 估计 g(θ),把无偏恒等式求导并对 score 使用 Cauchy–Schwarz,可得 Varθ(T)g(θ)2/In(θ)。等号要求中心化估计误差与 score 成比例;信息大只给潜在下界,不保证任意估计量达到。

推论与应用

一一光滑重参数化 η=g(θ) 下,信息按 Jacobian 合同变换,二次线元保持统计几何意义。正则 MLE 的渐近协方差常为 I(θ0)1/n

score 检验在零假设参数处计算梯度,无需拟合完整备择;Newton 与 Fisher scoring 则分别使用观测 Hessian或期望信息更新参数。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§7.2。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。
  • David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 9。