Skip to content

Score 与 Fisher 信息

Score function · Fisher information

对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。

领域
统计学
条目类型
定义

形式陈述

共同支配模型有密度 pθ=dPθ/dμ,参数空间 ΘRk。在固定 θ 处,若 ϑpϑ(x)μ-几乎处处的 x微分,单个观测的 score 向量定义为

sθ(x)=θlogpθ(x)=θpθ(x)pθ(x),

其中只需在 pθ(x)>0Pθ-几乎处处集合上定义。样本 score 是联合对数似然的梯度;条件独立时

Sn(θ)=n(θ)=i=1nsθ(Xi).

若 score 二阶可积,单观测 Fisher 信息矩阵以期望定义为

I(θ)=Eθ[sθ(X)sθ(X)T].

它总是半正定,可能奇异。若参数点位于 Θ 内部、支持集在该点附近不随参数变化,并存在可积包络允许把一阶微分移入 pθdμ=1,则

Eθ[sθ(X)]=0,

若再有二阶可微与相应的微分—积分交换条件,才有曲率形式的信息等式

I(θ)=Eθ[θ2logpθ(X)].

独立同分布样本的信息相加为 In(θ)=nI(θ);独立但不同分布时则是各项信息之和。观测信息 Jn(θ;x)=2n(θ;x) 随数据变化,其模型期望在正则条件下才等于 In(θ)

直觉

Score 记录沿某个参数方向轻推模型时,这次观测的对数似然立即上升还是下降;Fisher 信息把这些随机斜率的外积在模型下平均,刻画相邻参数分布分离的二阶尺度。多参数情形中它是一张局部椭球:有信息的方向曲率大,平坦或不可识别方向会出现零特征值。

信息等式推导

由归一化 pθ(x)dμ(x)=1,在上述一阶正则条件下

0=θpθdμ=pθθlogpθdμ=Eθ[sθ(X)].

对零均值恒等式再微分,乘积法则给

0=θEθ[sθ(X)]=Eθ[θ2logpθ(X)+sθ(X)sθ(X)T],

移项便得到曲率公式。推导中的每个等号都有支配、可微与可积义务;支持边界移动时,第一个微分就会多出边界项。

例子与边界

若仪器读数 XN(μ,σ2)σ 已知,

sμ(X)=Xμσ2,

所以

I(μ)=Eμ[(Xμ)2σ4]=1σ2.

n 个观测,score 方程 i(Xiμ)/σ2=0 的内部解为 X¯;总信息 n/σ2 的逆恰是 X¯ 的方差。这个吻合依赖正态位置模型的正则性,也依赖样本均值恰好达到信息界。

二元结局 XBernoulli(p)

sp(X)=Xp1X1p=Xpp(1p),

故内部参数处 Ip(p)=1/[p(1p)]。该数在 p 接近边界时发散,主要反映概率坐标被压缩;它不能解释成单次稀有事件观测携带了无限的坐标无关信息。

对 logit 参数 η=logp/(1p),链式法则给 dp/dη=p(1p),所以

Iη(η)=Ip(p)(dpdη)2=p(1p).

两个公式一个趋于无穷、一个趋于零,却描述同一分布族。一般地,若 θ=h(η)J=θ/η,则

sη=JTsθ,Iη=JTIθJ.

坐标变换保持的是信息二次型,而非某个矩阵元素的裸数值。

边界与失败情形

Uniform(0,θ) 的支持为 [0,θ]。若忽略似然中的边界指示,只对 logθ 求导,会得到恒为 1/θ 的“score”,其期望显然不为零。归一化积分的上限也在移动,遗漏的边界项正好说明常规零均值与 Hessian 等式为何失效。

信息矩阵奇异可能来自不可识别、冗余坐标,也可能来自参数点处的一阶变化退化。此时不能直接把 I1 当成协方差;常规 Cramér–Rao 界和 n 渐近正态公式都需要切空间、广义逆或更高阶分析。

Fisher 信息是模型内、参数局部的辨别尺度,与 Shannon 熵或文件所含“信息量”并非同一概念。模型失配时,score 外积的期望 B 与负期望 Hessian A 往往不同,极值估计的协方差呈 A1BAT,不能继续以单个 I1 代替。

有限且正的信息也不保证 MLE 存在、唯一或无偏。信息只描述真参数附近的二阶模型几何,无法单独控制全局似然形状和参数空间边界。

真参数处的样本 score 通常仍是随机量,正则条件只使它的模型期望为零。MLE 处 score 等于零则是内部优化的一阶条件;前一个“零”沿重复抽样平均,后一个“零”沿参数方向求极值,两者不能互相推出。

若只观察统计量 T(X),在正则条件下它自己的 score 是完整数据 score 的条件期望,故条件方差不等式给 IT(θ)IX(θ)。当 T 充分时,参数相关部分全部经 T 保留,信息不损失;一般数据处理则只会丢失局部辨别能力。

推论与应用

正则 MLE 的一阶条件与似然 Taylor 展开把样本 score、观测 Hessian和渐近正态性连起来;在正确指定且信息非奇异的模型中,常得到极限协方差 I(θ0)1/n

Cramér–Rao 下界通过 Cauchy–Schwarz 把信息转成正则无偏估计的方差界;Wald 与 Score 检验在零假设附近使用同一局部几何。计算上,Newton 法使用观测 Hessian,Fisher scoring 用期望信息替代它;更新矩阵相似不意味着二者在有限样本中相同。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§7.2。
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。
  • David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 9。
关系图谱16 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组