Skip to content

定义Definition

Score 与 Fisher 信息

Score function · Fisher information

对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。

形式陈述 ​

设共同支配模型有密度 pθ=dPθ/dμ,参数空间 Θ⊆Rk。在固定 θ 处,若 ϑ↦pϑ(x) 对 μ-几乎处处的 x 具有多元导数,单个观测的 score 向量定义为

sθ(x)=∇θlog⁡pθ(x)=∇θpθ(x)pθ(x),

其中只需在 pθ(x)>0 的 Pθ-几乎处处集合上定义。样本 score 是联合对数似然的梯度;若各观测在参数给定后独立且密度均为 pθ,则

Sn(θ)=∇ℓn(θ)=∑i=1nsθ(Xi).

若 score 二阶可积,单观测 Fisher 信息矩阵以期望定义为

I(θ)=Eθ[sθ(X)sθ(X)T].

它总是半正定,可能奇异。

不要求逐点导数的均方得分 ​

在内点 θ 处,还可通过平方根密度的二次均值可微性定义得分:若存在 sθ∈L2(Pθ;Rk),使

∫{pθ+h−pθ−12hTsθpθ}2dμ=o(‖h‖2),

则称 sθ 为均方得分,Fisher 信息仍定义为 Eθ[sθsθT]。得分在 Pθ-几乎处处意义下唯一;把上述展开代入密度归一化,平方范数的一阶项为 hTEθsθ,故 Eθsθ=0。

这一定义控制积分平方误差,本身不要求每个数据点的密度导数存在。若平方根密度关于参数几乎处处为 C1,且某邻域内的导数受一个 L2(μ) 包络控制,则微分可在 L2 中进行;在 pθ>0 处,均方得分等于 2∇pθ/pθ=∇log⁡pθ。因此它包含通常的光滑模型,却不能反过来由均方可微性断言逐点可微。

经典得分的正则条件 ​

若参数点位于 Θ 内部、支持集在该点附近不随参数变化,并存在可积包络允许把一阶微分移入 ∫pθdμ=1,则

Eθ[sθ(X)]=0,

若再有二阶可微与相应的微分—积分交换条件,才有曲率形式的信息等式

I(θ)=−Eθ[∇θ2log⁡pθ(X)].

在各观测 score 零均值的正则条件下,独立同分布样本的信息相加为 In(θ)=nI(θ);独立但不同分布时则是各项信息之和。若 score 均值不为零,展开联合 score 的外积还会出现交叉项,不能只靠独立性删去。观测信息 Jn(θ;x)=−∇2ℓn(θ;x) 随数据变化,其模型期望在正则条件下才等于 In(θ)。

直觉

Score 记录沿某个参数方向轻推模型时,这次观测的对数似然立即上升还是下降;Fisher 信息把这些随机斜率的外积在模型下平均,刻画相邻参数分布分离的二阶尺度。多参数情形中它是一张局部椭球:有信息的方向曲率大,平坦或不可识别方向会出现零特征值。

信息等式推导 ​

由归一化 ∫pθ(x)dμ(x)=1,在上述一阶正则条件下

0=∇θ∫pθdμ=∫pθ∇θlog⁡pθdμ=Eθ[sθ(X)].

对零均值恒等式再微分,乘积法则给

0=∇θEθ[sθ(X)]=Eθ[∇θ2log⁡pθ(X)+sθ(X)sθ(X)T],

移项便得到曲率公式。推导中的每个等号都有支配、可微与可积义务;支持边界移动时,第一个微分就会多出边界项。

例子与边界

若仪器读数 X∼N(μ,σ2) 且 σ 已知,

sμ(X)=X−μσ2,

所以

I(μ)=Eμ[(X−μ)2σ4]=1σ2.

对 n 个观测,score 方程 ∑i(Xi−μ)/σ2=0 的内部解为 X¯;总信息 n/σ2 的逆恰是 X¯ 的方差。这个吻合依赖正态位置模型的正则性,也依赖样本均值恰好达到信息界。

二元结局 X∼Bernoulli(p) 中

sp(X)=Xp−1−X1−p=X−pp(1−p),

故内部参数处 Ip(p)=1/[p(1−p)]。该数在 p 接近边界时发散,主要反映概率坐标被压缩;它不能解释成单次稀有事件观测携带了无限的坐标无关信息。

对 logit 参数 η=logp/(1−p),链式法则给 dp/dη=p(1−p),所以

Iη(η)=Ip(p)(dpdη)2=p(1−p).

两个公式一个趋于无穷、一个趋于零,却描述同一分布族。一般地,若 θ=h(η) 且 J=∂θ/∂η,则

sη=JTsθ,Iη=JTIθJ.

坐标变换保持的是信息二次型,而非某个矩阵元素的裸数值。

边界与失败情形 ​

Uniform(0,θ) 的支持为 [0,θ]。若忽略似然中的边界指示,只对 −log⁡θ 求导,会得到恒为 −1/θ 的“score”,其期望显然不为零。归一化积分的上限也在移动,遗漏的边界项正好说明常规零均值与 Hessian 等式为何失效。

信息矩阵奇异可能来自不可识别、冗余坐标,也可能来自参数点处的一阶变化退化。例如 X∼N(θ3,1) 的参数化是一一的,但

sθ(X)=3θ2(X−θ3),I(θ)=9θ4.

在 θ=0 信息为零,是因为均值对参数的一阶导数为零。此处 IID 样本的 MLE 为 θ^=X¯3;因 nX¯∼N(0,1),有 n1/6θ^=dZ3,其中 Z∼N(0,1)。速率与极限形状均偏离常规正态理论。此时不能直接把 I−1 当成协方差;常规 Cramér–Rao 界和 n 渐近正态公式需要重新检查切空间与更高阶变化。

Fisher 信息是模型内、参数局部的辨别尺度,与 Shannon 熵或文件所含“信息量”并非同一概念。模型失配时,score 外积的期望 B 与负期望 Hessian A 往往不同,极值估计的协方差呈 A−1BA−T,不能继续以单个 I−1 代替。

有限且正的信息也不保证 MLE 存在、唯一或无偏。信息只描述真参数附近的二阶模型几何,无法单独控制全局似然形状和参数空间边界。

真参数处的样本 score 通常仍是随机量,正则条件只使它的模型期望为零。MLE 处 score 等于零则是内部优化的一阶条件;前一个“零”沿重复抽样平均,后一个“零”沿参数方向求极值,两者不能互相推出。

若只观察不依赖未知参数的统计量 T(X),假设其诱导模型正则,且允许在每个 σ(T) 事件的概率积分中把参数微分移入积分,则它自己的 score 是完整数据 score 的条件期望,故条件方差不等式给 IT(θ)⪯IX(θ)。当 T 充分时,参数相关部分全部经 T 保留,信息不损失;一般数据处理则只会丢失局部辨别能力。

推论与应用

正则 MLE 的一阶条件与似然 Taylor 展开把样本 score、观测 Hessian 和渐近正态性连起来;在正确指定且信息非奇异的模型中,常得到

n(θ^n−θ0)⇒Nk(0,I(θ0)−1).

极限协方差是 I(θ0)−1;未缩放估计量的常用近似协方差才是 I(θ0)−1/n。弱收敛本身不保证二阶矩收敛,因此把该近似进一步写成真实协方差的渐近等式,还需矩的一致可积等条件。

Cramér–Rao 下界通过 Cauchy–Schwarz 把信息转成正则无偏估计的方差界;Wald 与 Score 检验在零假设附近使用同一局部几何。计算上,Newton 法使用观测 Hessian,Fisher scoring 用期望信息替代它;更新矩阵相似不意味着二者在有限样本中相同。

Cox 部分似然的每次事件得分贡献,就是实际事件者协变量减去风险集加权均值。Schoenfeld 残差把这些贡献逐次保留:即使总得分为零,早晚残差的趋势仍可揭示固定系数遗漏的时间结构。

参考资料
  • A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§7.2。

  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。

  • David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 9。

  • John Duchi, Stats 300b: Local Asymptotics and Optimality, Stanford, 2021,幻灯片 14–6 至 14–7:二次均值可微、均方得分的零均值与 Fisher 信息。

关系图谱21 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系