“统计似然把参数视为坐标时,score 是 log likelihood 对参数的梯度,其期望为零与信息等式依赖交换微分、积分等正则性;Hessian记录二阶局部曲率。它们属于具体统计模型的推…”
形式陈述 ​
设支配模型密度
样本 score 是对数似然梯度;独立样本下
若
在可将微分移入积分且支持不随参数变化等正则条件下,
并有信息等式
独立样本信息相加:
推导 ​
由归一化
再对该零均值求导,乘积法则产生 score 外积与 log 密度 Hessian,移项即得两种信息公式。每一步都依赖支配、可微和可积包络,而非纯符号恒等式。
例子与计算 ​
若
所以
对
Bernoulli
故
对 logit 参数
两个公式一个在边界发散、一个趋零,却描述同一分布族的不同坐标。真正不变的是信息二次型,而不是矩阵元素的裸数值。
边界与失败情形 ​
Uniform
信息矩阵奇异可来自不可识别或冗余参数。奇异时不能直接取
Fisher 信息是模型内局部曲率,不是样本中“信息量”的通用语义度量。模型失配时 score 方差与负期望 Hessian可能不同,产生 sandwich 协方差。
有限信息不保证 MLE 存在或无偏;信息下界还需要估计量和模型的正则条件。
样本 score 在真参数处通常是随机的,不应逐样本等于零;等于零的是正则条件下的模型期望。MLE 处 score 为零则是优化一阶条件,两种“零”分别关于抽样平均和参数极值,不能相互证明。
标量正则模型中,对无偏估计量
推论与应用 ​
一一光滑重参数化
score 检验在零假设参数处计算梯度,无需拟合完整备择;Newton 与 Fisher scoring 则分别使用观测 Hessian或期望信息更新参数。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§7.2。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。
- David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 9。