形式陈述
设共同支配模型公理库似然函数Likelihood function固定可观测数据后,由共同支配密度定义、仅在参数间作相对比较的似然函数。有密度 ,参数空间 。在固定 处,若 对 -几乎处处的 可微分公理库导数Derivative函数增量比在步长趋零时的极限。,单个观测的 score 向量定义为
其中只需在 的 -几乎处处集合上定义。样本 score 是联合对数似然的梯度;条件独立时
若 score 二阶可积,单观测 Fisher 信息矩阵以期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。定义为
它总是半正定,可能奇异。若参数点位于 内部、支持集在该点附近不随参数变化,并存在可积包络允许把一阶微分移入 ,则
若再有二阶可微与相应的微分—积分交换条件,才有曲率形式的信息等式
独立同分布样本的信息相加为 ;独立但不同分布时则是各项信息之和。观测信息 随数据变化,其模型期望在正则条件下才等于 。
直觉
Score 记录沿某个参数方向轻推模型时,这次观测的对数似然立即上升还是下降;Fisher 信息把这些随机斜率的外积在模型下平均,刻画相邻参数分布分离的二阶尺度。多参数情形中它是一张局部椭球:有信息的方向曲率大,平坦或不可识别方向会出现零特征值。
信息等式推导
由归一化 ,在上述一阶正则条件下
对零均值恒等式再微分,乘积法则给
移项便得到曲率公式。推导中的每个等号都有支配、可微与可积义务;支持边界移动时,第一个微分就会多出边界项。
例子与边界
若仪器读数 且 已知,
所以
对 个观测,score 方程 的内部解为 ;总信息 的逆恰是 的方差。这个吻合依赖正态位置模型的正则性,也依赖样本均值恰好达到信息界。
二元结局 中
故内部参数处 。该数在 接近边界时发散,主要反映概率坐标被压缩;它不能解释成单次稀有事件观测携带了无限的坐标无关信息。
对 logit 参数 ,链式法则给 ,所以
两个公式一个趋于无穷、一个趋于零,却描述同一分布族。一般地,若 且 ,则
坐标变换保持的是信息二次型,而非某个矩阵元素的裸数值。
边界与失败情形
Uniform 的支持为 。若忽略似然中的边界指示,只对 求导,会得到恒为 的“score”,其期望显然不为零。归一化积分的上限也在移动,遗漏的边界项正好说明常规零均值与 Hessian 等式为何失效。
信息矩阵奇异可能来自不可识别、冗余坐标,也可能来自参数点处的一阶变化退化。此时不能直接把 当成协方差;常规 Cramér–Rao 界和 渐近正态公式都需要切空间、广义逆或更高阶分析。
Fisher 信息是模型内、参数局部的辨别尺度,与 Shannon 熵或文件所含“信息量”并非同一概念。模型失配时,score 外积的期望 与负期望 Hessian 往往不同,极值估计的协方差呈 ,不能继续以单个 代替。
有限且正的信息也不保证 MLE 存在、唯一或无偏。信息只描述真参数附近的二阶模型几何,无法单独控制全局似然形状和参数空间边界。
真参数处的样本 score 通常仍是随机量,正则条件只使它的模型期望为零。MLE 处 score 等于零则是内部优化的一阶条件;前一个“零”沿重复抽样平均,后一个“零”沿参数方向求极值,两者不能互相推出。
若只观察统计量 ,在正则条件下它自己的 score 是完整数据 score 的条件期望,故条件方差不等式给 。当 充分公理库充分统计量Sufficient statistic以参数无关的条件分布保留整个模型区分能力的数据压缩,并连接因子分解与决策等价。时,参数相关部分全部经 保留,信息不损失;一般数据处理则只会丢失局部辨别能力。
推论与应用
正则 MLE 的一阶条件与似然 Taylor 展开把样本 score、观测 Hessian和渐近正态性公理库估计量的渐近正态性Asymptotic normality of estimators估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。连起来;在正确指定且信息非奇异的模型中,常得到极限协方差 。
Cramér–Rao 下界公理库Cramér–Rao 下界Cramér–Rao lower bound · Information inequality正则可微模型中由 score 协方差恒等式推出的方差与 MSE 下界、等号条件及非正则边界。通过 Cauchy–Schwarz 把信息转成正则无偏估计的方差界;Wald 与 Score 检验公理库Wald、Score 与 LR 渐近检验Wald test · Score test · Lagrange multiplier test用估计量距离、零点梯度或似然差构造的三类正则大样本检验。在零假设附近使用同一局部几何。计算上,Newton 法使用观测 Hessian,Fisher scoring 用期望信息替代它;更新矩阵相似不意味着二者在有限样本中相同。
参考资料
- A. W. van der Vaart, Asymptotic Statistics, Cambridge University Press, 1998,§7.2。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。
- David R. Cox and David V. Hinkley, Theoretical Statistics, Chapman & Hall, 1974,Ch. 9。