形式陈述
设标量参数 位于参数空间内部, 个观测的联合密度 具有不随 移动的共同支持。假设密度对参数可微,允许分别把 移入 与 ,且样本Fisher 信息公理库Score 与 Fisher 信息Score function · Fisher information对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 有限、严格为正。若 二阶可积,记
则
对独立同分布样本,。若 无偏估计可微目标 ,便有
若偏差 可微,带偏版本为
结合MSE 分解公理库偏差、方差与均方误差Bias–variance decomposition · Mean squared error平方损失下将点态估计风险精确拆成抽样波动与系统位移,并说明两者的权衡边界。可得
这条式子同时显示,单看方差界会漏掉偏差本身的代价。
直觉
推导
令样本 score 为 。一阶正则性给
对 求导并移入积分:
由Cauchy–Schwarz 不等式公理库Cauchy–Schwarz 不等式Cauchy–Schwarz inequality · 柯西–施瓦茨不等式内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。,
代入 score 方差即得结论。Cauchy–Schwarz 的等号条件要求
在 -几乎处处意义下成立。若要同一估计量在整个参数空间都有效, 的表达式必须同时满足所有参数点的比例关系,且不能偷偷使用未知 ;多数模型的界因此严格而不可达。
例子与边界
若校准读数 , 已知,单样本信息 。任何正则无偏估计 的规则都满足
样本均值的方差恰为 ,且
所以它在每个 达到等号。这是“可达”需要的完整核对,而不仅是界值与某个方差碰巧相同。
在暴露时长不同的事故计数中,设独立 ,其中 已知、 是单位暴露率。总信息为
无偏率估计 的方差为 ,并满足等号条件。若把不同暴露时长当作同长重复计数,信息与估计量都会算错。
边界与失败情形
Uniform 的支持随参数移动,score 零均值与 的推导均漏掉边界项。样本最大值误差是 量级,看起来超过常规 尺度,实质上它位于定理适用域之外。非正则模型可改用有限差分型信息界,不能强行套入本式。
Cramér–Rao 给出固定参数点的局部方差约束,不是所有估计量的 minimax 风险下界。允许偏差后,常数规则在某个参数点可以同时有零偏差和零 MSE;这类超效率或局部取巧说明,点态界无法替代参数邻域或全空间风险比较。
参数位于边界、信息矩阵奇异或目标不光滑时,普通逆矩阵公式没有意义。需要根据问题使用约束切空间、广义逆、局部渐近 minimax 界或其他非正则下界。
带 nuisance 参数时,把参数写成 并分块
若 可逆,估计 的有效信息是 Schur complement
而非对角块 。忽略与干扰参数的交叉信息会给出过度乐观的方差界。
带偏公式也没有把偏差选择问题优化掉。 与 受同一可实施估计规则约束,不能在每个参数点分别挑选最有利的函数值;逐点最小化右侧往往只构造出依赖未知参数的 oracle。
推论与应用
在正则、信息非奇异的向量参数模型中,若 无偏估计 ,矩阵版本为
其中 , 是全样本信息。半正定序同时控制每个线性方向;若要得到单个风险数字,还需指定方向或平方损失权重。
正则 MLE 的渐近协方差常达到信息逆,形成渐近效率公理库渐近效率Asymptotic efficiency用估计量的渐近协方差相对于正则模型信息下界衡量其局部大样本精度。。这项大样本结论允许有限样本偏差,也依赖局部正则性;它与“每个 都无偏并精确达到 Cramér–Rao 界”是两项独立命题。
参考资料
- Harald Cramér, Mathematical Methods of Statistics, Princeton University Press, 1946,Ch. 32。
- C. R. Rao, “Information and the Accuracy Attainable in the Estimation of Statistical Parameters,” 1945。
- Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 2。