Skip to content

估计量、决策规则与风险

Estimator and decision rule · Statistical risk

将观测映为行动的规则,以及在每个参数下对抽样随机性平均后的损失。

形式陈述

统计决策问题由模型 {Pθ:θΘ}、行动空间 A 与损失函数

L:Θ×A[0,]

组成。决策规则是样本空间到行动空间的可测映射 δ:XA;允许随机化时,δ(dax) 是从观测到行动的概率核。若行动用于估计目标 g(θ),决策规则通常称为估计量并记作 g^=δ(X)

点风险是在固定参数 θ 下对样本及规则随机性取期望:

R(θ,δ)=Eθ[L(θ,δ(X))].

风险是 θ 的函数,不是单个无条件数字。给定参数先验 π,Bayes 风险为

r(π,δ)=ΘR(θ,δ)π(dθ),

而最坏情形风险为 supθΘR(θ,δ)。Bayes 规则最小化前者,minimax 规则最小化后者;二者的量词顺序和评价标准不同。

直觉

数据不会直接给出“正确行动”,决策规则负责把证据转成选择,损失函数则明确不同错误的代价。风险把同一真实参数下重复抽样造成的波动平均掉,因此比较的是规则的长期性能,而非某一份样本上恰好产生的误差。

没有损失就没有普遍最优估计量。平方损失重罚大偏差,绝对损失更稳健,01 损失关心是否完全答对;同一抽样分布下,它们可导出不同最优行动。

例子与计算

X1,,XnN(μ,σ2)σ2 已知,以平方损失 L(μ,a)=(aμ)2 估计 μ。样本均值 δ(X)=X¯ 的风险为

R(μ,X¯)=Eμ[(X¯μ)2]=Varμ(X¯)=σ2n,

μ 无关。

若用收缩规则 δc=cX¯,则

R(μ,δc)=c2σ2n+(1c)2μ2.

第一项是方差,第二项是偏差平方。对靠近零的 μ,适度收缩可降低风险;在无界参数空间上,任何固定 c1 的最坏风险却因 μ2 项而无穷大。局部改进不能自动升级为全参数空间支配。

一般平方损失下,任意具有二阶矩的估计量 g^ 都满足逐参数分解

R(θ,g^)=Varθ(g^)+(Eθ[g^]g(θ))2.

这是同一个 θ 下的恒等式,不是把模型中不同参数点的方差和偏差拼接。它说明无偏只消去第二项,并不保证总风险最小;略有偏差的规则可能以更大的方差下降换得较低风险。

在二元检验中,行动空间为 {0,1}01 损失把错误决定计为一。此时风险分别成为第一类或第二类错误概率,说明估计与检验共享同一决策论骨架。

边界与失败情形

观测损失 L(θ,δ(x)) 通常不可计算,因为真实 θ 未知;风险更是模型下的理论期望。交叉验证或经验风险是风险估计工具,不等于风险定义。

学习理论的总体风险常写为对未来样本 (X,Y) 的预测损失期望;统计决策风险则固定参数并平均当前实验及规则随机性。两者形式相似,但随机对象与外层量词必须逐项对齐,不能因都叫 risk 就互换。

风险较小不保证每次误差较小,也不描述尾部灾难概率。若应用关心高概率界、约束违反或非对称代价,应将其写进损失或另加风险度量。期望存在也需可积性;重尾损失可能使风险为无穷。

随机化规则的风险必须同时平均数据和内部随机币。若随机币依赖未知参数,规则无法实施;若只报告对随机种子平均的好结果而忽略某些种子的灾难行为,也应说明评价标准确实接受这种平均。

推论与应用

估计量 δ1 支配 δ2,若对所有 θR(θ,δ1)R(θ,δ2) 且至少一点严格。不存在被另一规则支配的规则称为 admissible;这是一项全参数空间比较,不等于某个数据集上的排名。

Bayes 规则在平方损失下常为后验均值,在绝对损失下常为后验中位数,在 01 型决策下对应后验概率最大的行动。minimax 下界则寻找任何规则都无法避开的最坏参数风险。

参考资料
  • Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1–2。
  • Thomas S. Ferguson, Mathematical Statistics: A Decision Theoretic Approach, Academic Press, 1967,Ch. 1–2。
  • James O. Berger, Statistical Decision Theory and Bayesian Analysis, 2nd ed., Springer, 1985,Ch. 1–4。