形式陈述
统计决策问题由模型 、行动空间 与损失函数
组成。非随机化决策规则是样本空间到行动空间的可测映射 ;允许随机化时, 是给定观测后抽取行动的概率核公理库概率核(Markov 核)Probability kernel · Markov kernel · 转移核从每个输入状态可测地指定一个输出概率分布的映射。。规则必须在不知道真实 时可实施。若 是目标 的取值空间, 便称为估计量并记作 ;估计量因此是有特定目标的统计量公理库统计量与抽样分布Statistic · Sampling distribution样本的可测数据摘要,以及该摘要在指定统计模型与重复抽样设计下的推前分布。,决策规则则还覆盖检验、分类与区间选择。
点风险先固定真实参数,再对样本和规则内部随机性取期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。:
对随机化核,右端应理解为 ;符号 此时包含在给定数据后再抽取行动的一步。由于损失非负,这个积分可取无穷,而不需要先假设风险有限。
因此 是定义在参数空间上的函数,不是一个脱离量词的评分。给定参数先验 ,Bayes 风险为
而最坏情形风险为 。Bayes 规则最小化 ,minimax公理库极小极大风险Minimax risk在模型族最坏参数上评价算法风险,再在所有允许算法中寻找最优值。 规则最小化最坏情形风险;先对参数平均与先取最坏点是两种不同的决策承诺。
直觉
模型描述数据怎样随机出现,规则描述看到数据后做什么,损失把行动后果换成可比较的数值,风险再沿重复抽样取平均。这四层不能合并:一份样本上的误差可能偶然很小,风险比较的却是同一真实参数下反复使用整套规则的长期表现。
“最优”必须连同行动空间、损失与参数量词给出。平方损失重罚大误差,绝对损失按距离线性计费,非对称损失可以让漏诊比误报更昂贵;即使模型与数据完全相同,三种损失也可能选择不同规则。
例子与边界
设校准实验的读数 独立同分布于 , 已知,以平方损失 估计仪器偏移 。样本均值规则 的风险为
与 无关。
若先验工程知识表明偏移常靠近零,可以考察固定收缩规则 :
第一项来自抽样波动,第二项来自系统收缩。对靠近零的 ,适度收缩可能降低点风险;在无界参数空间上,任何固定 的最坏风险却因 项而无穷大。一个局部区域的改进不能升级成全参数空间支配。
若具体取 ,记 ,则先验平均后的风险为 。对 求导得 ,故最优收缩系数是 。观测噪声越大便越向零收缩;先验越分散便越接近样本均值。这是按指定先验平均的最优选择,仍没有推翻前面的最坏风险结论。
一般平方损失下,任意二阶可积估计量都满足逐参数分解
这是在同一个 下展开平方所得的恒等式。无偏只消去第二项,不保证第一项小,更不保证其他损失下表现好;偏差—方差—MSE公理库偏差、方差与均方误差Bias–variance decomposition · Mean squared error平方损失下将点态估计风险精确拆成抽样波动与系统位移,并说明两者的权衡边界。必须作为平方损失风险的特例来理解。
在疾病筛查的二元决策中,行动空间为 。若漏诊损失为 、误报损失为 ,且 ,风险会分别加权两类错误概率;把两项权重都设为一才得到对称 – 损失。例如给定检测结果后患病概率为 ,转诊的条件损失是 ,不转诊的是 ;因此当 时选择转诊。漏诊越昂贵,阈值越低;若两项损失都为零,两种行动的损失恒为零,就无需计算这个阈值。这一步是在已有概率判断上比较行动后果,说明模型与损失各自承担什么工作。
边界与失败情形
实际数据上通常连 都无法直接计算,因为真参数未知;风险更是模型下对潜在重复实验的期望。交叉验证、无偏风险估计和测试集误差是估计风险的不同工具,不应倒过来充当定义。
预测问题常把未来 也纳入损失期望;参数估计的点风险固定 ,平均的是当前实验与规则随机性。两者可以放进同一决策框架,前提是明确哪些随机量在训练阶段、哪些在未来预测阶段,而不是因为都写作 risk 就互换公式。
期望风险较小不保证每次误差都小,也不直接控制尾部灾难概率。应用若关心超限概率、约束违反或风险敏感效用,应把这些要求写进损失或另给风险泛函。可积性同样是实质条件:重尾数据配上增长过快的损失会使风险为无穷。
随机化规则的风险要同时平均数据和内部随机币。随机币若依赖未知参数,规则便不可实施;若只报告种子平均结果,还要确认应用确实接受这种平均,而不是要求每个部署实例都满足硬约束。
推论与应用
若对所有 都有 ,且至少一个参数点严格,便称 支配 。不被任何其他规则支配称为 admissible;这只排除一致更差的规则,并不保证它在 Bayes、minimax 或有限样本某一点上唯一最优。
在可测选择存在时,Bayes 规则公理库Bayes 估计量与后验风险Bayes estimator · Posterior expected loss给定观测后最小化后验期望损失的行动规则及其条件风险。可通过逐数据最小化后验期望损失得到。实值行动不受约束时,后验二阶矩有限保证平方损失由后验均值最小化;后验一阶绝对矩有限时,绝对损失由后验中位数最小化。若风险处处为无穷,便不能靠这套有限矩推导选出有意义的最优行动。
minimax 分析寻找任何规则都无法避开的最坏参数风险。Cramér–Rao、Rao–Blackwell 与 Lehmann–Scheffé 等后续结果则在更窄的模型、损失或无偏类中比较规则,使用前仍要说明本页的完整决策问题。
参考资料
-
Erich L. Lehmann and George Casella, Theory of Point Estimation, 2nd ed., Springer, 1998,Ch. 1–2。
-
Thomas S. Ferguson, Mathematical Statistics: A Decision Theoretic Approach, Academic Press, 1967,Ch. 1–2。
-
James O. Berger, Statistical Decision Theory and Bayesian Analysis, 2nd ed., Springer, 1985,Ch. 1–4。
-
Larry Wasserman, All of Statistics: A Concise Course in Statistical Inference, Springer, 2004,§§12.1–12.2:损失、点风险、Bayes 与最坏风险,CMU 教材全文。