Skip to content

损失函数与总体风险

Loss function · Population risk · Expected risk

损失刻画一次决策的代价,总体风险是未知分布下的平均代价。

条目类型
定义

形式陈述

损失与总体风险

损失函数先评价预测器的一次行动。若真实标签在 Y 中、预测落在 Y^ 中,可写成可测映射

:Y^×YR{+}.

也可以把特征和标签合为观测 Z=(X,Y),写成 (h,Z)=(h(X),Y)。给定与训练数据独立的新观测 ZD,预测器 h 的总体风险是

RD(h)=EZD[(h,Z)].

其中的平均是期望。若 h 由随机训练样本选出,RD(h) 在条件于 h 后仍只对新观测取期望;学习定理再对训练样本的随机性作高概率陈述。定义要求损失可测且期望有意义。总体风险允许为 +,但此时依赖有限风险差、Hoeffding 或 Rademacher 集中的结论没有适用对象。统计决策风险使用同一“行动—损失—期望”骨架,只是还把未知状态和模型族放在外层量词中。

直觉

0–1 损失直接给分类错误率,却非凸且不连续。概率预测的 log loss 重罚自信的错误。平方损失的条件最优动作是均值,绝对损失则是中位数;代价敏感分类还会因假阴性和假阳性代价不同而改变阈值。同一个数据来源并不自动决定唯一损失,目标还取决于行动后果。

一个两类医疗筛查例子能看出代价的作用。若漏诊代价为 20、误报代价为 1,且 η(x)=Pr(Y=1X=x),则

Lx(报阳性)=1η(x),Lx(报阴性)=20η(x).

比较两式得到阈值 η(x)>1/21,远低于对称 0–1 损失的 1/2。同一批概率预测在错误率下可能显得误报过多,在规定的临床损失下却是条件最优决策。

从单点损失到总体风险
例子与边界

附加性质与尾部边界

非负、有界、凸、光滑都是损失的附加性质,彼此不等价。凸性有助于求解经验目标,却不保证该目标与最终业务损失一致;代理风险能否控制 0–1 风险,需要校准或转换界。最大似然只在明确的概率模型下对应经验对数损失最小化,也不是 ERM 的同义词。

还要区分损失范围与风险估计方法。0–1 损失天然落在 [0,1],可直接使用有界变量集中;对数损失在预测概率趋近零时无界,即便期望有限,也不能原样套同一常数。截断概率、次指数尾假设或专门的似然分析都是额外选择,不能藏在“取期望”四个字里。

经验评价与非逐点目标

h 随机,风险通常还要对预测随机性取期望。比较经验风险、Bayes 风险和超额风险时,必须固定同一分布、损失与输出语义;否则同名的“风险差”可能比较的是不同决策问题。

损失还可能依赖样本 z 而不只依赖 (y^,y),例如不同病人的漏诊代价不同,或排序损失同时比较两个样本。后一类不再是 IID 单点损失的简单平均,需要 U 统计量等工具。把所有训练目标都写成 m1i(h,Zi) 会漏掉这种依赖结构。

风险是决策评价,不是概率分布之间固定的距离。交叉熵、KL 和 log loss 只在指定真分布与预测分布后出现相应恒等关系;类权重、截断或确定标签都会改变对象。散度可以解释某些风险,却不能替代损失和预测协议的定义。

推论与应用

把总体期望换成训练样本平均,就得到经验风险与泛化间隙;学习理论随后要证明数据依赖预测器的经验表现何时能够代表总体表现。若目标是所有可测规则中的最优行动,则条件风险逐点最小化导向 Bayes 预测器与 Bayes 风险。

当直接损失难以优化时,可以改用凸代理损失,但必须再证明代理超额风险如何控制原任务风险。正则化、PAC-Bayes 与稳定性方法也都以本页风险为最终尺度;它们改变的是选择规则或证明工具,不会替代对损失语义的声明。

参考资料
  • Mohri, Rostamizadeh, Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018, Ch. 2.
  • Bartlett, Mendelson, “Rademacher and Gaussian Complexities,” JMLR, 2002.
关系图谱50 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组