Skip to content

损失函数与总体风险

Loss function · Population risk · Expected risk

损失刻画一次决策的代价,总体风险是未知分布下的平均代价。

损失与总体风险

损失函数先评价一次预测。若真实标签在 Y 中、预测落在 Y^ 中,可写成

:Y^×YR{+}.

也可以把特征和标签合为观测 Z,写成 (h,Z)。给定预测器 h 与未来观测分布 D,总体风险是

RD(h)=EZD[(h,Z)].

它评价新的观测,不是训练样本上的平均。定义要求损失可测且期望有意义;总体风险也允许为 +,这时依赖有限风险的比较或集中结论便没有适用对象。统计决策风险使用同一“行动—损失—期望”骨架,但还会把未知状态和分布族放在外层量词中。

换损失会换问题

0–1 损失直接给分类错误率,却非凸且不连续。概率预测的 log loss 重罚自信的错误。平方损失的条件最优动作是均值,绝对损失则是中位数;代价敏感分类还会因假阴性和假阳性代价不同而改变阈值。同一个数据来源并不自动决定唯一损失,目标还取决于行动后果。

一个两类医疗筛查例子能看出代价的作用。若漏诊代价为 20、误报代价为 1,且 η(x)=Pr(Y=1X=x),预测阳性的条件代价是 1η(x),预测阴性是 20η(x);因此当 η(x)>1/21 就应报阳性,而不是等到 1/2。同一批概率预测在 0–1 错误率下可能显得“误报太多”,在规定损失下却是最优决策。

附加性质与尾部边界

非负、有界、凸、光滑都是损失的附加性质,彼此不等价。凸性有助于求解经验目标,却不保证该目标与最终业务损失一致;代理风险能否控制 0–1 风险,需要校准或转换界。最大似然只在明确的概率模型下对应经验对数损失最小化,也不是 ERM 的同义词。

还要区分损失的范围与风险的估计方法。0–1 损失天然落在 [0,1],可直接用 Hoeffding;对数损失在预测概率趋近零时无界,即便期望有限,也不能原样套同一常数。截断概率、次指数尾假设或专门的似然分析都是额外选择,不能藏在“取期望”四个字里。

经验评价与非逐点目标

h 随机,风险通常还要对预测随机性取期望。比较经验风险、Bayes 风险和超额风险时,必须固定同一分布、损失与输出语义;否则同名的“风险差”可能比较的是不同决策问题。

损失还可能依赖样本 z 而不只依赖 (y^,y),例如不同病人的漏诊代价不同,或排序损失同时比较两个样本。后一类不再是 IID 单点损失的简单平均,需要 U 统计量等工具。把所有训练目标都写成 m1i(h,Zi) 会漏掉这种依赖结构。

风险是决策评价,不是概率分布之间固定的距离。交叉熵、KL 和 log loss 只在指定真分布与预测分布后出现相应恒等关系;类权重、截断或确定标签都会改变对象。散度可以解释某些风险,却不能替代损失和预测协议的定义。

参考资料
  • Mohri, Rostamizadeh, Talwalkar, Foundations of Machine Learning, Ch. 2.
  • Bartlett, Mendelson, “Rademacher and Gaussian Complexities,” JMLR, 2002.