“设 $F$ 是由有界损失组成、从 $\mathcal Z$ 到 $[0,1]$ 的固定函数类,$S=(Z 1,\ldots,Z m)\sim D^m$。采用Rademacher 复杂度”
形式陈述 ​
损失与总体风险 ​
损失函数先评价预测器的一次行动。若真实标签在
也可以把特征和标签合为观测
其中的平均是期望。若
直觉
0–1 损失直接给分类错误率,却非凸且不连续。概率预测的 log loss 重罚自信的错误。平方损失的条件最优动作是均值,绝对损失则是中位数;代价敏感分类还会因假阴性和假阳性代价不同而改变阈值。同一个数据来源并不自动决定唯一损失,目标还取决于行动后果。
一个两类医疗筛查例子能看出代价的作用。若漏诊代价为
比较两式得到阈值
例子与边界
附加性质与尾部边界 ​
非负、有界、凸、光滑都是损失的附加性质,彼此不等价。凸性有助于求解经验目标,却不保证该目标与最终业务损失一致;代理风险能否控制 0–1 风险,需要校准或转换界。最大似然只在明确的概率模型下对应经验对数损失最小化,也不是 ERM 的同义词。
还要区分损失范围与风险估计方法。0–1 损失天然落在
经验评价与非逐点目标 ​
若
损失还可能依赖样本
风险是决策评价,不是概率分布之间固定的距离。交叉熵、KL 和 log loss 只在指定真分布与预测分布后出现相应恒等关系;类权重、截断或确定标签都会改变对象。散度可以解释某些风险,却不能替代损失和预测协议的定义。
推论与应用
把总体期望换成训练样本平均,就得到经验风险与泛化间隙;学习理论随后要证明数据依赖预测器的经验表现何时能够代表总体表现。若目标是所有可测规则中的最优行动,则条件风险逐点最小化导向 Bayes 预测器与 Bayes 风险。
当直接损失难以优化时,可以改用凸代理损失,但必须再证明代理超额风险如何控制原任务风险。正则化、PAC-Bayes 与稳定性方法也都以本页风险为最终尺度;它们改变的是选择规则或证明工具,不会替代对损失语义的声明。
参考资料
- Mohri, Rostamizadeh, Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018, Ch. 2.
- Bartlett, Mendelson, “Rademacher and Gaussian Complexities,” JMLR, 2002.