形式陈述
损失与总体风险
损失函数先评价预测器公理库预测器与假设类Predictor · Hypothesis class区分可用于预测的函数、函数集合及其参数表示。的一次行动。若真实标签在 中、预测落在 中,可写成可测映射
也可以把特征和标签合为观测 ,写成 。给定与训练数据独立的新观测 ,预测器 的总体风险是
其中的平均是期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。。若 由随机训练样本选出, 在条件于 后仍只对新观测取期望;学习定理再对训练样本的随机性作高概率陈述。定义要求损失可测且期望有意义。非负损失的扩展期望总能定义;若允许正负值,至少要排除正部和负部期望同时为无穷,否则 不是风险。总体风险允许为 ,但此时依赖有限风险差、Hoeffding 或 Rademacher 集中的结论没有适用对象。统计决策风险公理库估计量、决策规则与风险Estimator and decision rule · Statistical risk从观测到行动的可实施规则,以及在逐参数、Bayes 与最坏情形量词下的期望损失。使用同一“行动—损失—期望”骨架,只是还把未知状态和模型族放在外层量词中。
直觉
0–1 损失直接给分类错误率,却非凸且不连续。概率预测的 log loss 重罚自信的错误。实值预测中,条件二阶矩有限时,平方损失选择条件均值;条件一阶绝对矩有限时,绝对损失选择条件中位数。这些是条件风险最小化公理库Bayes 预测器与 Bayes 风险Bayes predictor · Bayes classifier · Bayes risk已知真实联合分布时逐点最小化条件损失所得的最优决策。的结论,不能跳过矩条件。代价敏感分类还会因假阴性和假阳性代价不同而改变阈值;同一个数据来源并不自动决定唯一损失。
一个两类医疗筛查例子能看出代价的作用。若漏诊代价为 、误报代价为 ,且 ,则
比较两式得到阈值 ,远低于对称 0–1 损失的 。同一批概率预测在错误率下可能显得误报过多,在规定的临床损失下却是条件最优决策。
从单点损失到总体风险
例子与边界
附加性质与尾部边界
非负、有界、凸、光滑都是损失的附加性质,彼此不等价。凸性有助于求解经验目标,却不保证该目标与最终业务损失一致;代理风险能否控制 0–1 风险,需要校准或转换界。最大似然只在明确的概率模型下对应经验对数损失最小化,也不是 ERM 的同义词。
还要区分损失范围与风险估计方法。0–1 损失天然落在 ,可直接使用有界变量集中;对数损失在预测概率趋近零时无界,即便期望有限,也不能原样套同一常数。截断概率、次指数尾假设或专门的似然分析都是额外选择,不能藏在“取期望”四个字里。
经验评价与非逐点目标
若 随机,风险通常还要对预测随机性取期望。比较经验风险公理库经验风险与泛化间隙Empirical risk · Generalization gap训练平均损失与总体风险之差,以及数据依赖选择带来的困难。、Bayes 风险和超额风险时,必须固定同一分布、损失与输出语义;否则同名的“风险差”可能比较的是不同决策问题。
损失还可能依赖样本 而不只依赖 ,例如不同病人的漏诊代价不同,或排序损失同时比较两个样本。后一类不再是 IID 单点损失的简单平均,需要 U 统计量等工具。把所有训练目标都写成 会漏掉这种依赖结构。
以固定输入处的概率预测为例,若 、输出为 ,对数风险是 ,本例的对数与 KL 散度采用同一底数。当 时,减去最优值 ,恰得 。因此 KL 对应这个特定问题的超额风险,原风险还包含不可消去的标签熵。
若 却报 ,正标签事件带来无限对数损失;同一输出在 0–1 分类损失下仍只有有限错误率。这说明总体风险首先依赖行动与损失语义,并不是概率分布之间某种固定距离。类权重、概率截断都会改变上述恒等式。
推论与应用
把总体期望换成训练样本平均,就得到经验风险与泛化间隙公理库经验风险与泛化间隙Empirical risk · Generalization gap训练平均损失与总体风险之差,以及数据依赖选择带来的困难。;学习理论随后要证明数据依赖预测器的经验表现何时能够代表总体表现。若目标是所有可测规则中的最优行动,则条件风险逐点最小化导向 Bayes 预测器与 Bayes 风险。
当直接损失难以优化时,可以改用凸代理损失,但必须再证明代理超额风险如何控制原任务风险。正则化、PAC-Bayes 与稳定性方法也都以本页风险为最终尺度;它们改变的是选择规则或证明工具,不会替代对损失语义的声明。
风险的分布下标也确定了评价人群:源风险 与目标风险 即使用同一损失,也可能给模型相反的排序。协变量漂移公理库协变量漂移Covariate shift · 协变量偏移 · Covariate-shift adaptation输入人群的组成改变而给定输入的标签机制不变时,以输入密度比把源分布损失转换为目标风险。在条件标签机制不变且目标输入分布相对于源输入分布绝对连续时,把目标风险写成源损失的密度比加权期望;其独立验证集估计可以无偏,但权重还会影响方差。
参考资料
- Mohri, Rostamizadeh, Talwalkar, Foundations of Machine Learning, 2nd ed., MIT Press, 2018, Ch. 2.
- Bartlett, Mendelson, “Rademacher and Gaussian Complexities,” JMLR, 2002.