“Bernoulli 变量是概率建模的基本构件:独立同参数求和给出二项计数;样本比例按大数律收敛到 $p$;标准化后由中心极限定理趋于正态;有限样本下 Hoeffding 不等式给出指数集中界…”
损失与总体风险 ​
损失函数先评价一次预测。若真实标签在
也可以把特征和标签合为观测
它评价新的观测,不是训练样本上的平均。定义要求损失可测且期望有意义;总体风险也允许为
换损失会换问题 ​
0–1 损失直接给分类错误率,却非凸且不连续。概率预测的 log loss 重罚自信的错误。平方损失的条件最优动作是均值,绝对损失则是中位数;代价敏感分类还会因假阴性和假阳性代价不同而改变阈值。同一个数据来源并不自动决定唯一损失,目标还取决于行动后果。
一个两类医疗筛查例子能看出代价的作用。若漏诊代价为
附加性质与尾部边界 ​
非负、有界、凸、光滑都是损失的附加性质,彼此不等价。凸性有助于求解经验目标,却不保证该目标与最终业务损失一致;代理风险能否控制 0–1 风险,需要校准或转换界。最大似然只在明确的概率模型下对应经验对数损失最小化,也不是 ERM 的同义词。
还要区分损失的范围与风险的估计方法。0–1 损失天然落在
经验评价与非逐点目标 ​
若
损失还可能依赖样本
风险是决策评价,不是概率分布之间固定的距离。交叉熵、KL 和 log loss 只在指定真分布与预测分布后出现相应恒等关系;类权重、截断或确定标签都会改变对象。散度可以解释某些风险,却不能替代损失和预测协议的定义。
参考资料
- Mohri, Rostamizadeh, Talwalkar, Foundations of Machine Learning, Ch. 2.
- Bartlett, Mendelson, “Rademacher and Gaussian Complexities,” JMLR, 2002.