Skip to content

交叉熵

Cross-entropy

在真实分布下对另一分布负对数似然取期望所得的信息量。

条目类型
定义

形式陈述

对同一可数字母表上的离散概率分布 P,Q,交叉熵定义为

H(P,Q)=xP(x)logQ(x)=H(P)+DKL(PQ),

采用 P(x)>0,Q(x)=0 时为 + 的约定。它是在真实分布 P 下使用模型 Q 编码或预测的平均负对数损失,不对称且一般不满足距离公理。

直觉

交叉熵是数据来自真实分布 P、却用模型分布 Q 的码长 logQ(x) 编码时的平均成本;模型越低估真实常见事件,付出的对数代价越大。它同时包含不可消除的真实熵和模型失配代价:H(P,Q)=H(P)+DKL(PQ)。只有在总体分布 P 固定且期望可得时,最小化总体交叉熵才等价于最小化 DKL(PQ);最大似然训练实际最小化的是样本上的经验负对数似然,两者之间还隔着采样与模型选择误差。

例子与边界

二分类真实标签为 y{0,1}、模型预测正类概率为 q 时,单样本损失是 ylogq(1y)log(1q)。若真实结果为正而 q=0.9,损失约 0.105 nat;若 q=0.01,损失约 4.605,对自信错误惩罚很大。固定 P 时,交叉熵由 Q=P 最小化,因为 KL 散度非负。经验交叉熵只是样本均值,其接近总体值还需独立性、可积性等统计条件。

经验交叉熵是 log loss 总体风险的有限样本版本,不等于已知真实分布下的期望;泛化间隙可能让训练损失很低而测试风险仍高。若 Q(x)=0P(x)>0,交叉熵为无穷,数值实现常用 log-softmax 而非直接取概率后对数。

推论与应用

在熵编码与概率模型评估中,给出无法消除的平均码长,KL 散度则量化使用错误分布造成的额外代价;语言模型与密度估计因此用交叉熵度量模型分布下的期望码长。当观测模型和支配测度已经指定时,样本交叉熵也是一项负 log likelihood,最大似然估计便在候选模型中最小化这项评分。

分类训练还把二元或多类交叉熵当作代理损失。它为何能服务零一分类、何时得到正确决策边界,应由代理损失与校准说明,不能从信息恒等式直接推出。训练交叉熵较小只表示样本内评分改善;参数偏差与风险属于估计规则的评价,趋近真实目标还要证明一致性,检验校准与样本外泛化则分别需要抽样理论和复杂度控制。这些结论都不会由低训练损失自动获得。

参考资料
  • Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006,Chs. 2–8。
  • Claude E. Shannon, “A Mathematical Theory of Communication,” Bell System Technical Journal 27, 1948,Parts I–II。
关系图谱10 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组