“交叉熵满足 $H(P,Q)=H(P)+D(P Q)$,所以当 $P$ 固定时,最小化交叉熵等价于最小化相同方向的 KL。互信息则是”
形式陈述 ​
对同一可数字母表上的离散概率分布
采用
直觉
交叉熵是数据来自真实分布
例子与边界
二分类真实标签为
经验交叉熵是 log loss 总体风险的有限样本版本,不等于已知真实分布下的期望;泛化间隙可能让训练损失很低而测试风险仍高。若
推论与应用
在熵编码与概率模型评估中,熵给出无法消除的平均码长,KL 散度则量化使用错误分布造成的额外代价;语言模型与密度估计因此用交叉熵度量模型分布下的期望码长。当观测模型和支配测度已经指定时,样本交叉熵也是一项负 log likelihood,最大似然估计便在候选模型中最小化这项评分。
分类训练还把二元或多类交叉熵当作代理损失。它为何能服务零一分类、何时得到正确决策边界,应由代理损失与校准说明,不能从信息恒等式直接推出。训练交叉熵较小只表示样本内评分改善;参数偏差与风险属于估计规则的评价,趋近真实目标还要证明一致性,检验校准与样本外泛化则分别需要抽样理论和复杂度控制。这些结论都不会由低训练损失自动获得。
参考资料
- Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006,Chs. 2–8。
- Claude E. Shannon, “A Mathematical Theory of Communication,” Bell System Technical Journal 27, 1948,Parts I–II。