Skip to content

KL 散度

Kullback–Leibler divergence · Relative entropy

分布 P 相对于 Q 的对数似然比期望。

形式陈述

对同一可数样本空间上的概率分布 P,Q,KL 散度(相对熵)定义为

D(PQ)=xP(x)logP(x)Q(x),

约定 0log(0/q)=0,且若存在 P(x)>0,Q(x)=0D(PQ)=+。一般情形若 PQ,则

D(PQ)=logdPdQdP;

否则为无穷。Gibbs 不等式给 D(PQ)0,等号当且仅当 P=Q 几乎处处。

直觉

它衡量用模型 Q 为实际分布 P 编码或预测时,多付出的平均对数损失;方向决定谁是数据分布、谁是近似模型。

例子与边界

P=(1,0)Q=(1/2,1/2),则以二为底时 D(PQ)=1 bit;反向 D(QP)=。因此 KL 散度不对称,也不满足三角不等式,不是度量。对参数模型最大化似然等价于在经验分布固定时最小化相应交叉熵,从而最小化 KL 中随参数变化的部分。

推论与应用

KL 散度连接信息论、统计推断、变分方法和机器学习。互信息可写为 D(PXYPXPY);数据处理不等式说明随机映射不能增大它。

参考资料
  • Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006,§2.3, relative entropy and Gibbs inequality。
  • Imre Csiszár and János Körner, Information Theory: Coding Theorems for Discrete Memoryless Systems, 2nd ed., Cambridge University Press, 2011,Chs. 1–2, divergence and information measures。