Skip to content

定义Definition

KL 散度

Kullback–Leibler divergence · Relative entropy

同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。

形式陈述 ​

设 P,Q 是同一可测空间上的概率分布。若 P 对 Q 绝对连续,记作 P≪Q,则Radon–Nikodym 定理给出 Q-几乎处处定义的导数 dP/dQ,并定义

Db(P‖Q)=∫logb⁡dPdQdP=∫dPdQlogb⁡dPdQdQ.

若 P≪̸Q,定义 Db(P‖Q)=+∞;即使 P≪Q,上面的积分也仍可能为 +∞。对数底须满足 b>1,否则非负性的方向会改变。本页默认 b=2,单位为 bit;自然对数给 nat。积分不会出现正负无穷抵消:在 0≤f≤1 上,fln⁡f≥−1/e,其负部对概率测度 Q 可积;因此结果是有限非负数或正无穷。

在可数空间上,这一形式展开为

D(P‖Q)=∑xP(x)log2⁡P(x)Q(x).

约定 0log⁡(0/q)=0;只要某个 x 满足 P(x)>0 而 Q(x)=0,整个散度就是 +∞。Gibbs 不等式给出

D(P‖Q)≥0,

且等号当且仅当 P=Q。KL 一般不对称,也不满足三角不等式。

直觉

D(P‖Q) 总是在 P 下取平均:把 P 当作真实数据规律、把 Q 当作预测或编码模型时,先比较每个结果的对数评分,再按真实发生概率加权。离散且 H(P)<∞ 时,它正好等于使用 Q 所多付的平均对数损失。若两个平均损失都无穷,应直接计算对数比的期望,不能把 KL 写成 ∞−∞。若 Q 给一个 P 真会产生的事件零概率,该方向的 KL 就是无穷。

KL 不是“两个分布隔多远”的普通几何距离。交换 P,Q 会同时改变取样权重和对零概率的容忍方向;非负性只说明错误模型不会在平均对数损失上优于真实模型。

KL 散度的方向与支持

非负性的证明机制 ​

令 f=dP/dQ。函数 φ(t)=tlogb⁡t 是凸函数,而 Q 是概率测度,所以Jensen 不等式给出

Db(P‖Q)=∫φ(f)dQ≥φ(∫fdQ)=φ(1)=0.

严格凸性说明等号要求 f=1 几乎处处,即 P=Q。离散情形的 log-sum 不等式是同一机制的有限和版本。

例子与边界

可复算例:方向与支持失配 ​

取 P=(1,0)、Q=(1/2,1/2)。以 2 为底,

D(P‖Q)=1log2⁡11/2+0=1 bit.

反向计算时,第二个坐标满足 Q(2)=1/2>0 而 P(2)=0,故

D(Q‖P)=+∞.

这同时展示了不对称性与绝对连续条件。若改取 Bernoulli 分布,有限支持匹配时有

D(Bern(p)‖Bern(q))=plog2⁡pq+(1−p)log2⁡1−p1−q.

两个方向都有限,也仍不是距离 ​

令 P=(1/2,1/2)、Q=(3/4,1/4),代入得到

D(P‖Q)=12log2⁡(4/3)≈0.2075,D(Q‖P)=34log2⁡(3/2)−14≈0.1887.

这里两者支持完全相同,差异仍来自“由谁取平均”。若另取 R=(0.9,0.1),则 D(P‖R)≈0.7370,但 D(P‖Q)+D(Q‖R)≈0.2075+0.1332=0.3407,直接违反三角不等式。支持没有零点也救不回度量性质。

边界与失败情形 ​

“样本中没见过某结果”不等于真实概率为零。直接把经验频数中的零代进第二个参数,可能制造假的无穷散度;平滑可以改善数值行为,却也改变了被比较的分布,必须明说。

KL 可以有限但任意大,也可以一边有限、反向无穷;因此不能用 D(P‖Q) 代替需要对称性或三角不等式的度量。与微分熵不同,两个分布同时经过同一个可逆光滑重参数化时,密度 Jacobian 在比值中抵消,KL 本身保持不变。

推论与应用

对可数字母表,交叉熵满足 H(P,Q)=H(P)+D(P‖Q)。固定 P 且 H(P)<∞ 时,两项目标只差一个有限常数,所以最小化交叉熵等价于最小化相同方向的 KL。

有限熵条件有实质作用。取 pk=c/[k(ln⁡k)2](k≥2,c 为归一化常数),级数可归一化,但熵中的尾项与 1/(kln⁡k) 同阶,故 H(P)=∞。MIT 讲义第 1 章讨论了这类可数分布。令 Q1=P、Q2=(P+δ2)/2;除第 2 个原子外,Q2 的概率都是 P 的一半,因此两个交叉熵都为无穷。可是 D(P‖Q1)=0,而 P/Q2≤2 且 P≠Q2 给出 0<D(P‖Q2)≤1 bit。交叉熵在这两个候选间无法区分,KL 却可以。连续密度下的分解还需检查微分熵与积分,具体条件见交叉熵页。

互信息则是

I(X;Y)=D(PXY‖PXPY),

即真实联合分布相对独立基线的散度。对同一随机信道施加后处理时,数据处理不等式给出 KL 收缩。

乘积分布还满足可加性 D(Pn‖Qn)=nD(P‖Q)。这一性质支撑假设检验误差指数、换测度下界和大偏差分析;使用时仍须保持方向、支配关系与对数底一致。

Sanov 定理赋予 D(Q‖P) 一个抽样解释:从 P 独立抽取大量样本,经验测度接近异常分布 Q 的指数成本由这个方向的相对熵决定。若概率尺度写成自然指数 e−nI,这里的速率须用 nat,即 I=De(Q‖P)=(ln⁡2)D2(Q‖P);使用默认 bit 值时,相应指数是 2−nD2。一般连续总体下必须按弱邻域理解,不能把每个原子经验实现的无穷相对熵误当成其精确点概率。

KL 描述对数似然比的平均值;Rényi 差分隐私改为控制它的指数矩,以约束较大损失的尾部。对同一阶数,这种预算在自适应组合中可相加,再转换成事件形式的隐私界。若某个大于一的 Rényi 阶数有限,其阶数趋向一时恢复 KL;只知道 KL 有限则还不足以保证更高阶矩有限。

参考资料
  • Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006, §2.3.
  • Imre Csiszár and János Körner, Information Theory: Coding Theorems for Discrete Memoryless Systems, 2nd ed., Cambridge University Press, 2011, §§2.1–2.2.
  • Robert M. Gray, Entropy and Information Theory, 2nd ed., Springer, 2011, §§5.2–5.3.
  • Yury Polyanskiy and Yihong Wu, Lecture Notes on Information Theory, MIT 6.441, 2016, Chs. 1–2(熵、散度与互信息的定义和适用条件)。
关系图谱53 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系