形式陈述
设 P , Q 是同一可测空间上的概率分布 公理库 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 。若 P 对 Q 绝对连续 公理库 测度的绝对连续 Absolute continuity of measures 当一个测度的零集必为另一个测度的零集时成立的支配关系。 ,记作 P ≪ Q ,则Radon–Nikodym 定理 公理库 Radon–Nikodym 定理 Radon–Nikodym theorem 在标准 σ-有限条件下,把绝对连续测度表示为参考测度的积分密度。 给出 Q -几乎处处定义的导数 d P / d Q ,并定义
D b ( P ‖ Q ) = ∫ log b d P d Q d P = ∫ d P d Q log b d P d Q d Q . 若 P ≪̸ Q ,定义 D b ( P ‖ Q ) = + ∞ ;即使 P ≪ Q ,上面的积分也仍可能为 + ∞ 。对数底须满足 b > 1 ,否则非负性的方向会改变。本页默认 b = 2 ,单位为 bit;自然对数给 nat。积分不会出现正负无穷抵消:在 0 ≤ f ≤ 1 上,f ln f ≥ − 1 / e ,其负部对概率测度 Q 可积;因此结果是有限非负数或正无穷。
在可数空间上,这一形式展开为
D ( P ‖ Q ) = ∑ x P ( x ) log 2 P ( x ) Q ( x ) . 约定 0 log ( 0 / q ) = 0 ;只要某个 x 满足 P ( x ) > 0 而 Q ( x ) = 0 ,整个散度就是 + ∞ 。Gibbs 不等式给出
D ( P ‖ Q ) ≥ 0 , 且等号当且仅当 P = Q 。KL 一般不对称,也不满足三角不等式。
直觉
D ( P ‖ Q ) 总是在 P 下取平均:把 P 当作真实数据规律、把 Q 当作预测或编码模型时,先比较每个结果的对数评分,再按真实发生概率加权。离散且 H ( P ) < ∞ 时,它正好等于使用 Q 所多付的平均对数损失。若两个平均损失都无穷,应直接计算对数比的期望,不能把 KL 写成 ∞ − ∞ 。若 Q 给一个 P 真会产生的事件零概率,该方向的 KL 就是无穷。
KL 不是“两个分布隔多远”的普通几何距离。交换 P , Q 会同时改变取样权重和对零概率的容忍方向;非负性只说明错误模型不会在平均对数损失上优于真实模型。
图片加载失败 KL 散度的方向与支持 非负性的证明机制
令 f = d P / d Q 。函数 φ ( t ) = t log b t 是凸函数,而 Q 是概率测度,所以Jensen 不等式 公理库 Jensen 不等式 Jensen's inequality 凸函数作用于平均值不超过函数值的相同加权平均。 给出
D b ( P ‖ Q ) = ∫ φ ( f ) d Q ≥ φ ( ∫ f d Q ) = φ ( 1 ) = 0. 严格凸性说明等号要求 f = 1 几乎处处,即 P = Q 。离散情形的 log-sum 不等式是同一机制的有限和版本。
例子与边界
可复算例:方向与支持失配
取 P = ( 1 , 0 ) 、Q = ( 1 / 2 , 1 / 2 ) 。以 2 为底,
D ( P ‖ Q ) = 1 log 2 1 1 / 2 + 0 = 1 bit . 反向计算时,第二个坐标满足 Q ( 2 ) = 1 / 2 > 0 而 P ( 2 ) = 0 ,故
D ( Q ‖ P ) = + ∞ . 这同时展示了不对称性与绝对连续条件。若改取 Bernoulli 分布,有限支持匹配时有
D ( Bern ( p ) ‖ Bern ( q ) ) = p log 2 p q + ( 1 − p ) log 2 1 − p 1 − q . 两个方向都有限,也仍不是距离
令 P = ( 1 / 2 , 1 / 2 ) 、Q = ( 3 / 4 , 1 / 4 ) ,代入得到
D ( P ‖ Q ) = 1 2 log 2 ( 4 / 3 ) ≈ 0.2075 , D ( Q ‖ P ) = 3 4 log 2 ( 3 / 2 ) − 1 4 ≈ 0.1887 . 这里两者支持完全相同,差异仍来自“由谁取平均”。若另取 R = ( 0.9 , 0.1 ) ,则 D ( P ‖ R ) ≈ 0.7370 ,但 D ( P ‖ Q ) + D ( Q ‖ R ) ≈ 0.2075 + 0.1332 = 0.3407 ,直接违反三角不等式。支持没有零点也救不回度量性质。
边界与失败情形
“样本中没见过某结果”不等于真实概率为零。直接把经验频数中的零代进第二个参数,可能制造假的无穷散度;平滑可以改善数值行为,却也改变了被比较的分布,必须明说。
KL 可以有限但任意大,也可以一边有限、反向无穷;因此不能用 D ( P ‖ Q ) 代替需要对称性或三角不等式的度量。与微分熵不同,两个分布同时经过同一个可逆光滑重参数化时,密度 Jacobian 在比值中抵消,KL 本身保持不变。
推论与应用
对可数字母表,交叉熵 公理库 交叉熵 Cross-entropy 在真实分布下对另一分布负对数似然取期望所得的信息量。 满足 H ( P , Q ) = H ( P ) + D ( P ‖ Q ) 。固定 P 且 H ( P ) < ∞ 时,两项目标只差一个有限常数,所以最小化交叉熵等价于最小化相同方向的 KL。
有限熵条件有实质作用。取 p k = c / [ k ( ln k ) 2 ] (k ≥ 2 ,c 为归一化常数),级数可归一化,但熵中的尾项与 1 / ( k ln k ) 同阶,故 H ( P ) = ∞ 。MIT 讲义第 1 章 讨论了这类可数分布。令 Q 1 = P 、Q 2 = ( P + δ 2 ) / 2 ;除第 2 个原子外,Q 2 的概率都是 P 的一半,因此两个交叉熵都为无穷。可是 D ( P ‖ Q 1 ) = 0 ,而 P / Q 2 ≤ 2 且 P ≠ Q 2 给出 0 < D ( P ‖ Q 2 ) ≤ 1 bit。交叉熵在这两个候选间无法区分,KL 却可以。连续密度下的分解还需检查微分熵与积分,具体条件见交叉熵页。
互信息 公理库 互信息 Mutual information 用联合分布相对独立边缘乘积的 KL 散度量化统计依赖。 则是
I ( X ; Y ) = D ( P X Y ‖ P X P Y ) , 即真实联合分布相对独立基线的散度。对同一随机信道施加后处理时,数据处理不等式 公理库 数据处理不等式 Data processing inequality 对 Markov 链 X→Y→Z,有 I(X;Z)≤I(X;Y)。 给出 KL 收缩。
乘积分布还满足可加性 D ( P n ‖ Q n ) = n D ( P ‖ Q ) 。这一性质支撑假设检验误差指数、换测度下界和大偏差分析;使用时仍须保持方向、支配关系与对数底一致。
Sanov 定理 公理库 Sanov 定理 Sanov theorem 以相对熵刻画 IID 经验测度偏离总体分布的指数成本,有限字母表下可由类型计数推导。 赋予 D ( Q ‖ P ) 一个抽样解释:从 P 独立抽取大量样本,经验测度接近异常分布 Q 的指数成本由这个方向的相对熵决定。若概率尺度写成自然指数 e − n I ,这里的速率须用 nat,即 I = D e ( Q ‖ P ) = ( ln 2 ) D 2 ( Q ‖ P ) ;使用默认 bit 值时,相应指数是 2 − n D 2 。一般连续总体下必须按弱邻域理解,不能把每个原子经验实现的无穷相对熵误当成其精确点概率。
KL 描述对数似然比的平均值;Rényi 差分隐私 公理库 Rényi 差分隐私 Renyi differential privacy · RDP 以 Rényi 散度控制隐私损失的指数矩,使同一阶数的自适应组合预算可加。 改为控制它的指数矩,以约束较大损失的尾部。对同一阶数,这种预算在自适应组合中可相加,再转换成事件形式的隐私界。若某个大于一的 Rényi 阶数有限,其阶数趋向一时恢复 KL;只知道 KL 有限则还不足以保证更高阶矩有限。
参考资料
Thomas M. Cover and Joy A. Thomas, Elements of Information Theory , 2nd ed., Wiley, 2006, §2.3.
Imre Csiszár and János Körner, Information Theory: Coding Theorems for Discrete Memoryless Systems , 2nd ed., Cambridge University Press, 2011, §§2.1–2.2.
Robert M. Gray, Entropy and Information Theory , 2nd ed., Springer, 2011, §§5.2–5.3.
Yury Polyanskiy and Yihong Wu, Lecture Notes on Information Theory , MIT 6.441, 2016, Chs. 1–2(熵、散度与互信息的定义和适用条件)。