形式陈述
设实随机变量 X 相对于 Lebesgue 测度 d x 有概率密度 公理库 概率密度函数 Probability density function · PDF 概率分布相对于指定参考测度的 Radon–Nikodym 导数。 f 。固定坐标单位,以 2 为对数底,定义微分熵
h ( X ) = − ∫ R f ( x ) log 2 f ( x ) d x , 0 log 2 0 = 0. 若 f log 2 f 的正部和负部积分不同时为无穷,该式是有定义的扩展实数;若
∫ R f ( x ) | log 2 f ( x ) | d x < ∞ , 则 h ( X ) 是有限实数。以下涉及有限数相减的恒等式均注明这一条件。微分熵可以为负,也依赖坐标单位;它与离散Shannon 熵 公理库 Shannon 熵 Shannon entropy · Information entropy 随机变量不确定性的平均信息量,以最优编码所需位数为基本解释。 的联系由量化给出。
具体地,令 Δ > 0 ,等宽量化索引为 K Δ = ⌊ X / Δ ⌋ 。若 f 在某个有限区间 [ A , B ] 外为零、有界,且在 ( A , B ) 连续,则
lim Δ ↓ 0 [ H ( K Δ ) + log 2 Δ ] = h ( X ) , 即 H ( K Δ ) = h ( X ) − log 2 Δ + o ( 1 ) 。区间端点允许密度跳跃,因而均匀密度也在此范围内。这是一组足够条件,下面直接证明它。
直觉
在密度连续的位置,一个宽度为 Δ 的小格子约有概率 f ( x ) Δ ,落入该格子的自信息约为 − log 2 f ( x ) − log 2 Δ 。按真实分布平均后,第一项成为 h ( X ) ,第二项记录分辨率。格子宽度减半时,多出的约一 bit 用来分辨原来每格内的两个子格;即使 h ( X ) 为负,量化索引的离散熵仍非负。无损编码在这里针对指定精度的格子索引,h ( X ) 本身不表示精确记录一个实数所需的位数。
单位变换:密度与长度同时变化
设 Y = a X + b ,其中 a ≠ 0 ,并假设 X 的绝对熵积分有限。密度变换为
f Y ( y ) = 1 | a | f ( y − b a ) . 代入定义并换元 y = a x + b ,得到
h ( Y ) = − ∫ R f ( x ) log 2 f ( x ) | a | d x = h ( X ) + log 2 | a | ∫ R f ( x ) d x = h ( X ) + log 2 | a | . 变换后的绝对熵积分至多为原值加 | log 2 | a | | ,所以换元和拆项均合法。平移不改变微分熵,缩放则留下长度单位的对数。
量化极限:先构造真正的密度,再交换极限
记第 k 个格子为 I k , Δ = [ k Δ , ( k + 1 ) Δ ) ,令
p k , Δ = ∫ I k , Δ f ( x ) d x , f Δ ( x ) = p k , Δ Δ ( x ∈ I k , Δ ) . f Δ 把每个格子的总质量均匀摊开,仍是概率密度。在有界支撑下,只有有限个格子有正质量,因此逐格积分精确给出
h ( f Δ ) = − ∑ k Δ p k , Δ Δ log 2 p k , Δ Δ = − ∑ k p k , Δ log 2 p k , Δ + log 2 Δ ∑ k p k , Δ = H ( K Δ ) + log 2 Δ . 把 f 在区间外补为零。在每个连续点 x ,包含 x 的格子中所有位置都与 x 相距至多 Δ ,故
| f Δ ( x ) − f ( x ) | ≤ sup | u − x | ≤ Δ | f ( u ) − f ( x ) | ⟶ 0. 端点至多两个,因而 f Δ → f 几乎处处。若 0 ≤ f ≤ M ,则 0 ≤ f Δ ≤ M 。函数 ϕ ( t ) = − t log 2 t 在 [ 0 , M ] 连续,令 C = max 0 ≤ t ≤ M | ϕ ( t ) | 。当 Δ ≤ 1 时,所有 f Δ 的支撑都包含于固定区间 [ A − 1 , B + 1 ] ,从而
| ϕ ( f Δ ( x ) ) | ≤ C 1 [ A − 1 , B + 1 ] ( x ) . 右端可积,控制收敛定理 公理库 控制收敛定理 Dominated convergence theorem 几乎处处收敛且被同一可积函数控制时,可以交换极限与积分。 于是给出 h ( f Δ ) → h ( f ) 。与逐格恒等式合并,就证明了量化极限;这里有界性控制尖峰,固定有限支撑控制积分区域。
例子与边界
同一个测量,换单位还是换分辨率
取 X ∼ U [ 0 , 1 / 4 ] ,密度为 4 ,所以
h ( X ) = − ∫ 0 1 / 4 4 log 2 4 d x = − 2. 令 Δ = 1 / 1024 ,支撑恰好分成 256 个等概率格子,每格概率 1 / 256 ,故 H ( K Δ ) = 8 bit。此处无需渐近误差:8 = − 2 − log 2 ( 1 / 1024 ) 精确成立。
现在令 Y = 100 X ,则 Y ∼ U [ 0 , 25 ] ,h ( Y ) = log 2 25 ≈ 4.643856 。两种量化方案的差异是:
量化对象与格宽
等概率格子数
索引熵(bit)
X ,格宽 1 / 1024
256
8
Y ,格宽 100 / 1024
256
8
Y ,格宽 1 / 1024
25,600
log 2 25,600 ≈ 14.643856
第二行满足 ⌊ Y / ( 100 Δ ) ⌋ = ⌊ X / Δ ⌋ ,记录的索引完全相同。第三行保持数值格宽,换回原坐标相当于把分辨率提高 100 倍,所以多出 log 2 100 bit。信息量的增加来自新的测量精度。
有限方差和有界支撑仍不保证有限微分熵
考虑有界区间上的密度
其 他 情 形 f ( x ) = { 1 x [ ln ( 1 / x ) ] 2 , 0 < x < e − 1 , 0 , 其他情形 . 令 t = ln ( 1 / x ) ,则 x = e − t 、| d x | = e − t d t ,于是
∫ 0 e − 1 f ( x ) d x = ∫ 1 ∞ d t t 2 = 1. 其支撑有界,所以均值、方差有限;但 ln f ( e − t ) = t − 2 ln t ,从而
∫ f ( x ) ln f ( x ) d x = ∫ 1 ∞ t − 2 ln t t 2 d t = lim R → ∞ [ ln R − 2 + 2 ( ln R + 1 ) R ] = + ∞ . 故 h ( X ) = − ∞ 。这里密度在零附近无界,不能套用前面的有界密度量化证明;有限方差也不能替代绝对熵可积条件。该例仍满足任何有限的高斯熵上界,只是不能再把熵差当作两个有限数之差。
微分熵还要求分布确有 Lebesgue 密度。非原子并不足够,例如 Cantor 分布没有这种密度;常量分布同样没有。对它们,不能直接使用本页的密度积分定义。即使密度存在,一般情形也可能同时出现积分正负部无穷,此时 h 未定义。
推论与应用
高斯最大熵:KL 给出全局证书
设 X 有密度 f ,E X = μ 、Var ( X ) = σ 2 ∈ ( 0 , ∞ ) ,且 ∫ f | log 2 f | < ∞ 。取具有相同均值、方差的正态分布 公理库 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 密度
g ( x ) = 1 2 π σ 2 exp ( − ( x − μ ) 2 2 σ 2 ) . 关键在于 − log 2 g ( x ) 是一个常数加二次项。任何具有上述均值、方差的 f 都有相同的交叉熵:
− ∫ f ( x ) log 2 g ( x ) d x = 1 2 log 2 ( 2 π σ 2 ) + E [ ( X − μ ) 2 ] 2 σ 2 ln 2 = 1 2 log 2 ( 2 π e σ 2 ) . 有限二阶矩同时保证 ∫ f | log 2 g | < ∞ 。令 f = g 便算出 h ( g ) = 1 2 log 2 ( 2 π e σ 2 ) ;对一般 f ,两项绝对可积,故KL 散度 公理库 KL 散度 Kullback–Leibler divergence · Relative entropy 同一可测空间上分布 P 相对于 Q 的对数 Radon–Nikodym 导数在 P 下的积分。 可以展开为
D ( f ‖ g ) = ∫ f log 2 f − ∫ f log 2 g = 1 2 log 2 ( 2 π e σ 2 ) − h ( X ) ≥ 0. 因此
h ( X ) ≤ 1 2 log 2 ( 2 π e σ 2 ) , 且等号当且仅当 f = g 几乎处处。这个证明比较了全部满足约束的密度,KL 还精确给出离最优值差多少。
例如 X ∼ U [ − 3 , 3 ] 的方差为 ( 2 3 ) 2 / 12 = 1 ,微分熵为 log 2 ( 2 3 ) ≈ 1.792481 ;标准正态的熵为 1 2 log 2 ( 2 π e ) ≈ 2.047096 。两者相差
D ( U [ − 3 , 3 ] ‖ N ( 0 , 1 ) ) = 1 2 log 2 π e 6 ≈ 0.254614 bit . 若约束改为 Var ( X ) ≤ v 、v > 0 ,在同样的有限熵条件下,先用实际方差的上界,再用对数单调性,可得 h ( X ) ≤ 1 2 log 2 ( 2 π e v ) 。取等要求方差用满且分布为高斯,均值可以任意。方差为零的分布集中在一点,不属于有 Lebesgue 密度的候选。若约束是 E [ X 2 ] ≤ v ,则还须用 Var ( X ) = E [ X 2 ] − μ 2 ,取等进一步要求 μ = 0 。
为什么互信息不随单位改变
若 X , Y 有联合密度,且联合与两个边缘的绝对熵积分均有限,互信息 公理库 互信息 Mutual information 一个随机变量对另一个随机变量不确定性的平均减少量。 的密度比可以拆开并边缘化,得到
I ( X ; Y ) = ∬ f X Y ( x , y ) log 2 f X Y ( x , y ) f X ( x ) f Y ( y ) d x d y = h ( X ) + h ( Y ) − h ( X , Y ) . 分别作 U = a X + b 、V = c Y + d ,a c ≠ 0 ,联合密度的换元给 h ( U , V ) = h ( X , Y ) + log 2 | a | + log 2 | c | 。两个边缘各增加对应的一项,在上式中恰好抵消,所以 I ( U ; V ) = I ( X ; Y ) 。更一般的可逆光滑变换也使 KL 密度比中的 Jacobian 抵消;互信息保留的是变量间的统计依赖。
若 Y = X 且 X 非原子,联合分布落在对角线上,没有二维密度;这时应回到互信息的 KL 定义,而不是套用三个微分熵的相减式。
参考资料