Skip to content

定义Definition

微分熵

Differential entropy · 连续熵

连续密度的平均负对数,连接测量尺度、细量化熵与固定方差下的高斯最大熵。

形式陈述 ​

设实随机变量 X 相对于 Lebesgue 测度 dx 有概率密度 f。固定坐标单位,以 2 为对数底,定义微分熵

h(X)=−∫Rf(x)log2⁡f(x)dx,0log2⁡0=0.

若 flog2⁡f 的正部和负部积分不同时为无穷,该式是有定义的扩展实数;若

∫Rf(x)|log2⁡f(x)|dx<∞,

则 h(X) 是有限实数。以下涉及有限数相减的恒等式均注明这一条件。微分熵可以为负,也依赖坐标单位;它与离散Shannon 熵的联系由量化给出。

具体地,令 Δ>0,等宽量化索引为 KΔ=⌊X/Δ⌋。若 f 在某个有限区间 [A,B] 外为零、有界,且在 (A,B) 连续,则

limΔ↓0[H(KΔ)+log2⁡Δ]=h(X),

即 H(KΔ)=h(X)−log2⁡Δ+o(1)。区间端点允许密度跳跃,因而均匀密度也在此范围内。这是一组足够条件,下面直接证明它。

直觉

在密度连续的位置,一个宽度为 Δ 的小格子约有概率 f(x)Δ,落入该格子的自信息约为 −log2⁡f(x)−log2⁡Δ。按真实分布平均后,第一项成为 h(X),第二项记录分辨率。格子宽度减半时,多出的约一 bit 用来分辨原来每格内的两个子格;即使 h(X) 为负,量化索引的离散熵仍非负。无损编码在这里针对指定精度的格子索引,h(X) 本身不表示精确记录一个实数所需的位数。

单位变换:密度与长度同时变化 ​

设 Y=aX+b,其中 a≠0,并假设 X 的绝对熵积分有限。密度变换为

fY(y)=1|a|f(y−ba).

代入定义并换元 y=ax+b,得到

h(Y)=−∫Rf(x)log2⁡f(x)|a|dx=h(X)+log2⁡|a|∫Rf(x)dx=h(X)+log2⁡|a|.

变换后的绝对熵积分至多为原值加 |log2⁡|a||,所以换元和拆项均合法。平移不改变微分熵,缩放则留下长度单位的对数。

量化极限:先构造真正的密度,再交换极限 ​

记第 k 个格子为 Ik,Δ=[kΔ,(k+1)Δ),令

pk,Δ=∫Ik,Δf(x)dx,fΔ(x)=pk,ΔΔ(x∈Ik,Δ).

fΔ 把每个格子的总质量均匀摊开,仍是概率密度。在有界支撑下,只有有限个格子有正质量,因此逐格积分精确给出

h(fΔ)=−∑kΔpk,ΔΔlog2⁡pk,ΔΔ=−∑kpk,Δlog2⁡pk,Δ+log2⁡Δ∑kpk,Δ=H(KΔ)+log2⁡Δ.

把 f 在区间外补为零。在每个连续点 x,包含 x 的格子中所有位置都与 x 相距至多 Δ,故

|fΔ(x)−f(x)|≤sup|u−x|≤Δ|f(u)−f(x)|⟶0.

端点至多两个,因而 fΔ→f 几乎处处。若 0≤f≤M,则 0≤fΔ≤M。函数 ϕ(t)=−tlog2⁡t 在 [0,M] 连续,令 C=max0≤t≤M|ϕ(t)|。当 Δ≤1 时,所有 fΔ 的支撑都包含于固定区间 [A−1,B+1],从而

|ϕ(fΔ(x))|≤C1[A−1,B+1](x).

右端可积,控制收敛定理于是给出 h(fΔ)→h(f)。与逐格恒等式合并,就证明了量化极限;这里有界性控制尖峰,固定有限支撑控制积分区域。

例子与边界

同一个测量,换单位还是换分辨率 ​

取 X∼U[0,1/4],密度为 4,所以

h(X)=−∫01/44log2⁡4dx=−2.

令 Δ=1/1024,支撑恰好分成 256 个等概率格子,每格概率 1/256,故 H(KΔ)=8 bit。此处无需渐近误差:8=−2−log2⁡(1/1024) 精确成立。

现在令 Y=100X,则 Y∼U[0,25],h(Y)=log2⁡25≈4.643856。两种量化方案的差异是:

量化对象与格宽 等概率格子数 索引熵(bit)
X,格宽 1/1024 256 8
Y,格宽 100/1024 256 8
Y,格宽 1/1024 25,600 log2⁡25,600≈14.643856

第二行满足 ⌊Y/(100Δ)⌋=⌊X/Δ⌋,记录的索引完全相同。第三行保持数值格宽,换回原坐标相当于把分辨率提高 100 倍,所以多出 log2⁡100 bit。信息量的增加来自新的测量精度。

有限方差和有界支撑仍不保证有限微分熵 ​

考虑有界区间上的密度

f(x)={1x[ln⁡(1/x)]2,0<x<e−1,0,其他情形.

令 t=ln⁡(1/x),则 x=e−t、|dx|=e−tdt,于是

∫0e−1f(x)dx=∫1∞dtt2=1.

其支撑有界,所以均值、方差有限;但 ln⁡f(e−t)=t−2ln⁡t,从而

∫f(x)ln⁡f(x)dx=∫1∞t−2ln⁡tt2dt=limR→∞[ln⁡R−2+2(ln⁡R+1)R]=+∞.

故 h(X)=−∞。这里密度在零附近无界,不能套用前面的有界密度量化证明;有限方差也不能替代绝对熵可积条件。该例仍满足任何有限的高斯熵上界,只是不能再把熵差当作两个有限数之差。

微分熵还要求分布确有 Lebesgue 密度。非原子并不足够,例如 Cantor 分布没有这种密度;常量分布同样没有。对它们,不能直接使用本页的密度积分定义。即使密度存在,一般情形也可能同时出现积分正负部无穷,此时 h 未定义。

推论与应用

高斯最大熵:KL 给出全局证书 ​

设 X 有密度 f,EX=μ、Var(X)=σ2∈(0,∞),且 ∫f|log2⁡f|<∞。取具有相同均值、方差的正态分布密度

g(x)=12πσ2exp(−(x−μ)22σ2).

关键在于 −log2⁡g(x) 是一个常数加二次项。任何具有上述均值、方差的 f 都有相同的交叉熵:

−∫f(x)log2⁡g(x)dx=12log2⁡(2πσ2)+E[(X−μ)2]2σ2ln⁡2=12log2⁡(2πeσ2).

有限二阶矩同时保证 ∫f|log2⁡g|<∞。令 f=g 便算出 h(g)=12log2⁡(2πeσ2);对一般 f,两项绝对可积,故KL 散度可以展开为

D(f‖g)=∫flog2⁡f−∫flog2⁡g=12log2⁡(2πeσ2)−h(X)≥0.

因此

h(X)≤12log2⁡(2πeσ2),

且等号当且仅当 f=g 几乎处处。这个证明比较了全部满足约束的密度,KL 还精确给出离最优值差多少。

例如 X∼U[−3,3] 的方差为 (23)2/12=1,微分熵为 log2⁡(23)≈1.792481;标准正态的熵为 12log2⁡(2πe)≈2.047096。两者相差

D(U[−3,3]‖N(0,1))=12log2⁡πe6≈0.254614 bit.

若约束改为 Var(X)≤v、v>0,在同样的有限熵条件下,先用实际方差的上界,再用对数单调性,可得 h(X)≤12log2⁡(2πev)。取等要求方差用满且分布为高斯,均值可以任意。方差为零的分布集中在一点,不属于有 Lebesgue 密度的候选。若约束是 E[X2]≤v,则还须用 Var(X)=E[X2]−μ2,取等进一步要求 μ=0。

为什么互信息不随单位改变 ​

若 X,Y 有联合密度,且联合与两个边缘的绝对熵积分均有限,互信息的密度比可以拆开并边缘化,得到

I(X;Y)=∬fXY(x,y)log2⁡fXY(x,y)fX(x)fY(y)dxdy=h(X)+h(Y)−h(X,Y).

分别作 U=aX+b、V=cY+d,ac≠0,联合密度的换元给 h(U,V)=h(X,Y)+log2⁡|a|+log2⁡|c|。两个边缘各增加对应的一项,在上式中恰好抵消,所以 I(U;V)=I(X;Y)。更一般的可逆光滑变换也使 KL 密度比中的 Jacobian 抵消;互信息保留的是变量间的统计依赖。

若 Y=X 且 X 非原子,联合分布落在对角线上,没有二维密度;这时应回到互信息的 KL 定义,而不是套用三个微分熵的相减式。

参考资料
  • Yury Polyanskiy and Yihong Wu, Lecture Notes on Information Theory, MIT 6.441, Spring 2016:§1.3,印刷页 18,Definition/Theorem 1.5,讨论定义与有限性;§23.1.5,印刷页 241,式 (23.2),给出高分辨率量化关系。本页在有界、有限支撑条件下补全其极限证明。
  • Muriel Médard, 6.441 Lecture 16, MIT, Spring 2010,slides 4–8:密度熵、尺度变换及 KL 最大熵论证。
  • Claude E. Shannon, “A Mathematical Theory of Communication”, 1948,§20,items 5–6、8–9:连续熵、固定二阶矩下的高斯极值与坐标依赖;其固定二阶矩约束对应本页最后说明的零均值取等情形。
关系图谱11 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系