形式陈述
离散随机变量 $X,Y$ 的互信息定义为
$$ I(X;Y)=\sum_{x,y}p(x,y)\log\frac{p(x,y)}{p(x)p(y)} =D_{\mathrm{KL}}(p_{XY}\Vert p_Xp_Y). $$在相关熵有限时,等价地
$$ I(X;Y)=H(X)-H(X\mid Y) =H(Y)-H(Y\mid X) =H(X)+H(Y)-H(X,Y). $$因此 $I(X;Y)\ge0$,且在离散情形下 $I(X;Y)=0$ 当且仅当 $X,Y$ 独立。
直觉
互信息是一个变量对另一个变量所揭示的信息量:观察 $Y$ 使描述 $X$ 的平均不确定性减少多少。它是对称量,尽管“用 $Y$ 预测 $X$”的语言看似有方向。
例子与边界
若 $Y=X$,则 $I(X;Y)=H(X)$;若独立,则互信息为零。相关并不意味着线性相关:两个变量即使协方差为零,也可能具有正互信息。互信息不是普通距离,因为一般不满足三角不等式且 $I(X;X)$ 通常非零。
推论与应用
互信息用于信道容量、特征选择、统计依赖度量和数据处理不等式。确定性或随机处理形成 Markov 链 $X\to Y\to Z$ 时,有 $I(X;Z)\le I(X;Y)$,表达后处理不能创造关于源的新信息。
参考资料
- Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006,§§2.3, 2.8。
- Claude E. Shannon, “A Mathematical Theory of Communication,” Bell System Technical Journal 27, 1948,Part I, §§6–12。