“本页固定有限字母表上的离散无记忆源(DMS):$X 1,X 2,\ldots$ IID 服从 $P X$,单字母熵为 $H(X)$,并以 $2$ 为对数底。把 $X^n$ 看作一个超符号,考…”
形式陈述 ​
设离散随机变量
其中约定
每一项都非负,所以有限字母表上熵有限;可数无限字母表上允许
这里定义的是离散熵。若
它不是把离散求和机械换成积分后仍保留全部性质的同一个量:
直觉
结果
在已知分布的无损编码模型中,熵是长块平均码长的极限,而不是每个样本各自携带的固定标签。它不等于某个文件的最短压缩长度,也不衡量单次最佳猜测;后一个问题通常由最大点概率定义的最小熵控制。
基本界的证明机制 ​
若支持大小为
其中最后一步使用
例子与边界
可复算例:偏置比特 ​
若
故
边界与失败情形 ​
可数支持不保证有限熵。例如在
其中
连续均匀变量
名称相近的度量熵与覆盖数也不是 Shannon 熵:前者对给定尺度计算覆盖度量空间所需集合数的对数,不需要概率分布。
推论与应用
联合熵把同一定义施于随机变量元组,条件熵描述获得侧信息后的剩余不确定性,互信息描述减少量。这三者的链式恒等式构成后续信息不等式的代数基础。
对离散无记忆源,AEP把样本平均自信息收敛到
参考资料
- Claude E. Shannon, “A Mathematical Theory of Communication,” Bell System Technical Journal 27, 1948, Part I, §§6–8.
- Thomas M. Cover and Joy A. Thomas, Elements of Information Theory, 2nd ed., Wiley, 2006, §§2.1, 8.3.
- David J. C. MacKay, Information Theory, Inference, and Learning Algorithms, Cambridge University Press, 2003, §§2.2–2.4.