“对离散处理,也可逐个 $a$ 写成 $A=a\Rightarrow Y=Y(a)$。因而每个单位最多揭示潜在结果向量的一项。其余项并非普通缺失值:缺失模式由实际处理决定,通常与潜在结果有关。…”
形式陈述 ​
设随机元素
映射
称为
边缘分布由坐标投影取回:
离散情形中,这对应把联合质量表按另一坐标求和;若联合分布有密度
的几乎处处版本。
其中右侧是乘积测度。在联合密度存在时,这等价于
直觉
边缘分布像分别拍摄的两张单人照片,只说明每个坐标单独出现什么;联合分布是一张同框照片,保留哪些取值会一起出现。固定两份边缘后,仍可以用许多方式配对样本,这些联合测度称为边缘之间的耦合。独立乘积只是其中一个特别对称的选择。
从联合分布可以推出边缘,反方向却通常不行。求边缘是把另一坐标的信息积分掉,这个操作不可逆;依赖、相关、条件分布和事件同时发生的概率,都可能在边缘化时被丢失。
例子与边界
令
再取
上;这条线的二维 Lebesgue 测度为零,因此联合分布没有二维普通密度。不能从“每个坐标连续”推出“联合分布有密度”。
二维边缘也不足以确定更高维联合分布。令
联合分布只规定取值怎样同现,不要求变量具有同一物理来源。耦合法常把原本定义在不同概率空间的两个分布放到一个新空间中共同实现,以便控制
推论与应用
对联合可积的可测函数
因此协方差、和的分布、最大值概率与损失风险都需要联合分布,而不能由两个边缘单独计算。只有当
条件分布把一个坐标固定为信息后,描述另一个坐标的剩余规律;条件期望则对这种剩余规律取平均。二者都以联合结构为输入:同样的边缘配上不同耦合,会产生不同条件规律。
Markov 链用相邻时刻联合分布和转移核组织时间依赖,信息论用联合分布与边缘乘积之差定义互信息,最优传输则在固定边缘的全部耦合中最小化运输成本。三类应用关心的对象不同,却都依赖“边缘之外的同现结构”。
参考资料
- Olav Kallenberg, Foundations of Modern Probability, 3rd ed., Springer, 2021, Chapters 1 and 4.
- Rick Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, 2019, Chapter 1.
- MIT OpenCourseWare, 6.436J Fundamentals of Probability: Lecture Notes, lectures on random vectors and joint laws.