条件期望回答一个预测问题:只允许利用已经掌握的信息,对随机量 应怎样给出平均预测?信息越粗,我们就把越多可能结果合并求平均;信息越细,预测就能随观察结果作出更多区分。
因此 一般是随机变量,而不是一个数。 表示允许使用的信息;条件期望给每种可辨认的情况分配一个预测值。普通期望理路期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。是完全不区分情况时的特例。[1][2]
形式陈述
一般定义:可见性与积分守恒
设实值随机变量 绝对可积,即 , 是一个子 -代数。实值随机变量 称为 关于 的条件期望,如果
第一条让预测只随可辨认的信息变化。下文的四结果例子中, 必须在 内取相同值,在 内也取相同值。第二条再决定各组该取多少:若在正概率组 上恒取 ,就必须有 ,因而 等于组内的条件加权平均。仅要求 只能固定所有组加起来的总量,仍允许把一组的预测人为调高、另一组调低;逐个可见事件的积分等式排除了这种错误补偿。
满足条件的 存在,并且在几乎处处意义下唯一。存在性可由 Radon–Nikodym 定理理路Radon–Nikodym 定理Radon–Nikodym theorem在标准 σ-有限条件下,把绝对连续测度表示为参考测度的积分密度。得到:对非负可积 ,在 上定义测度 ,它关于 绝对连续,其密度就是所求 ;一般 再分解成正部与负部。
唯一性的理由也直接体现了定义。若 都满足条件,事件 属于 ,而
非负函数积分为零意味着它几乎处处为零,因此 ;交换二者可得 几乎处处。“条件期望”通常指这一等价类,具体选出的随机变量称为一个版本。
复值可积变量 的条件期望按实部与虚部分别定义为 ;事件积分等式与唯一性逐分量成立。下文涉及大小关系、正负部分、平方误差和实凸函数的结论均采用实值变量。
两个端点有助于定位概念: 时,条件期望是常数 ; 已经 -可测时, 几乎处处。后一种情形中,答案本身已经包含在允许使用的信息里。
同组对象获得相同预测,但平均按原概率加权。A 组的条件均值是 2/3,而不是两个取值的算术平均 1。
非负变量允许无穷期望
若 可测,仍可定义扩展值条件期望。令 ,先按可积情形取 。保序性给出 几乎处处;把这些可数例外并入同一个 -可测零测集,并在其上把所有 置零,就可选到处处单调的版本。定义
它为 -可测,而且对每个 ,在等式两边使用单调收敛定理理路单调收敛定理Monotone convergence theorem非负可测函数单调递增时,积分极限等于极限函数积分。得到
两边可以同时为无穷。这个非负版本仍唯一到几乎处处相等:若 都满足事件积分等式,先限制到 ,其中 为整数。该集合上 的积分有限,等式便迫使集合概率为零;对 取可数并,再交换 即得唯一性。可积 时此定义与前文相同。它不允许把正负两部分的无穷条件期望直接相减。
给定一个变量,和给定它的一个数值
记号
表示只根据 预测 。对实值 ,可以把一个版本写成 。其中 是预测规则, 是随观察结果变化的随机变量, 才是观察到具体 后采用的数值。
若 离散且 ,公式是熟悉的条件加权平均:
连续分布的 在每个单点上满足 。有联合密度时,可用条件密度积分求 ;更一般的构造见正则条件概率理路正则条件概率Regular conditional probability把给定信息后的所有事件条件概率同时选择为一个逐点概率测度核。。预测规则 在 的分布意义下几乎处处确定:在一个 -零测集上改变它的值,仍给出同一个条件期望版本等价类。
例如 独立且均匀分布于 。给定 后, 的角色对称,又有二者之和等于 ,于是
因此观察到总和后,两项的平均预测各占一半;推导使用的是对称性与线性,而无需先求出条件密度。
直觉
从四个结果看清“按信息分组”
设样本空间有四个结果,概率与 的值如下。观察者无法区分前两个结果,也无法区分后两个结果,只知道自己落在哪一组。
| 结果 |
|
|
|
|
| 概率 |
|
|
|
|
|
0 |
2 |
4 |
8 |
| 可见组别 |
|
|
|
|
落在 时,需要把组内概率重新归一化:两种结果的条件概率为 ,所以预测是 ;落在 时,预测是 。于是
A 组中的零值结果出现概率是另一结果的两倍,所以加权平均为 ;算术平均 则对应两种结果等可能的另一种模型。
这两个预测还保留了每组的总量。例如
对全部结果再取平均,也得到
一般定义要保留的,正是“只按已知信息变化”和“每个可见事件上的总量不变”这两件事。
补充示意图
分块平均与平方误差投影
例子与边界
掷骰子的完整计算:信息解释了哪部分波动
独立掷两枚公平六面骰,点数为 ,总和为 。未观察任何骰子时,预测为 ;看到第一枚后,
实际残差为 ,所以剩余均方误差是 。而原先用常数 预测的误差为
信息把误差分成了两半:由第一枚骰子解释的波动,以及尚未观察的第二枚骰子留下的波动。一般地,对平方可积的 ,
其中
本身也是随机变量。第一项是平均剩余不确定性,第二项是不同可见情况之间的预测差异。
信息嵌套与独立性
塔式法则需要信息集合嵌套。取独立公平比特 ,令 、。由于 与 独立,
观察 会把关于 的预测平均成常数;随后再按 分组,这个常数保持不变。信息集合嵌套时,塔式法则才给出下面所述的简化。
另一个边界是独立性。 与 独立且可积,确实推出 ;反方向对单个 不成立。令 ,,就有 ,但 显然包含关于 的信息。若要刻画完整独立性,应对所有有界可测变换 都要求条件期望保持不变。
推论与应用
平方误差下,条件期望是正交投影
进一步假设 。所有平方可积且 -可测的随机变量组成 的一个闭子空间。设 ,则对该子空间中的任意 ,
它先由定义对指标函数成立,再推广到简单函数、有界函数,最后经截断与 极限扩展到任意这样的 。也就是说,预测残差 与每个可用信息构成的平方可积统计量都正交。
因而任何另一个允许的预测 都满足
交叉项为零,这就是概率空间中的勾股定理。第二项非负,所以 是唯一到几乎处处相等的最小均方误差预测。这一结论是 正交投影理路正交投影Orthogonal projection把向量映到子空间上最近点并使误差与子空间正交的线性算子。在随机变量空间中的具体实例。[2]
可积性 支持积分定义;平方可积性 进一步支持残差正交和均方误差最小化。损失函数改变时,最优预测也随之改变:平方损失对应条件均值,绝对值损失对应条件中位数。
从定义推导常用运算
线性与保序。对可积 和常数 ,条件期望保留线性组合;若 几乎处处,则相应条件期望也保持大小关系。因此可以先拆分随机量,再分别计算预测。
提出已知因子。若 为有界的 -可测变量,则
在给定信息下, 的值已经确定,因此可以提出。无界 的情形也适用,只要 与 均可积;对 逐级截断可得 ,再由 得到右侧的可积性。
塔式法则。若 ,则
先用细信息预测,再忘掉部分信息,与直接使用粗信息一致。反向嵌套也有
因为内层结果已经由粗信息决定,自然也能由细信息观察到。
条件 Jensen 不等式。若 为凸函数, 与 可积,则
取 可得 收缩;取 可得平方可积情形的 收缩。这些性质并非一组无关公式,它们都表达了同一件事:分组平均保留线性结构,却会平滑凸函数所衡量的波动。[1]
条件期望怎样进入统计与随机过程
对平方可积估计量 ,取 保留其无条件期望,并使方差不增。Rao–Blackwell 方法选用充分统计量作为信息:给定它后的样本条件分布不依赖未知参数,于是条件平均可写成一条可实施的估计规则。
若信息随时间增长,,那么对固定可积的最终量 ,过程 满足
这就是塔式法则产生的鞅:每次得到新信息都更新预测,而站在过去的视角,未来更新的平均值仍等于当前预测。条件期望因而把分组平均、最优预测与动态信息更新连成了同一套语言。
参考资料
[1] Rick Durrett, Probability: Theory and Examples, 5th ed., Cambridge University Press, 2019,Conditional Expectation 相关章节。作者公开稿。
[2] Steven P. Lalley, Conditional Expectation,University of Chicago 课程讲义。公开讲义,从条件期望的定义发展到 投影与基本性质。
[3] David Williams, Probability with Martingales, Cambridge University Press, 1991,条件期望与鞅章节。适合进一步学习信息流、塔式法则和随机过程中的使用方法。