形式陈述
初读可先用有限分布的 ∑ x x p ( x ) 理解加权平均,再用本节的可积性条件判断何时能推广到无限情形。下文统一区分总体期望、随机样本平均与给定信息后的条件期望。
随机变量 公理库 随机变量 Random variable · Random element 从概率空间到可测取值空间的可测映射;实值情形承载数值概率运算。 X 的期望,是它相对于概率测度的 Lebesgue 积分 公理库 Lebesgue 积分 Lebesgue integral 从简单函数积分出发,按单调逼近定义非负、扩展值与可积函数的积分。 。若 X ≥ 0 ,定义
E X = ∫ Ω X d P ∈ [ 0 , ∞ ] . 非负变量的期望总有定义,但可以是 + ∞ 。一般实变量要先拆成 X = X + − X − ,其中 X + = max ( X , 0 ) 、X − = max ( − X , 0 ) 。只有 E X + 、E X − 不同时为无穷大时,才定义扩展期望
E X = E X + − E X − . 若 E | X | < ∞ ,则称 X 可积,期望是有限实数。可积性排除了用正负两端的无穷量“互相抵消”。复随机变量的有限期望分别对实部和虚部积分,通常同样要求 E | X | < ∞ 。[1,2]
对实随机变量 X ,设其分布 公理库 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 为 μ ,同一个期望还可写成
E X = ∫ R x μ ( d x ) . 离散时化为 ∑ x x P ( X = x ) ;有密度 f 时化为 ∫ R x f ( x ) d x 。求和与密度积分是分布的特殊表示,不是两种彼此无关的期望定义。
直觉
期望是按概率质量加权的平均位置。公平骰子的平均点数为 3.5 ,尽管骰子从不掷出 3.5 ;它也不是“最有可能出现的值”,因为六个点数具有相同概率。若以概率 0.99 得到 0 、以概率 0.01 得到 100 ,期望为 1 ,最常出现的结果却是 0 。期望概括长期平均的中心位置,不替代单次结果或完整分布。
“大量重复后的平均”提供直觉,但不是期望定义所需的前提。先有随机变量与概率测度,才能定义积分;在独立同分布且可积等条件下,大数定律再说明样本平均趋向期望。若直接拿重复试验来定义期望,就会把需要证明的收敛结论藏进定义。
把一个复杂总量拆成很多简单贡献,往往比先求它的完整分布更有效。设总量在每个样本点上都满足 T ( ω ) = X ( ω ) + Y ( ω ) ;只要两项可积,积分便把逐点加法变成 E T = E X + E Y 。这里并没有把联合概率拆成乘积,所以不需要独立。读一道期望题时,应先找这种逐点成立的分解,再检查每一项能否积分;只有计算乘积期望等步骤时,才另行询问依赖关系。
例子与边界
指示变量把概率变成代数
事件 A 的指示变量只取 0 , 1 ,因此 E 1 A = P ( A ) 。若 N = ∑ i = 1 m 1 A i 统计发生次数,则
E N = ∑ i = 1 m P ( A i ) . 事件之间可以高度相关。例如把 n ≥ 1 封信按均匀随机排列装入 n 个信封,令 I i 表示第 i 封信放对。每封信放对的概率为 1 / n ,所以放对总数的期望是 ∑ i 1 / n = 1 。各事件一般并不独立:前面放置的信息会改变后面的选择,但线性性不需要它们独立。
对于可积 X , Y 和常数 a , b ,一般形式为 E ( a X + b Y ) = a E X + b E Y 。若涉及无穷期望,应回到正负部分检查表达式,而不能自动相减。
尾概率也能累计成期望
非负整数值变量 N 满足逐点恒等式
N = ∑ k = 1 ∞ 1 { N ≥ k } . 一个值为 7 的结果,恰好越过 1 到 7 这七层门槛。非负性允许用Tonelli 定理 公理库 Tonelli 定理 Tonelli's theorem 非负可测函数的二重积分与两种迭代积分相等,允许共同取无穷。 交换积分与求和,于是
E N = ∑ k = 1 ∞ P ( N ≥ k ) . 若 N 为独立 Bernoulli 试验中首次成功的次数,成功概率 p > 0 ,则 P ( N ≥ k ) = ( 1 − p ) k − 1 ,从几何级数立即得到 E N = 1 / p 。若改数“成功前的失败次数”,随机变量变为 N − 1 ,期望相应为 ( 1 − p ) / p 。
对一般非负实变量,层的高度连续变化,得到
E X = ∫ 0 ∞ P ( X > t ) d t . 这个尾积分公式使“均值是否有限”直接成为尾概率衰减速度的问题,并不要求变量有密度。
对称分布不一定有期望
标准 Cauchy 变量的密度为 f ( x ) = 1 / [ π ( 1 + x 2 ) ] 。对每个 M ,对称截断积分 ∫ − M M x f ( x ) d x = 0 ;但正半轴与负半轴上的绝对贡献各自发散:
∫ 0 M x π ( 1 + x 2 ) d x = log ( 1 + M 2 ) 2 π ⟶ ∞ . 因此它的正、负部分期望都为无穷,E X 不存在。对称截断的值称为一种主值,不能冒充期望。这个例子划清了“分布关于零对称”和“具有均值零”的边界。
固定 c > 0 ,采用不对称截断,便有
∫ − R c R x π ( 1 + x 2 ) d x = 1 2 π log 1 + c 2 R 2 1 + R 2 ⟶ log c π . 换一个 c 就换一个极限。对称主值只是某种截断规则的结果,不是一个与截断无关的概率平均。
收敛为什么不能自动穿过期望
在 ( 0 , 1 ) 上均匀取 U ,令 X n = n 1 { U < 1 / n } 。对每个固定 U > 0 ,足够大的 n 都使 X n = 0 ,所以 X n → 0 几乎必然;但
E X n = n ⋅ 1 n = 1. 非零部分越来越罕见,同时越来越高,面积始终没有消失。几乎必然收敛控制每条样本路径的尾部,却不自动控制随 n 移动的稀有大值。
推论与应用
积分运算的正确条件
若 0 ≤ X n ↑ X ,单调收敛定理 公理库 单调收敛定理 Monotone convergence theorem 非负可测函数单调递增时,积分极限等于极限函数积分。 保证 E X n ↑ E X ,允许极限为无穷。若 X n → X 几乎必然,且存在同一个可积变量 Y 满足 | X n | ≤ Y ,则支配收敛定理保证期望收敛。这些条件分别利用单调性或统一的尾部控制,补上上面尖峰例子缺少的约束。
有限个可积变量可以直接使用线性性;非负可数项可以通过单调收敛交换求和与期望;一般有正有负的可数项,需要绝对可积等额外条件;例如 ∑ n E | X n | < ∞ 就足以交换求和与期望。把“有限求和能做”推成“任何无穷求和都能做”,是最容易隐藏错误的跨步。
若 X , Y 独立且分别可积,则 X Y 也可积,并有 E ( X Y ) = E X E Y ;没有独立性时一般不成立。例如 Y = X 时,左边是二阶矩,而非均值平方。乘积公式与线性公式所需的假设不同。有限均值也不保证有限二阶矩:密度 p ( x ) = 3 2 x − 5 / 2 1 [ 1 , ∞ ) ( x ) 给出 E X = 3 ,却有 E X 2 = ∞ 。
变换变量而不重求分布
对可测 g ,只要 g ≥ 0 或 g ( X ) 可积,就有
E [ g ( X ) ] = ∫ g ( x ) P X ( d x ) . 例如公平骰子 D 的平方期望直接为 ( 1 2 + ⋯ + 6 2 ) / 6 = 91 / 6 ,不必先给 D 2 建一张新分布表。它与 ( E D ) 2 = 49 / 4 不同,差为 35 / 12 ,正是方差。按本库方差 公理库 方差 Variance 随机变量相对其均值的平方偏差期望,也是最佳常数平方预测的剩余误差。 条目的约定,使用有限二阶矩来保证这些式子都是有限量。
对非负 X 和 t > 0 ,逐点不等式 t 1 { X ≥ t } ≤ X 给出 Markov 不等式 公理库 Markov 不等式 Markov's inequality 非负随机变量超过阈值的概率由其期望除以阈值控制。 。对凸函数 φ ,在 X 与 φ ( X ) 可积时,Jensen 不等式 公理库 Jensen 不等式 Jensen's inequality 凸函数作用于平均值不超过函数值的相同加权平均。 给出 φ ( E X ) ≤ E φ ( X ) 。两者都把积分的顺序性质转成可用的概率或非线性界。
从总体平均到给定信息后的平均
E X 是指定模型下的确定数值;X ― n = n − 1 ∑ i X i 是随样本变化的随机变量。IID 且可积时,强大数律保证 X ― n → E X 几乎必然;进一步有有限方差时,Var ( X ― n ) = Var ( X ) / n 。收敛、有限样本误差和无偏性是三个不同结论,不能用“平均会接近期望”一句话互相替代。
可积变量的条件期望 公理库 条件期望 Conditional expectation 以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。 E [ X ∣ G ] 是只利用信息 G 表达的随机变量,而通常不是一个常数;再次取总体平均,仍有
E [ E [ X ∣ G ] ] = E X . 在有限分组的情形,这就是先算各组均值,再按组概率加权。它把一次复杂平均拆成条件内与条件外两层,而不是随意交换随机条件。
一阶矩方法 公理库 一阶矩方法 First moment method 用坏事件计数的期望小于一或 Markov 型界证明好对象存在。 利用非负坏事件计数的期望证明好对象存在;Monte Carlo 则用样本均值近似积分。前者关心平均值怎样约束存在性,后者还要研究随机误差如何随样本数变化。期望提供中心量,置信范围仍须由方差、尾界或其他概率工具补足。
对人数路径积分可换成逐位顾客的逗留时间之和,Little 定律 公理库 Little 定律 Little law 从同一批顾客的占用面积推出平均人数等于有效到达率乘平均逗留时间,并明确系统边界。 据此连接平均人数、有效到达率与平均时间。若继续追踪当前服务的剩余工作量,M/G/1 平均等待公式 公理库 Pollaczek–Khinchine 平均等待公式 Pollaczek-Khinchine mean formula 在稳定 M/G/1 队列中,将平均等待分解为剩余服务与前方顾客工作量,显出二阶矩效应。 还会引入服务时间二阶矩;有限平均服务并不自动保证有限平均等待。
参考资料
[1] Rick Durrett, Probability: Theory and Examples ,第 5 版作者稿,2019-01-11,§1.6“Expected Value”,尤其 §§1.6.2–1.6.3;极限交换、尾积分与期望计算。
[2] Sheldon Axler, Measure, Integration & Real Analysis , Springer, 2020,作者电子版更新于 2026-06-12,Chapter 3、Chapter 12;非负积分、积分收敛定理与概率期望。
[3] Joseph K. Blitzstein and Jessica Hwang, Introduction to Probability , 2nd ed., CRC Press, 2019,Chapter 4;线性性、指示变量与随机变量函数的期望。