形式陈述
设实随机变量 具有有限二阶矩 。由Cauchy–Schwarz 不等式公理库Cauchy–Schwarz 不等式Cauchy–Schwarz inequality · 柯西–施瓦茨不等式内积的绝对值不超过两向量范数之积,且等号精确刻画线性相关。,,所以期望公理库期望Expectation · Expected value实值或复值随机变量关于概率测度的 Lebesgue 积分,概括加权平均与总体质量平衡。 已有定义。方差为
展开平方并使用期望线性性,得到常用计算式
这个等式只在二阶矩有限的前提下使用;不能把两个无穷量的形式差当作方差。
方差非负,并且
平移 不改变离均值的距离,缩放 则把平方距离放大 倍。 当且仅当 几乎必然成立。标准差
与 具有相同量纲,便于回到原测量尺度解释。
直觉
方差是“用一个常数预测 ”所无法消去的最小平方误差。对任意常数 ,
交叉项取期望后为零,因此
均值由此成为平方损失下唯一的最佳常数预测,最小风险就是方差。这一恒等式比“平均离均值多远”更精确,也预告了 投影、偏差—方差分解和条件期望的几何结构。
对有限带权样本,这个分解还给出压缩目标:保持总质量、一阶矩和二阶矩,就保持每个常数预测值对应的平方损失。精确单均值核心集公理库核心集与精确单均值压缩Coreset · Strong coreset · 核集 · Exact one-mean coreset核心集用带权输入子集同时保持所有查询的目标值;二次提升与凸组合消元给出至多 d+2 点的非负精确单均值核心集。将此推广到欧氏空间,并通过二次提升与凸组合消元构造少量带权原始点;它保持整个损失函数,因而同时保持最佳中心与最小残差。
把分布看成总质量为一的物体,期望是质心,方差类似绕质心的转动惯量:距离中心两倍远的质量会贡献四倍。平方带来漂亮的代数和正交结构,却也让方差对极端尾部格外敏感;完整描述分布形状或风险还需要尾概率、分位数等信息。
例子与边界
若 ,则 ,所以
方差在 时达到 ,在 接近 或 时趋于零。这个变化具有预测含义:几乎总取同一值的比特容易预测,胜负各半时平方误差最大。
温标转换展示单位规则。若摄氏温度为 ,华氏温度为 ,则
常数 只移动中心,不改变散布;标准差随单位线性变化,方差则带平方单位。
有限均值不保证有限方差。取 Pareto 分布
它满足 ,但 ,因此没有有限方差。这里平均位置存在,尾部波动却无法压缩成一个有限二阶尺度;任何依赖方差的误差界都需要改用更强尾部假设或稳健方法。
相同方差也不意味着相同风险形态。标准正态分布与 上的均匀分布都具有方差 ,前者无界而后者严格有界。方差控制的是一个二阶平均,不能单独决定尾概率、偏度或极端值行为。
推论与应用
对有限二阶矩变量,和的方差由协方差公理库协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。补齐:
只要协方差为零,方差便可加。独立性足以推出零协方差,反向推论通常不成立。对有限族变量,只知道每一对不相关即可消去二阶交叉项,但这仍不推出它们相互独立。
Chebyshev 不等式公理库Chebyshev 不等式Chebyshev's inequality随机变量偏离均值至少给定距离的概率由方差除以距离平方控制。把二阶平均转成分布无关的尾界:对 ,
它通常不够锋利,却只要求有限方差。若样本序列具有共同均值 、两两不相关且 ,则对每个样本量 ,有 。对每个 ,Chebyshev 给出 ,得到一类弱大数律。
给定信息后,总波动分解为
第一项是信息块内仍未解释的波动,第二项是不同信息块预测值之间的波动。该式既说明条件平均为何能降低平方误差,也构成统计中的组内—组间分解。
Monte Carlo 把 作为独立样本均值的基础波动尺度;固定置信度下的误差区间还需 Chebyshev、中心极限定理或集中不等式连接到概率陈述。平方损失下的估计风险同样要区分抽样方差、偏差平方与不可约噪声,预测值的方差无法单独代表泛化误差。
方差对系统表现的影响不止体现在误差条。M/G/1 平均等待公式公理库Pollaczek–Khinchine 平均等待公式Pollaczek-Khinchine mean formula在稳定 M/G/1 队列中,将平均等待分解为剩余服务与前方顾客工作量,显出二阶矩效应。在固定到达率和平均服务时间下,仍通过 改变等待;随机时刻更容易落在长服务中的长度偏倚是其机制。
参考资料
- Patrick Billingsley, Probability and Measure, 3rd ed., Wiley, 1995, Chapter 4.
- Joseph K. Blitzstein and Jessica Hwang, Introduction to Probability, 2nd ed., CRC Press, 2019, Chapter 6.
- Larry Wasserman, All of Statistics, Springer, 2004, Chapters 2–3.