Skip to content

F 分布

F-distribution · Fisher–Snedecor distribution

两个独立卡方变量分别除以自由度后所得比值的正值分布。

形式陈述

Uχd12Vχd22 且二者独立。随机变量

F=U/d1V/d2

服从分子自由度 d1>0、分母自由度 d2>0F 分布,记作 FFd1,d2。在 x>0 上其密度为

f(x)=Γ((d1+d2)/2)Γ(d1/2)Γ(d2/2)(d1d2)d1/2xd1/21(1+d1d2x)(d1+d2)/2.

它只取正值并通常右偏。当 d2>2

E[F]=d2d22;

d2>4 时方差存在。分母靠近零会产生长右尾,矩存在范围主要受分母自由度控制。

倒数满足

FFd1,d2F1Fd2,d1.

自由度顺序随倒数交换,而分布本身一般不对称,因此 Fd1,d2Fd2,d1 不能混用。

若令 B=d1F/(d1F+d2),则 B 服从 Beta(d1/2,d2/2)。这给出分布函数与分位数计算的稳定转换,也说明 F 的右尾对应 Beta 变量逼近一。它是分布之间的精确变换,不需要大样本近似。

直觉

每个卡方变量除以自己的自由度后,成为均值约为一的“平方波动尺度”。F 分布比较两个独立尺度估计:分子异常大或分母异常小都会产生大的比值。它天然适合方差比、解释平方和与残差平方和之比。

自由度记录两个尺度各自由多少独立正态方向估计。分母自由度小时,尺度估计容易偶然接近零,右尾很厚;自由度增加后,比值更集中在一附近。

例子与计算

设两组独立正态样本

X1,,XmN(μX,σX2),Y1,,YnN(μY,σY2),

并分别计算无偏样本方差 SX2,SY2。由正态样本方差的卡方分布,

U=(m1)SX2σX2χm12,V=(n1)SY2σY2χn12,

且两者独立。因此

SX2/σX2SY2/σY2Fm1,n1.

在零假设 σX2=σY2 下,原始方差比 SX2/SY2 服从 Fm1,n1。若交换分子分母,统计量变为倒数,临界值和自由度也必须同步交换。

线性回归中,若嵌套模型新增 q 个系数,正态同方差误差下可比较

F=(RSSreducedRSSfull)/qRSSfull/(npfull).

零假设下,分子是新增方向解释的平方和,分母是剩余噪声均方;正交投影使两部分独立,故得到 Fq,npfull

边界与失败情形

独立性不能省略。若分子、分母来自重叠数据或相关平方和,它们即使边缘各自是标准化卡方,比值也未必服从 F。线性模型的精确 F 分解依赖投影子空间正交与正态误差。

正态性对小样本方差比检验尤其关键。重尾或偏斜分布会使样本方差高度不稳定,名义 F 临界值可能严重失准;稳健的尺度检验或重抽样方法有不同假设,不能继续声称精确 F 分布。

较大的 F 值只说明分子均方相对分母均方大。它不自动说明实际效应重要,也不定位哪些系数非零;多自由度整体检验拒绝后还需估计、区间与预先规定的对比解释。

当备择使分子二次型具有非零均值时,统计量服从非中心 F 分布。用中心 F 描述备择下功效会错误;中心分布主要负责零假设校准。

推论与应用

Ttν,则

T2F1,ν.

因此单个回归系数的双侧 t 检验与单自由度 F 检验给出相同 p 值。F 统计量没有符号,所以多参数整体检验只判断是否存在偏离,不保留方向。

F 分位数可反演正态总体方差比的置信区间,也构成 ANOVA 与嵌套线性模型检验的有限样本基准。更一般模型中的“F-type”统计量可能只渐近服从相应分布,必须写明近似范围。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§5.3。
  • T. W. Anderson, An Introduction to Multivariate Statistical Analysis, 3rd ed., Wiley, 2003,Ch. 2–3。
  • George A. F. Seber and Alan J. Lee, Linear Regression Analysis, 2nd ed., Wiley, 2003,Ch. 2–3。