Skip to content

Student t 分布

Student's t-distribution · t distribution

标准正态变量除以独立卡方均方根所得的对称重尾分布。

形式陈述

ZN(0,1)Vχν2,且 ZV 独立。随机变量

T=ZV/ν

服从自由度 ν>0 的 Student t 分布,记作 Ttν。其密度为

fν(t)=Γ((ν+1)/2)νπΓ(ν/2)(1+t2ν)(ν+1)/2,tR.

密度关于零对称。均值在 ν>1 时存在且为零;方差在 ν>2 时为

Var(T)=νν2.

1<ν2 时均值存在而方差无穷;当 0<ν1 时通常期望不存在。随 νV/ν1,所以 tν 依分布收敛到 N(0,1)

自由度为一时 t1 就是标准 Cauchy 分布,尾概率按多项式而非指数速度衰减,因而连均值都不存在。对一般 ν,密度尾部量级为 |t|(ν+1);只有阶数小于 ν 的绝对矩存在。这给“重尾”一个可检验的矩边界,不应只凭图形中央比正态矮来描述。

直觉

如果标准误的尺度已知,标准化均值是正态变量;当尺度必须由同一小样本估计时,分母会随机波动。偶尔偏小的分母把比值推向远尾,因此 t 分布比标准正态更重尾。自由度越大,尺度估计越稳定,额外不确定性越小。

t 分布的中心仍由对称标准正态分子决定。重尾不是“数据一定有异常值”,而是有限样本中估计方差所付出的精确校准代价。

例子与计算

X1,,Xn 独立服从 N(μ,σ2),其中 μ,σ2 未知,定义

X¯=1niXi,S2=1n1i(XiX¯)2.

正态样本具有两个关键事实:

Z=n(X¯μ)σN(0,1),V=(n1)S2σ2χn12,

并且 ZV 独立。因此未知 σ 消去后

n(X¯μ)S=ZV/(n1)tn1.

n=10、观察到 x¯=5.4s=0.6,检验 H0:μ=5 的统计量为

tobs=10(5.45)0.62.108.

应与 t9 而非标准正态比较;双侧 5% 临界值约 2.262,故不拒绝。若误用正态临界值 1.96,会改变有限样本决定。

同一数据的 95% 均值区间为

5.4±2.2620.610[4.971,5.829].

零假设值 5 位于区间内,与双侧检验未拒绝完全一致;这是一族检验反演的结果,不是“区间中每个参数各有 95% 后验概率”。

边界与失败情形

独立性是定义的一部分。若把任意相关的正态分子和卡方分母组成比值,分布一般不是 t。正态样本均值与样本方差的独立性是特殊定理,不能从“不相关”或大样本直觉替代。

一元 t 统计量的精确分布还依赖正态抽样。对偏斜或重尾总体,studentized 均值常在有限方差等条件下渐近正态,但小样本并不精确服从 tn1;异常值还会同时影响分子与样本标准差。

t 分布不是所有“估计值除以标准误”的普遍精确分布。回归系数的 t 检验需要线性模型、误差正态性与正确的方差结构;稳健标准误通常提供渐近校准,自由度处理另有规则。

配对样本应先形成配对差再做单样本 t 推断。把同一对象前后测量当成两组独立样本,会丢掉协方差信息并使用错误的标准误。

推论与应用

由枢轴量反演得到正态总体均值的精确置信区间

X¯±t1α/2,n1Sn.

覆盖概率在所有 μR,σ>0 上都恰为 1α,前提是独立正态模型成立。随着 n 增大,t 分位数趋近正态分位数,区间额外宽度逐渐消失。

Ttν,则 T2F1,ν。这个关系把双侧 t 检验连接到单自由度的 F 检验,但平方会丢失效应方向。

参考资料
  • George Casella and Roger L. Berger, Statistical Inference, 2nd ed., Duxbury, 2002,§5.3。
  • William Gosset, “The Probable Error of a Mean,” Biometrika 6(1), 1908。
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,关于正态均值检验的章节。