形式陈述
Student t 分布是一族实值连续概率分布 公理库 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 ,由标准正态变量除以独立卡方变量所给出的随机尺度产生,自由度控制尾部厚度。
设 Z 服从标准正态分布 公理库 正态分布 Normal distribution · Gaussian distribution · 高斯分布 具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。 ,V 服从卡方分布 公理库 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 χ ν 2 ,且 Z 与 V 独立 公理库 独立性 Statistical independence 若干事件、σ-代数或随机元素的所有有限联合概率都按边缘概率乘积分解。 。随机变量
T = Z V / ν 服从自由度 ν > 0 的 Student t 分布,记作 T ∼ t ν 。其密度为
f ν ( t ) = Γ ( ( ν + 1 ) / 2 ) ν π Γ ( ν / 2 ) ( 1 + t 2 ν ) − ( ν + 1 ) / 2 , t ∈ R . 密度关于零对称。均值在 ν > 1 时存在且为零;方差在 ν > 2 时为
Var ( T ) = ν ν − 2 . 当 1 < ν ≤ 2 时均值存在而方差无穷;当 0 < ν ≤ 1 时通常期望不存在。随 ν → ∞ ,V / ν → 1 ,所以 t ν 依分布收敛到 N ( 0 , 1 ) 。
自由度为一时 t 1 就是标准 Cauchy 分布,尾概率按多项式而非指数速度衰减,因而连均值都不存在。对一般 ν ,密度尾部量级为 | t | − ( ν + 1 ) ;只有阶数小于 ν 的绝对矩存在。这给“重尾”一个可检验的矩边界,不应只凭图形中央比正态矮来描述。
直觉
如果标准误的尺度已知,标准化均值是正态变量;当尺度必须由同一小样本估计时,分母会随机波动。偶尔偏小的分母把比值推向远尾,因此 t 分布比标准正态更重尾。自由度越大,尺度估计越稳定,额外不确定性越小。
t 分布的中心仍由对称标准正态分子决定。重尾不是“数据一定有异常值”,而是有限样本中估计方差所付出的精确校准代价。
例子与边界
若 X 1 , … , X n 独立服从 N ( μ , σ 2 ) ,其中 μ , σ 2 未知,定义
X ¯ = 1 n ∑ i X i , S 2 = 1 n − 1 ∑ i ( X i − X ¯ ) 2 . 正态样本具有两个关键事实:
Z = n ( X ¯ − μ ) σ ∼ N ( 0 , 1 ) , V = ( n − 1 ) S 2 σ 2 ∼ χ n − 1 2 , 并且 Z 与 V 独立。因此未知 σ 消去后
n ( X ¯ − μ ) S = Z V / ( n − 1 ) ∼ t n − 1 . 若 n = 10 、观察到 x ¯ = 5.4 、s = 0.6 ,检验 H 0 : μ = 5 的统计量为
t o b s = 10 ( 5.4 − 5 ) 0.6 ≈ 2.108 . 应与 t 9 而非标准正态比较;双侧 5 % 临界值约 2.262 ,故不拒绝。若误用正态临界值 1.96 ,会改变有限样本决定。
同一数据的 95 % 均值区间为
5.4 ± 2.262 0.6 10 ≈ [ 4.971 , 5.829 ] . 零假设值 5 位于区间内,与双侧检验未拒绝完全一致;这是一族检验反演的结果,不是“区间中每个参数各有 95 % 后验概率”。
边界与失败情形
独立性是定义的一部分。若把任意相关的正态分子和卡方分母组成比值,分布一般不是 t 。正态样本均值与样本方差的独立性是特殊定理,不能从“不相关”或大样本直觉替代。
一元 t 统计量的精确分布还依赖正态抽样。对偏斜或重尾总体,studentized 均值常在有限方差等条件下渐近正态,但小样本并不精确服从 t n − 1 ;异常值还会同时影响分子与样本标准差。
t 分布不是所有“估计值除以标准误”的普遍精确分布。回归系数的 t 检验需要线性模型、误差正态性与正确的方差结构;稳健标准误通常提供渐近校准,自由度处理另有规则。
配对样本应先形成配对差再做单样本 t 推断。把同一对象前后测量当成两组独立样本,会丢掉协方差信息并使用错误的标准误。
推论与应用
由枢轴量反演得到正态总体均值的精确置信区间 公理库 置信区间 Confidence interval · Confidence set 由样本决定、在重复抽样下以规定概率覆盖固定参数目标的随机集合。
X ¯ ± t 1 − α / 2 , n − 1 S n . 覆盖概率在所有 μ ∈ R , σ > 0 上都恰为 1 − α ,前提是独立正态模型成立。随着 n 增大,t 分位数趋近正态分位数,区间额外宽度逐渐消失。
若 T ∼ t ν ,则它的平方服从F 分布 公理库 F 分布 F-distribution · Fisher–Snedecor distribution 两个独立卡方变量分别除以自由度后所得比值的正值分布。 ,具体为 T 2 ∼ F 1 , ν 。这个关系把双侧 t 检验连接到单自由度的 F 检验,但平方会丢失效应方向。
参考资料
George Casella and Roger L. Berger, Statistical Inference , 2nd ed., Duxbury, 2002,§5.3。
William Gosset, “The Probable Error of a Mean,” Biometrika 6(1), 1908。
Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses , 3rd ed., Springer, 2005,关于正态均值检验的章节。