Skip to content

线性回归统计模型

Linear regression model · Linear model

响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。

形式陈述

固定设计线性回归观察响应向量 YRn,给定设计矩阵 XRn×p,模型写为

Y=Xβ+ε,

其中 βRp 未知,并假设

E[εX]=0.

因此条件均值满足

E[YX]=Xβ.

固定设计把 X 当非随机实验条件;随机设计则对每行协变量 Xi 建模,并通常要求 E[YiXi]=XiTβ。两种设定的概率量词不同,但“给定设计后的均值线性”是共同核心。

同方差不相关误差是附加条件

Cov(εX)=σ2In.

正态线性模型进一步假设 εXNn(0,σ2In)。零条件均值、同方差、独立和正态是不同层次,不能由“线性回归”四字一并推出。

可识别性

参数 β 可由条件均值识别,当且仅当 X 具有满列秩 p。若存在 v0 使 Xv=0,则

X(β+v)=Xβ,

两个参数给出相同均值;若误差分布也只通过均值平移,完整观测分布相同。此时可识别的是 Xβ 或某些 estimable contrast,而非全部坐标。

随机设计下常要求总体矩阵 E[XiXiT] 正定,或样本设计以高概率满秩。完美共线性是识别失败,近共线性则是可识别但病态,两者不能混为一谈。

例子与计算

一元带截距模型

Yi=β0+β1xi+εi

的设计行是 (1,xi)。若至少两个 xi 不同,矩阵满列秩。最小二乘解为

β^=(XTX)1XTY.

在条件零均值下

E[β^X]=β+(XTX)1XTE[εX]=β,

所以有限样本条件无偏。同方差下

Cov(β^X)=σ2(XTX)1.

若所有 xi 相等,截距列与斜率列线性相关,只能估计 β0+x0β1,不能分开两者。

拟合值与残差可写为

Y^=HY,e=(IH)Y,H=X(XTX)1XT.

H 是投影到设计列空间的矩阵,故 XTe=0。残差与已含协变量样本正交是最小二乘的代数条件,不等于误差与所有潜在变量独立,也不证明条件均值模型正确。

边界与失败情形

“线性”指对参数 β 线性,不要求对原始输入只有直线。加入已知特征 x2、样条基或交互项后,模型仍可写成 Xβ;反之,参数出现在指数中的模型通常不是线性模型。

条件均值正确并不保证同方差。若 Cov(εX)=Ω,普通最小二乘在零条件均值和满秩下仍无偏,但传统 σ2(XTX)1 标准误错误;需要 sandwich 或广义最小二乘并说明条件。

相关观测、遗漏变量与测量误差会改变零条件均值。尤其遗漏变量若与已包含协变量相关,误差条件均值不再为零,增加样本量只会更精确地估计错误目标。

正态性主要支持精确小样本 t/F 推断,不是最小二乘定义或无偏性的必要条件。重尾下二阶矩可能不存在,协方差公式失去意义。

随机设计下若用同一数据选择特征、删除异常点再套固定模型标准误,选择步骤会改变条件分布。线性模型必须包含实际分析流程,或使用样本拆分、选择后推断等重新校准方法。

固定设计推断把概率只放在 YX 上,结论针对这张设计矩阵;随机设计预测还要平均未来协变量分布。把前者的条件方差结论直接解释为新总体上的无条件预测保证,需要额外假设训练与目标协变量同分布。

推论与应用

Gauss–Markov 定理在固定设计、满秩、零均值和同方差不相关误差下,给出普通最小二乘在线性无偏估计量类中的最小协方差性质;它不声称在所有估计量中最优。

预测新响应还要区分条件均值 xTβ 的估计误差与新噪声 ε,后者使预测区间宽于均值置信区间。

参考资料
  • George A. F. Seber and Alan J. Lee, Linear Regression Analysis, 2nd ed., Wiley, 2003,Ch. 1–3。
  • C. R. Rao and Helge Toutenburg, Linear Models, 2nd ed., Springer, 1999,Ch. 2。
  • Halbert White, “A Heteroskedasticity-Consistent Covariance Matrix Estimator,” Econometrica 48(4), 1980。