Skip to content

模型Model

线性回归统计模型

Linear regression model · Linear model

响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。

形式陈述 ​

线性回归限定候选响应分布的条件均值和已声明的误差结构,因而是一类统计模型;只规定均值时,未指定的误差分布仍是模型的未知部分。固定设计线性回归观察响应向量 Y∈Rn,给定设计矩阵 X∈Rn×p,模型写为

Y=Xβ+ε,

其中 β∈Rp 未知,并以条件期望假设

E[ε∣X]=0.

因此条件均值满足

E[Y∣X]=Xβ.

误差的协方差结构须另行声明;同方差不相关模型取 Cov(ε∣X)=σ2I,一般相关或异方差模型则不能沿用同一标准误公式。

固定设计把 X 当非随机实验条件;随机设计则对每行协变量 Xi 建模,并通常要求 E[Yi∣Xi]=XiTβ。两种设定的概率量词不同,但“给定设计后的均值线性”是共同核心。

正态线性模型进一步假设 ε∣X∼Nn(0,σ2In)。零条件均值、同方差、独立和正态是不同层次,不能由“线性回归”四字一并推出。

直觉

一行设计向量规定如何由同一组系数组合出这一行的平均响应。比如设计行 (1,xi,xi2) 对应 β0+β1xi+β2xi2:输入曲线可弯曲,但三个未知系数仍只做线性组合。误差是响应偏离这个条件均值的随机部分;拟合后算出的残差则还混入估计系数的误差,二者不是同一个向量。

可识别性 ​

参数 β 可由条件均值识别,当且仅当 X 具有满列秩 p。若存在 v≠0 使 Xv=0,则

X(β+v)=Xβ,

两个参数给出相同均值;若误差分布也只通过均值平移,完整观测分布相同。此时可识别的是 Xβ 或某些 estimable contrast,而非全部坐标。

随机设计下常要求总体矩阵 E[XiXiT] 正定,或样本设计以高概率满秩。完美共线性是识别失败,近共线性则是可识别但病态,两者不能混为一谈。

例子与边界

一元带截距模型

Yi=β0+β1xi+εi

的设计行是 (1,xi)。若至少两个 xi 不同,矩阵满列秩。最小二乘解为

β^=(XTX)−1XTY.

在条件零均值下

E[β^∣X]=β+(XTX)−1XTE[ε∣X]=β,

所以有限样本条件无偏。同方差且不相关的误差条件下

Cov(β^∣X)=σ2(XTX)−1.

若所有 xi 相等,截距列与斜率列线性相关,只能估计 β0+x0β1,不能分开两者。

可用三点数据检查这套运算。取 x=(−1,0,1)、Y=(1,1,4),带截距设计满足 XTX=diag(3,2)、XTY=(6,3)T。于是 β^=(2,1.5)T,拟合值为 (0.5,2,3.5),残差为 (0.5,−1,0.5)。残差和为零、与 x 的内积也为零,是拟合算法必然满足的两条等式;仅看这三点不能据此验证真正的误差条件均值为零。

拟合值与残差可写为

Y^=HY,e=(I−H)Y,H=X(XTX)−1XT.

H 是投影到设计列空间的矩阵,故 XTe=0。残差与已含协变量样本正交是最小二乘的代数条件,不等于误差与所有潜在变量独立,也不证明条件均值模型正确。

边界与失败情形 ​

“线性”指对参数 β 线性,不要求对原始输入只有直线。加入已知特征 x2、样条基或交互项后,模型仍可写成 Xβ;广义线性模型则让链接后的条件均值等于 Xβ;例如 Poisson 的对数链接给均值 eXβ,这已改变条件均值模型。独立同方差 Gaussian 响应配恒等链接是二者的一个共同特例;一般线性模型允许的非 Gaussian、相关误差并不自动属于 GLM。

条件均值正确并不保证同方差。若 Cov(ε∣X)=Ω,普通最小二乘在零条件均值和满秩下仍无偏,但传统 σ2(XTX)−1 标准误错误;需要 sandwich 或广义最小二乘并说明条件。

观测相关本身不必破坏零条件均值。例如固定设计下 εi=U+ηi,各噪声均值为零且 U 与所有 ηi 独立,就会因共同冲击而相关,同时仍有 E(ε∣X)=0。此时首先改变的是协方差与标准误。遗漏变量或测量误差则可能使条件均值失效;尤其遗漏变量同时影响响应且与已含协变量相关时,增加样本量也不能消除系数偏移。

正态性主要支持精确小样本 t/F 推断,不是最小二乘定义或无偏性的必要条件。重尾下二阶矩可能不存在,协方差公式失去意义。

随机设计下若用同一数据选择特征、删除异常点再套固定模型标准误,选择步骤会改变条件分布。线性模型必须包含实际分析流程,或使用样本拆分、选择后推断等重新校准方法。

固定设计推断把概率只放在 Y∣X 上,结论针对这张设计矩阵;随机设计预测还要平均未来协变量分布。把前者的条件方差结论直接解释为新总体上的无条件预测保证,需要额外假设训练与目标协变量同分布。

推论与应用

Gauss–Markov 定理在固定设计、满秩、零均值和同方差不相关误差下,给出普通最小二乘在线性无偏估计量类中的最小协方差性质;它不声称在所有估计量中最优。精确 t/F 校准与区间构造由OLS 推断补上,组均值与嵌套模型比较则通向ANOVA。

当变量数超过样本数时,样本 Gram 矩阵不可逆。若再引入可用的稀疏结构与设计条件,去偏 Lasso可从稀疏初始估计出发,以近似逆修正残差得分;只要逆矩阵缺陷与初始系数误差的乘积相对于坐标标准误趋零,就能在相应噪声条件下建立渐近坐标区间。完全相同的列仍会使某些坐标无法识别,正则化本身不能解除这种障碍。

预测新响应还要区分条件均值 x∗Tβ 的估计误差与新噪声 ε∗,后者使预测区间宽于均值置信区间。

若每个实验单位同时测量多个响应,多响应线性回归把响应和系数都写成矩阵。共同设计下系数数值仍可逐列 OLS 计算,但联合标准误与检验必须保留跨响应协方差,残差交叉乘积在正态模型下具有 Wishart 分布。

参考资料
  • George A. F. Seber and Alan J. Lee, Linear Regression Analysis, 2nd ed., Wiley, 2003,Ch. 1–3。
  • C. R. Rao and Helge Toutenburg, Linear Models, 2nd ed., Springer, 1999,Ch. 2。
  • Halbert White, “A Heteroskedasticity-Consistent Covariance Matrix Estimator,” Econometrica 48(4), 1980。
关系图谱24 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置
类型化关系