形式陈述
固定设计线性回归观察响应向量公理库随机向量Random vector · 多维随机变量一次随机试验同时输出有限多个实坐标所形成的可测映射。 ,给定设计矩阵公理库矩阵Matrix以有限行列集合为索引、取值于半环,并以中间指标求和定义乘法的函数。 ,模型写为
其中 未知,并以条件期望公理库条件期望Conditional expectation给定子 σ-代数后可测、并在所有已知事件上保持原积分的随机变量。假设
因此条件均值满足
误差的协方差公理库协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。结构须另行声明;同方差不相关模型取 ,一般相关或异方差模型则不能沿用同一标准误公式。
固定设计把 当非随机实验条件;随机设计则对每行协变量 建模,并通常要求 。两种设定的概率量词不同,但“给定设计后的均值线性”是共同核心。
同方差不相关误差是附加条件
正态线性模型进一步假设 。零条件均值、同方差、独立和正态是不同层次,不能由“线性回归”四字一并推出。
直觉
可识别性
参数 可由条件均值识别,当且仅当 具有满列秩 。若存在 使 ,则
两个参数给出相同均值;若误差分布也只通过均值平移,完整观测分布相同。此时可识别的是 或某些 estimable contrast,而非全部坐标。
随机设计下常要求总体矩阵 正定,或样本设计以高概率满秩。完美共线性是识别失败,近共线性则是可识别但病态,两者不能混为一谈。
例子与边界
一元带截距模型
的设计行是 。若至少两个 不同,矩阵满列秩。最小二乘解为
在条件零均值下
所以有限样本条件无偏。同方差下
若所有 相等,截距列与斜率列线性相关,只能估计 ,不能分开两者。
拟合值与残差可写为
是投影到设计列空间的矩阵,故 。残差与已含协变量样本正交是最小二乘的代数条件,不等于误差与所有潜在变量独立,也不证明条件均值模型正确。
边界与失败情形
“线性”指对参数 线性,不要求对原始输入只有直线。加入已知特征 、样条基或交互项后,模型仍可写成 ;反之,参数出现在指数中的模型通常不是线性模型。
条件均值正确并不保证同方差。若 ,普通最小二乘在零条件均值和满秩下仍无偏,但传统 标准误错误;需要 sandwich 或广义最小二乘并说明条件。
相关观测、遗漏变量与测量误差会改变零条件均值。尤其遗漏变量若与已包含协变量相关,误差条件均值不再为零,增加样本量只会更精确地估计错误目标。
正态性主要支持精确小样本 推断,不是最小二乘定义或无偏性的必要条件。重尾下二阶矩可能不存在,协方差公式失去意义。
随机设计下若用同一数据选择特征、删除异常点再套固定模型标准误,选择步骤会改变条件分布。线性模型必须包含实际分析流程,或使用样本拆分、选择后推断等重新校准方法。
固定设计推断把概率只放在 上,结论针对这张设计矩阵;随机设计预测还要平均未来协变量分布。把前者的条件方差结论直接解释为新总体上的无条件预测保证,需要额外假设训练与目标协变量同分布。
推论与应用
Gauss–Markov 定理在固定设计、满秩、零均值和同方差不相关误差下,给出普通最小二乘在线性无偏估计量类中的最小协方差性质;它不声称在所有估计量中最优。精确 t/F 校准与区间构造由OLS 推断公理库普通最小二乘推断Ordinary least squares inference · OLS inference在线性模型假设下推导 OLS 系数分布、标准误及有限样本 t/F 推断。补上,组均值与嵌套模型比较则通向ANOVA公理库方差分析Analysis of variance · ANOVA将组均值比较表示为线性模型,并把总平方和正交分解为组间与组内部分。。
预测新响应还要区分条件均值 的估计误差与新噪声 ,后者使预测区间宽于均值置信区间。
参考资料
- George A. F. Seber and Alan J. Lee, Linear Regression Analysis, 2nd ed., Wiley, 2003,Ch. 1–3。
- C. R. Rao and Helge Toutenburg, Linear Models, 2nd ed., Springer, 1999,Ch. 2。
- Halbert White, “A Heteroskedasticity-Consistent Covariance Matrix Estimator,” Econometrica 48(4), 1980。