形式陈述
线性回归限定候选响应分布的条件均值和已声明的误差结构,因而是一类统计模型公理库统计模型与参数Statistical model · Statistical parameter对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。;只规定均值时,未指定的误差分布仍是模型的未知部分。固定设计线性回归观察响应向量公理库随机向量Random vector · 多维随机变量一次随机试验同时输出有限多个实坐标所形成的可测映射。 ,给定设计矩阵公理库矩阵Matrix以有限行列集合为索引、取值于半环,并以中间指标求和定义乘法的函数。 ,模型写为
其中 未知,并以条件期望公理库条件期望Conditional expectation以信息分组的加权平均建立条件期望直觉,再连接测度定义、最小均方预测、塔式性质和可计算反例。假设
因此条件均值满足
误差的协方差公理库协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。结构须另行声明;同方差不相关模型取 ,一般相关或异方差模型则不能沿用同一标准误公式。
固定设计把 当非随机实验条件;随机设计则对每行协变量 建模,并通常要求 。两种设定的概率量词不同,但“给定设计后的均值线性”是共同核心。
正态线性模型进一步假设 。零条件均值、同方差、独立和正态是不同层次,不能由“线性回归”四字一并推出。
直觉
一行设计向量规定如何由同一组系数组合出这一行的平均响应。比如设计行 对应 :输入曲线可弯曲,但三个未知系数仍只做线性组合。误差是响应偏离这个条件均值的随机部分;拟合后算出的残差则还混入估计系数的误差,二者不是同一个向量。
可识别性
参数 可由条件均值识别,当且仅当 具有满列秩 。若存在 使 ,则
两个参数给出相同均值;若误差分布也只通过均值平移,完整观测分布相同。此时可识别的是 或某些 estimable contrast,而非全部坐标。
随机设计下常要求总体矩阵 正定,或样本设计以高概率满秩。完美共线性是识别失败,近共线性则是可识别但病态,两者不能混为一谈。
例子与边界
一元带截距模型
的设计行是 。若至少两个 不同,矩阵满列秩。最小二乘解公理库最小二乘与正规方程Least squares · Normal equations将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。为
在条件零均值下
所以有限样本条件无偏。同方差且不相关的误差条件下
若所有 相等,截距列与斜率列线性相关,只能估计 ,不能分开两者。
可用三点数据检查这套运算。取 、,带截距设计满足 、。于是 ,拟合值为 ,残差为 。残差和为零、与 的内积也为零,是拟合算法必然满足的两条等式;仅看这三点不能据此验证真正的误差条件均值为零。
拟合值与残差可写为
是投影到设计列空间的矩阵,故 。残差与已含协变量样本正交是最小二乘的代数条件,不等于误差与所有潜在变量独立,也不证明条件均值模型正确。
边界与失败情形
“线性”指对参数 线性,不要求对原始输入只有直线。加入已知特征 、样条基或交互项后,模型仍可写成 ;广义线性模型公理库广义线性模型Generalized linear model · GLM用链接函数把指数族响应的条件均值连接到协变量线性预测子。则让链接后的条件均值等于 ;例如 Poisson 的对数链接给均值 ,这已改变条件均值模型。独立同方差 Gaussian 响应配恒等链接是二者的一个共同特例;一般线性模型允许的非 Gaussian、相关误差并不自动属于 GLM。
条件均值正确并不保证同方差。若 ,普通最小二乘在零条件均值和满秩下仍无偏,但传统 标准误错误;需要 sandwich 或广义最小二乘并说明条件。
观测相关本身不必破坏零条件均值。例如固定设计下 ,各噪声均值为零且 与所有 独立,就会因共同冲击而相关,同时仍有 。此时首先改变的是协方差与标准误。遗漏变量或测量误差则可能使条件均值失效;尤其遗漏变量同时影响响应且与已含协变量相关时,增加样本量也不能消除系数偏移。
正态性主要支持精确小样本 推断,不是最小二乘定义或无偏性的必要条件。重尾下二阶矩可能不存在,协方差公式失去意义。
随机设计下若用同一数据选择特征、删除异常点再套固定模型标准误,选择步骤会改变条件分布。线性模型必须包含实际分析流程,或使用样本拆分、选择后推断等重新校准方法。
固定设计推断把概率只放在 上,结论针对这张设计矩阵;随机设计预测还要平均未来协变量分布。把前者的条件方差结论直接解释为新总体上的无条件预测保证,需要额外假设训练与目标协变量同分布。
推论与应用
Gauss–Markov 定理在固定设计、满秩、零均值和同方差不相关误差下,给出普通最小二乘在线性无偏估计量类中的最小协方差性质;它不声称在所有估计量中最优。精确 t/F 校准与区间构造由OLS 推断公理库普通最小二乘推断Ordinary least squares inference · OLS inference在线性模型假设下推导 OLS 系数分布、标准误及有限样本 t/F 推断。补上,组均值与嵌套模型比较则通向ANOVA公理库方差分析Analysis of variance · ANOVA将组均值比较表示为线性模型,并把总平方和正交分解为组间与组内部分。。
当变量数超过样本数时,样本 Gram 矩阵不可逆。若再引入可用的稀疏结构与设计条件,去偏 Lasso公理库去偏 Lasso 与坐标置信区间Debiased Lasso · de-biased Lasso · de-sparsified Lasso · desparsified Lasso · 去稀疏 Lasso用近似逆矩阵修正 Lasso 的残差得分,将坐标误差拆成高斯主项与可控制的乘积余项,并据此构造置信区间。可从稀疏初始估计出发,以近似逆修正残差得分;只要逆矩阵缺陷与初始系数误差的乘积相对于坐标标准误趋零,就能在相应噪声条件下建立渐近坐标区间。完全相同的列仍会使某些坐标无法识别,正则化本身不能解除这种障碍。
预测新响应还要区分条件均值 的估计误差与新噪声 ,后者使预测区间宽于均值置信区间。
若每个实验单位同时测量多个响应,多响应线性回归公理库多响应线性回归模型Multivariate linear regression · Multivariate linear model同一设计矩阵同时拟合多个相关响应,系数仍逐列等于 OLS,但联合系数误差与残差散布具有矩阵正态和 Wishart 结构。把响应和系数都写成矩阵。共同设计下系数数值仍可逐列 OLS 计算,但联合标准误与检验必须保留跨响应协方差,残差交叉乘积在正态模型下具有 Wishart 分布。
参考资料
- George A. F. Seber and Alan J. Lee, Linear Regression Analysis, 2nd ed., Wiley, 2003,Ch. 1–3。
- C. R. Rao and Helge Toutenburg, Linear Models, 2nd ed., Springer, 1999,Ch. 2。
- Halbert White, “A Heteroskedasticity-Consistent Covariance Matrix Estimator,” Econometrica 48(4), 1980。