Skip to content

模型Model

多响应线性回归模型

Multivariate linear regression · Multivariate linear model

同一设计矩阵同时拟合多个相关响应,系数仍逐列等于 OLS,但联合系数误差与残差散布具有矩阵正态和 Wishart 结构。

形式陈述 ​

一次实验同时测量多个响应,怎样保留它们的相关性?设固定设计矩阵 X∈Rn×k 满列秩,n>k,响应矩阵 Y∈Rn×p。多响应正态线性模型为

Y=XB+ε,ε∼MNn,p(0,In,Σ),Σ>0.

这里 B∈Rk×p:每一列是一个响应的回归系数,每一行对应同一个解释变量。本模型把单响应线性回归扩展成多个响应列;矩阵正态假设表示不同行独立,而同一行的 p 个响应误差可以相关。

固定列优先向量化后,模型也可写成

vec(Y)=(Ip⊗X)vec(B)+vec(ε),Cov(vecε)=Σ⊗In.

因此在这个表示下,它是允许相关误差的一般线性回归模型的特例;额外限制是共同设计与可分离的高斯误差结构。

系数估计、投影和残差散布分别为

B^=(XTX)−1XTY,PX=X(XTX)−1XT,ε^=(I−PX)Y,E=ε^Tε^.

精确抽样分布为

B^∼MNk,p(B,(XTX)−1,Σ),E∼Wp(n−k,Σ),B^⊥E.

E/(n−k) 是无偏协方差估计;若 n−k≥p,E 几乎必然正定,E/n 才是位于正定参数空间内的协方差极大似然估计。

直觉

同一组解释变量可以一次拟合多列数据。由于每列使用相同的设计空间,把所有残差平方相加时,最优系数仍是每列各做一次 OLS 得到的结果。

但系数数值可以逐列计算,不表示不确定性也能逐列拆开。若两个响应误差经常同向变化,它们的斜率估计也可能同向变化;残差矩阵的交叉乘积正是保存这份信息的地方。

几何上,PXY 把每一列都投到同一个 k 维设计子空间,(I−PX)Y 则放到正交的 n−k 维残差子空间。高斯性使这两个正交部分独立,因而给出精确抽样分解。

例子与边界

四行设计、两个响应,全部手算 ​

取截距和解释变量 t=(−3,−1,1,3)T,

X=(1−31−11113),Y=(−47−2−1238−1).

因为 XTX=diag(4,20),而

XTY=(4840−20),

所以

B^=(122−1).

第一响应拟合为 1+2t,第二响应为 2−t。残差矩阵为

ε^=(12−1−4−1210),E=(44424).

残差自由度为 n−k=2,因此无偏估计为

Σ^=E2=(22212).

例如两列截距估计的真实协方差为 Σ12/4,代入估计值为 1/2;两列斜率估计的协方差为 Σ12/20,代入为 1/10。单独看每列的标准误无法恢复这些交叉关系。

多个响应与多个解释变量不是同一件事 ​

“多元回归”在不同语境里可能指解释变量多,也可能指响应多。本页明确让 Y 为 n×p 矩阵,p>1 时才是多响应;k 包括截距等全部设计列。

若不同响应使用不同设计矩阵,逐列 OLS 一般不再等于考虑跨响应协方差的联合广义最小二乘估计。若不同行相关,则 In 要换成行协方差因子,也会改变系数估计和推断。

剩余自由度决定协方差可逆性 ​

即使 X 满列秩,若 n−k<p,残差散布仍必然奇异。增加响应列会增加要估计的方向,却不会增加残差行空间。加岭、收缩或降维可帮助计算,但使用这些修改后必须重新建立检验的参考分布。

非正态误差下,OLS 的某些均值和协方差性质仍可成立,矩阵正态分布、Wishart 律和拟合—残差独立性却不能一起照搬。

推论与应用

为什么相关响应不改变共同设计下的系数解 ​

固定正定 Σ,高斯负对数似然中依赖 B 的部分为

12tr{Σ−1(Y−XB)T(Y−XB)}.

令 D=B−B^。正规方程给出 XT(Y−XB^)=0,所以交叉项消失:

(Y−XB)T(Y−XB)=E+DTXTXD.

第二项半正定,其与正定 Σ−1 的迹非负,且满秩设计下只有 D=0 才取零。因此无论共同响应协方差是什么,系数极大似然解都为 B^。这证明的是共同设计下的系数位置,不是响应之间互不相关。

系数分布与残差 Wishart ​

系数误差为 B^−B=(XTX)−1XTε。用矩阵正态的左乘公式,行协方差因子为

(XTX)−1XTX(XTX)−1=(XTX)−1,

列因子仍为 Σ。因此逐元素有

Cov(B^aj,B^bl)=[(XTX)−1]abΣjl.

残差投影 I−PX 的秩为 n−k,高斯投影的 Wishart 定理给出 E 的分布。又因 XT(I−PX)=0,系数误差与残差矩阵交叉协方差为零;二者联合正态,故独立,系数也独立于残差的外积和。

协方差估计的两个分母 ​

Wishart 均值公式给出 E[E]=(n−k)Σ,其中 E 是残差散布矩阵,E 才表示取期望。因此无偏估计为 E/(n−k)。

若 E>0,把系数解代回似然,优化 n2log⁡det⁡Σ+12tr(Σ−1E) 得到 Σ^ML=E/n。无偏分母与似然分母回答不同问题;在后续精确 F 或 Wishart 校准中不能随意混用。

预测均值与新观测 ​

对给定解释变量列向量 x0∈Rk,预测响应均值为 B^Tx0,其协方差是

h0Σ,h0=x0T(XTX)−1x0.

一个独立新观测还带有自身误差,所以预测误差协方差为 (1+h0)Σ。均值置信区域与新观测预测区域因而不同;估计 Σ 后,还要用相应的联合抽样分布作校准。

参考资料
  • Stanford STATS305C,《Multivariate regression》,Model、Estimation of B、Estimation of Σ、Distribution results 与 Sums of squares matrices。
关系图谱16 个相邻概念 · 3 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系