形式陈述
一次实验同时测量多个响应,怎样保留它们的相关性?设固定设计矩阵 X ∈ R n × k 满列秩,n > k ,响应矩阵 Y ∈ R n × p 。多响应正态线性模型为
Y = X B + ε , ε ∼ MN n , p ( 0 , I n , Σ ) , Σ > 0. 这里 B ∈ R k × p :每一列是一个响应的回归系数,每一行对应同一个解释变量。本模型把单响应线性回归 公理库 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。 扩展成多个响应列;矩阵正态 公理库 矩阵正态分布 Matrix normal distribution · Matrix-variate normal distribution 在列优先向量化约定下,以可分离的行列协方差描述联合正态矩阵,并明确密度、线性变换与参数尺度不识别。 假设表示不同行独立,而同一行的 p 个响应误差可以相关。
固定列优先向量化后,模型也可写成
vec ( Y ) = ( I p ⊗ X ) vec ( B ) + vec ( ε ) , Cov ( vec ε ) = Σ ⊗ I n . 因此在这个表示下,它是允许相关误差的一般线性回归模型的特例;额外限制是共同设计与可分离的高斯误差结构。
系数估计、投影和残差散布分别为
B ^ = ( X T X ) − 1 X T Y , P X = X ( X T X ) − 1 X T , ε ^ = ( I − P X ) Y , E = ε ^ T ε ^ . 精确抽样分布为
B ^ ∼ MN k , p ( B , ( X T X ) − 1 , Σ ) , E ∼ W p ( n − k , Σ ) , B ^ ⊥ E . E / ( n − k ) 是无偏协方差估计;若 n − k ≥ p ,E 几乎必然正定,E / n 才是位于正定参数空间内的协方差极大似然估计。
直觉
同一组解释变量可以一次拟合多列数据。由于每列使用相同的设计空间,把所有残差平方相加时,最优系数仍是每列各做一次 OLS 得到的结果。
但系数数值可以逐列计算,不表示不确定性也能逐列拆开。若两个响应误差经常同向变化,它们的斜率估计也可能同向变化;残差矩阵的交叉乘积正是保存这份信息的地方。
几何上,P X Y 把每一列都投到同一个 k 维设计子空间,( I − P X ) Y 则放到正交的 n − k 维残差子空间。高斯性使这两个正交部分独立,因而给出精确抽样分解。
例子与边界
四行设计、两个响应,全部手算
取截距和解释变量 t = ( − 3 , − 1 , 1 , 3 ) T ,
X = ( 1 − 3 1 − 1 1 1 1 3 ) , Y = ( − 4 7 − 2 − 1 2 3 8 − 1 ) . 因为 X T X = diag ( 4 , 20 ) ,而
X T Y = ( 4 8 40 − 20 ) , 所以
B ^ = ( 1 2 2 − 1 ) . 第一响应拟合为 1 + 2 t ,第二响应为 2 − t 。残差矩阵为
ε ^ = ( 1 2 − 1 − 4 − 1 2 1 0 ) , E = ( 4 4 4 24 ) . 残差自由度为 n − k = 2 ,因此无偏估计为
Σ ^ = E 2 = ( 2 2 2 12 ) . 例如两列截距估计的真实协方差为 Σ 12 / 4 ,代入估计值为 1 / 2 ;两列斜率估计的协方差为 Σ 12 / 20 ,代入为 1 / 10 。单独看每列的标准误无法恢复这些交叉关系。
多个响应与多个解释变量不是同一件事
“多元回归”在不同语境里可能指解释变量多,也可能指响应多。本页明确让 Y 为 n × p 矩阵,p > 1 时才是多响应;k 包括截距等全部设计列。
若不同响应使用不同设计矩阵,逐列 OLS 一般不再等于考虑跨响应协方差的联合广义最小二乘估计。若不同行相关,则 I n 要换成行协方差因子,也会改变系数估计和推断。
剩余自由度决定协方差可逆性
即使 X 满列秩,若 n − k < p ,残差散布仍必然奇异。增加响应列会增加要估计的方向,却不会增加残差行空间。加岭、收缩或降维可帮助计算,但使用这些修改后必须重新建立检验的参考分布。
非正态误差下,OLS 的某些均值和协方差性质仍可成立,矩阵正态分布、Wishart 律和拟合—残差独立性却不能一起照搬。
推论与应用
为什么相关响应不改变共同设计下的系数解
固定正定 Σ ,高斯负对数似然中依赖 B 的部分为
1 2 tr { Σ − 1 ( Y − X B ) T ( Y − X B ) } . 令 D = B − B ^ 。正规方程 公理库 最小二乘与正规方程 Least squares · Normal equations 将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。 给出 X T ( Y − X B ^ ) = 0 ,所以交叉项消失:
( Y − X B ) T ( Y − X B ) = E + D T X T X D . 第二项半正定,其与正定 Σ − 1 的迹非负,且满秩设计下只有 D = 0 才取零。因此无论共同响应协方差是什么,系数极大似然解都为 B ^ 。这证明的是共同设计下的系数位置,不是响应之间互不相关。
系数分布与残差 Wishart
系数误差为 B ^ − B = ( X T X ) − 1 X T ε 。用矩阵正态的左乘公式,行协方差因子为
( X T X ) − 1 X T X ( X T X ) − 1 = ( X T X ) − 1 , 列因子仍为 Σ 。因此逐元素有
Cov ( B ^ a j , B ^ b l ) = [ ( X T X ) − 1 ] a b Σ j l . 残差投影 I − P X 的秩为 n − k ,高斯投影的 Wishart 定理 公理库 Wishart 分布 Wishart distribution · Gaussian scatter distribution 独立高斯向量的外积和给出随机散布矩阵,其秩、方向卡方和正交投影结构解释样本协方差的自由度。 给出 E 的分布。又因 X T ( I − P X ) = 0 ,系数误差与残差矩阵交叉协方差为零;二者联合正态,故独立,系数也独立于残差的外积和。
协方差估计的两个分母
Wishart 均值公式给出 E [ E ] = ( n − k ) Σ ,其中 E 是残差散布矩阵,E 才表示取期望。因此无偏估计为 E / ( n − k ) 。
若 E > 0 ,把系数解代回似然,优化 n 2 log det Σ + 1 2 tr ( Σ − 1 E ) 得到 Σ ^ ML = E / n 。无偏分母与似然分母回答不同问题;在后续精确 F 或 Wishart 校准中不能随意混用。
预测均值与新观测
对给定解释变量列向量 x 0 ∈ R k ,预测响应均值为 B ^ T x 0 ,其协方差是
h 0 Σ , h 0 = x 0 T ( X T X ) − 1 x 0 . 一个独立新观测还带有自身误差,所以预测误差协方差为 ( 1 + h 0 ) Σ 。均值置信区域与新观测预测区域因而不同;估计 Σ 后,还要用相应的联合抽样分布作校准。
参考资料
Stanford STATS305C,《Multivariate regression》 ,Model、Estimation of B 、Estimation of Σ 、Distribution results 与 Sums of squares matrices。