双响应实验的联合推断与 Gaussian 判别
返回“多变量正态几何与联合推断”学习路线
下面是一份合成实验。每个实验单位测量两个响应,两组各有四个独立单位。推断部分假定各组为二元正态,均值可以不同,共享未知正定协方差。分类部分再明确指定目标先验与误分类成本;不要把检验的显著性水平当成分类损失。
任务一:从数据矩阵开始
两组观测为
Y 0 = ( 1 1 − 1 − 1 1 0 − 1 0 ) , Y 1 = ( 4 2 2 0 4 1 2 1 ) .
将它们合并为八行响应矩阵,以截距和组指标为设计,写出多响应回归模型、向量化协方差与系数估计。
算出组内散布 E 、无偏协方差估计与协方差极大似然估计,注明自由度。
若另加第三响应“前两列之和”,是否能直接用普通三维正态密度和三维 Hotelling 公式?
解答一:行独立,列不必独立
令 G i 在前四行取零、后四行取一,设计矩阵 X 第 i 行为 ( 1 , G i ) 。多响应回归模型 公理库 多响应线性回归模型 Multivariate linear regression · Multivariate linear model 同一设计矩阵同时拟合多个相关响应,系数仍逐列等于 OLS,但联合系数误差与残差散布具有矩阵正态和 Wishart 结构。 为
Y = X B + ε , B = ( μ 0 T ( μ 1 − μ 0 ) T ) , ε ∼ MN 8 , 2 ( 0 , I 8 , Σ ) . 依照列优先向量化 公理库 矩阵正态分布 Matrix normal distribution · Matrix-variate normal distribution 在列优先向量化约定下,以可分离的行列协方差描述联合正态矩阵,并明确密度、线性变换与参数尺度不识别。 ,Cov ( vec ε ) = Σ ⊗ I 8 ,不是把两个因子随意倒置。每行的两列可以相关,不同行却独立。
两组样本均值为 ( 0 , 0 ) T 与 ( 3 , 1 ) T 。进一步有
X T X = ( 8 4 4 4 ) , ( X T X ) − 1 = ( 1 / 4 − 1 / 4 − 1 / 4 1 / 2 ) , X T Y = ( 12 4 12 4 ) , B ^ = ( 0 0 3 1 ) . 所以第二行系数恰是样本均值差 d = ( 3 , 1 ) T 。它的真实协方差为 Σ / 2 ;截距与均值差的交叉协方差块为 − Σ / 4 ,不能把两行系数误认为独立。
解答二:散布与两个分母
两组减去各自样本均值后,残差都等于 Y 0 。单组散布为
Y 0 T Y 0 = ( 4 2 2 2 ) , 因此
E = ( 8 4 4 4 ) . 设计秩为二,残差自由度为 8 − 2 = 6 。Wishart 投影定理 公理库 Wishart 分布 Wishart distribution · Gaussian scatter distribution 独立高斯向量的外积和给出随机散布矩阵,其秩、方向卡方和正交投影结构解释样本协方差的自由度。 给出
E ∼ W 2 ( 6 , Σ ) , E ⊥ B ^ . 无偏合并估计与极大似然估计分别为
S p = E 6 = ( 4 / 3 2 / 3 2 / 3 2 / 3 ) , Σ ^ ML = E 8 = ( 1 1 / 2 1 / 2 1 / 2 ) . 下面的精确 F 检验使用无偏 S p ;分类插件也事先约定使用它。不同分母不是四舍五入误差,而是不同估计规则。
解答三:新增一列不等于新增随机方向
若第三响应为前两列之和,每一行的三维向量可写成
( X 1 X 2 X 1 + X 2 ) = ( 1 0 0 1 1 1 ) ( X 1 X 2 ) . 它仍联合正态 公理库 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 ,但协方差秩只有二,支撑为平面 x 3 = x 1 + x 2 。普通三维 Lebesgue 密度不存在,样本协方差也奇异。不能套三维普通逆矩阵公式;保留前两列或选任意两个独立支撑坐标即可保留全部信息。
任务二:联合均值差是否为零
检验两组均值向量相同,计算 Hotelling T 2 、精确 F 统计量与 p 值。
计算 MANOVA 的 H , E + H , Λ ,核对它与 T 2 的关系。
给均值差向量写出精确 95 % 置信椭球,并投影到两个坐标轴。解释投影区间包含零与联合检验拒绝之间是否矛盾。
解答四:一个联合 F 检验
合并协方差的逆为
S p − 1 = ( 3 / 2 − 3 / 2 − 3 / 2 3 ) , S p − 1 d = ( 3 , − 3 / 2 ) T . 两组有效均值差样本因子为 n 0 n 1 / ( n 0 + n 1 ) = 2 。由两样本 Hotelling 校准 公理库 Hotelling T² 检验 Hotelling T-squared test · Hotelling T2 statistic 用样本协方差逆度量均值向量偏离,并在独立正态样本下通过精确 F 分布统一校准全部方向。 ,
T 2 = 2 d T S p − 1 d = 15 , F = 8 − 2 − 1 2 ( 8 − 2 ) T 2 = 25 4 = 6.25 . 原假设下 F ∼ F 2 , 5 。其上尾为
p = ( 5 5 + 2 ( 6.25 ) ) 5 / 2 = ( 2 7 ) 5 / 2 ≈ 0.0436345 . 在预先规定的 5 % 水平下拒绝共同均值。结论依赖独立正态和共同协方差假设;它不是由某一个响应的边缘检验替代而来。
解答五:同一证据的行列式写法
两组 MANOVA 组间散布 公理库 MANOVA 与 Wilks Λ Multivariate analysis of variance · MANOVA · Wilks lambda 以组内和组间散布矩阵比较多个响应的均值向量,Wilks Λ 是行列式比值,其精确校准来自独立 Wishart 矩阵。 为
H = 2 d d T = ( 18 6 6 2 ) , E + H = ( 26 10 10 6 ) . 所以 det E = 16 、det ( E + H ) = 56 ,Λ = 2 / 7 。这与
Λ = 1 1 + T 2 / ( N − 2 ) = 1 1 + 15 / 6 = 2 7 完全一致。H 是秩一矩阵,因为两组只有一个组间对比方向;这不妨碍 E + H 正定,也不意味着只能分析一个响应。
解答六:置信椭球不是两个区间的笛卡尔积
记总体均值差为 Δ = μ 1 − μ 0 ,令
c = 2 ⋅ 6 5 F 2 , 5 ; 0.95 ≈ 13.886724 . 精确 95 % 置信椭球为
C = { Δ : 2 ( d − Δ ) T S p − 1 ( d − Δ ) ≤ c } . Δ = 0 时左边为十五,超过 c ,故零向量不在椭球内,与拒绝结果一致。
投影到第 j 个坐标,半宽为 c ( S p ) j j / 2 ,因此两个投影区间分别为
3 ± 3.042666 , 1 ± 2.151490 . 两者都包含零,却不矛盾:每个投影区间允许另一坐标同时移动到合适的位置。它们的笛卡尔积是一只外接矩形,大于原来倾斜的椭球;“各坐标分别可为零”不等于“它们可以同时都为零”。
任务三:相关、条件关系与可匹配方向
以下是另一个已知的总体校准模型,避免把估计值误称为真实参数。
三个变量 A , B , Z 联合正态、均值零,相关矩阵为
R = ( 1 0.6 0.5 0.6 1 0.4 0.5 0.4 1 ) . 求 A , B 给定 Z 的条件均值、残差协方差及偏相关;判断条件独立。
2. 另有一份 n = 30 的独立二元正态样本,观察相关 r = 0.6 。构造常用 Fisher 近似区间,并说明为什么不能把上一个总体模型中的已知 0.6 当成需要估计的同一个量。
3. 两组已经白化的二维变量,其交叉协方差为
K = ( 0.6 0.2 0.2 0.6 ) . 求两对典型相关与系数方向,并检查这个联合协方差是否可能存在。
解答七:Gaussian 条件残差仍保留相关
det R = 0.47 > 0 ,且顺序主子式为正,所以 R 正定。由 Gaussian 条件公式,
E [ ( A , B ) T ∣ Z = z ] = ( 0.5 z , 0.4 z ) T , 残差协方差为
( 1 0.6 0.6 1 ) − ( 0.5 0.4 ) ( 0.5 , 0.4 ) = ( 0.75 0.4 0.4 0.84 ) . 因此 偏相关 公理库 偏相关与精度矩阵 Partial correlation · Precision-matrix partial correlation 以去除控制变量线性投影后的残差相关定义偏相关;只有在相应联合 Gaussian 条件下,零偏相关才等价于条件独立。 为
ρ A B ⋅ Z = 0.4 0.75 ⋅ 0.84 = 0.4 0.63 ≈ 0.503953 . 它比边缘相关 0.6 小,但不是零。联合 Gaussian 条件下,这也表示给定 Z 后 A , B 仍不独立。若模型不是联合 Gaussian,单靠这个二阶矩计算不能得到条件独立结论。
解答八:样本相关的近似不确定性
第二小问的 r = 0.6 是另一份数据算出的统计量。Fisher 变换 公理库 相关系数的 Fisher z 变换 Fisher z transformation · Fisher correlation transform 用反双曲正切稳定二元正态样本相关的一阶方差,再在变换尺度推断并返回相关尺度,明确 n−3 只是有限样本近似修正。 给出 z ( r ) = log 2 ,常用 n − 3 修正的近似 95 % 区间为
tanh ( log 2 ± 1.959964 27 ) = [ 0.305842 , 0.789590 ] . 这里两个端点分别取 tanh 。一阶定理是一般 n → ∞ 时的根号样本量极限;n = 30 只是代入近似公式,不是一个带 o P ( 30 − 1 / 2 ) 的“固定样本量极限”。
上一小问把总体矩阵 R 当作已知参数进行条件分布计算,没有抽样区间问题;本小问则把未知总体相关和观测到的样本相关分开。相同的数值 0.6 不会让两种逻辑自动合并。
解答九:两组方向的匹配
CCA 公理库 典型相关分析 Canonical correlation analysis · CCA 在两组变量中各选单位方差线性组合,使跨组相关最大;白化后问题化为交叉协方差的奇异值分解。 对白化后的 K 作 SVD。这里 K 对称正定,两个正交方向为
u 1 = v 1 = 1 2 ( 1 , 1 ) T , u 2 = v 2 = 1 2 ( 1 , − 1 ) T , 对应典型相关 0.8 与 0.4 。整个四维协方差为 ( I K K I ) ,特征值为 1 ± 0.8 、1 ± 0.4 ,全部为正,因此是合法的非退化联合模型。
两个组各自协方差都是单位矩阵,单独 PCA 无法偏爱任何方向;跨组相关却明确挑出了和与差方向。若只用四行样本估计两个二维组,样本中心化空间只有三维,两个二维列空间必相交,第一样本典型相关会被强迫为一。这个有限样本几何现象不能推翻总体 0.8 的设定。
任务四:把模型用于带成本的判别
回到第一份两组数据,约定类别零、一的插件均值为 μ ^ 0 = ( 0 , 0 ) T 、μ ^ 1 = d = ( 3 , 1 ) T ,共同插件协方差使用无偏 S p 。目标总体先验为 π 1 = 1 / 4 , π 0 = 3 / 4 ,误报一的成本为四,漏报一的成本为一,正确分类成本零。
写出完整 LDA 分数差和成本阈值,给新点 x = ( 2.5 , 1 ) T 分类。
若把第一类协方差改成 2 S p 、零类仍为 S p ,写出 QDA 分数差并重新判断。
这份由八个观测拟合的分类器是否已经享有已知真实模型下的 Bayes 最优性?
解答十:先验和成本是两次不同的调整
记 A = S p − 1 ,则 A d = ( 3 , − 3 / 2 ) T 、d T A d = 15 / 2 。LDA 分数差 公理库 Gaussian 判别分析 Gaussian discriminant analysis · Linear discriminant analysis · Quadratic discriminant analysis · LDA · QDA 从类别条件正态密度与先验推导 LDA/QDA 分数,明确误分类成本、协方差假设和估计参数后的插件规则。 为
δ 1 ( x ) − δ 0 ( x ) = x T A d − 1 2 d T A d + log π 1 π 0 = 3 x 1 − 3 2 x 2 − 15 4 − log 3. 正确的成本阈值是 log 4 ,而不是零。等价地,只有
3 x 1 − 3 2 x 2 > 15 4 + log 12 才预测一。对 x = ( 2.5 , 1 ) ,分数差约为 1.151388 ,小于 log 4 ≈ 1.386294 ,所以预测零。
若忽略成本,只比较零阈值,则会预测一。模型内插件后验为 1 / ( 1 + e − 1.151388 ) ≈ 0.759764 ;误报成本为四要求后验超过 4 / 5 = 0.8 ,从而得到同一个决策。
解答十一:QDA 保留体积惩罚
第一类协方差放大两倍,在二维中行列式放大四倍,因此分数差为
δ 1 Q ( x ) − δ 0 Q ( x ) = − log 2 − 1 4 ( x − d ) T A ( x − d ) + 1 2 x T A x − log 3. 其中 − log 2 来自体积,不可遗漏。展开为
1 4 x T A x + 1 2 x T A d − 1 4 d T A d − log 6. 对同一个新点,它约为 0.551991 ,仍小于 log 4 ,故仍预测零。虽然这一个点的决策未变,整个边界已从直线变成二次曲线,其他位置可以改变类别。
这些规则使用估计均值和估计协方差。已知真实分布与损失下的 Bayes 最优性不能直接赋给有限训练样本的插件规则;应检查模型假设并用独立验证或适当验证设计评价目标风险。八个训练单位尤其不足以把训练表现当成未来性能保证。
验收标准
最终报告应能复算 E , S p , T 2 = 15 , Λ = 2 / 7 和精确 p ≈ 0.0436345 ,解释六个残差自由度与奇异三响应支撑;应区分置信椭球与其外接矩形、总体偏相关与样本相关区间、总体典型相关与高维样本单位相关。分类部分必须同时包含先验、成本与协方差行列式项,并把插件规则和已知模型最优规则分开。