Skip to content

双响应实验的联合推断与 Gaussian 判别 ​

返回“多变量正态几何与联合推断”学习路线

下面是一份合成实验。每个实验单位测量两个响应,两组各有四个独立单位。推断部分假定各组为二元正态,均值可以不同,共享未知正定协方差。分类部分再明确指定目标先验与误分类成本;不要把检验的显著性水平当成分类损失。

任务一:从数据矩阵开始 ​

两组观测为

Y0=(11−1−110−10),Y1=(42204121).
  1. 将它们合并为八行响应矩阵,以截距和组指标为设计,写出多响应回归模型、向量化协方差与系数估计。
  2. 算出组内散布 E、无偏协方差估计与协方差极大似然估计,注明自由度。
  3. 若另加第三响应“前两列之和”,是否能直接用普通三维正态密度和三维 Hotelling 公式?

解答一:行独立,列不必独立 ​

令 Gi 在前四行取零、后四行取一,设计矩阵 X 第 i 行为 (1,Gi)。多响应回归模型为

Y=XB+ε,B=(μ0T(μ1−μ0)T),ε∼MN8,2(0,I8,Σ).

依照列优先向量化,Cov(vecε)=Σ⊗I8,不是把两个因子随意倒置。每行的两列可以相关,不同行却独立。

两组样本均值为 (0,0)T 与 (3,1)T。进一步有

XTX=(8444),(XTX)−1=(1/4−1/4−1/41/2),XTY=(124124),B^=(0031).

所以第二行系数恰是样本均值差 d=(3,1)T。它的真实协方差为 Σ/2;截距与均值差的交叉协方差块为 −Σ/4,不能把两行系数误认为独立。

解答二:散布与两个分母 ​

两组减去各自样本均值后,残差都等于 Y0。单组散布为

Y0TY0=(4222),

因此

E=(8444).

设计秩为二,残差自由度为 8−2=6。Wishart 投影定理给出

E∼W2(6,Σ),E⊥B^.

无偏合并估计与极大似然估计分别为

Sp=E6=(4/32/32/32/3),Σ^ML=E8=(11/21/21/2).

下面的精确 F 检验使用无偏 Sp;分类插件也事先约定使用它。不同分母不是四舍五入误差,而是不同估计规则。

解答三:新增一列不等于新增随机方向 ​

若第三响应为前两列之和,每一行的三维向量可写成

(X1X2X1+X2)=(100111)(X1X2).

它仍联合正态,但协方差秩只有二,支撑为平面 x3=x1+x2。普通三维 Lebesgue 密度不存在,样本协方差也奇异。不能套三维普通逆矩阵公式;保留前两列或选任意两个独立支撑坐标即可保留全部信息。

任务二:联合均值差是否为零 ​

  1. 检验两组均值向量相同,计算 Hotelling T2、精确 F 统计量与 p 值。
  2. 计算 MANOVA 的 H,E+H,Λ,核对它与 T2 的关系。
  3. 给均值差向量写出精确 95% 置信椭球,并投影到两个坐标轴。解释投影区间包含零与联合检验拒绝之间是否矛盾。

解答四:一个联合 F 检验 ​

合并协方差的逆为

Sp−1=(3/2−3/2−3/23),Sp−1d=(3,−3/2)T.

两组有效均值差样本因子为 n0n1/(n0+n1)=2。由两样本 Hotelling 校准,

T2=2dTSp−1d=15,F=8−2−12(8−2)T2=254=6.25.

原假设下 F∼F2,5。其上尾为

p=(55+2(6.25))5/2=(27)5/2≈0.0436345.

在预先规定的 5% 水平下拒绝共同均值。结论依赖独立正态和共同协方差假设;它不是由某一个响应的边缘检验替代而来。

解答五:同一证据的行列式写法 ​

两组 MANOVA 组间散布为

H=2ddT=(18662),E+H=(2610106).

所以 det⁡E=16、det⁡(E+H)=56,Λ=2/7。这与

Λ=11+T2/(N−2)=11+15/6=27

完全一致。H 是秩一矩阵,因为两组只有一个组间对比方向;这不妨碍 E+H 正定,也不意味着只能分析一个响应。

解答六:置信椭球不是两个区间的笛卡尔积 ​

记总体均值差为 Δ=μ1−μ0,令

c=2⋅65F2,5;0.95≈13.886724.

精确 95% 置信椭球为

C={Δ:2(d−Δ)TSp−1(d−Δ)≤c}.

Δ=0 时左边为十五,超过 c,故零向量不在椭球内,与拒绝结果一致。

投影到第 j 个坐标,半宽为 c(Sp)jj/2,因此两个投影区间分别为

3±3.042666,1±2.151490.

两者都包含零,却不矛盾:每个投影区间允许另一坐标同时移动到合适的位置。它们的笛卡尔积是一只外接矩形,大于原来倾斜的椭球;“各坐标分别可为零”不等于“它们可以同时都为零”。

任务三:相关、条件关系与可匹配方向 ​

以下是另一个已知的总体校准模型,避免把估计值误称为真实参数。

  1. 三个变量 A,B,Z 联合正态、均值零,相关矩阵为
R=(10.60.50.610.40.50.41).

求 A,B 给定 Z 的条件均值、残差协方差及偏相关;判断条件独立。 2. 另有一份 n=30 的独立二元正态样本,观察相关 r=0.6。构造常用 Fisher 近似区间,并说明为什么不能把上一个总体模型中的已知 0.6 当成需要估计的同一个量。 3. 两组已经白化的二维变量,其交叉协方差为

K=(0.60.20.20.6).

求两对典型相关与系数方向,并检查这个联合协方差是否可能存在。

解答七:Gaussian 条件残差仍保留相关 ​

det⁡R=0.47>0,且顺序主子式为正,所以 R 正定。由 Gaussian 条件公式,

E[(A,B)T∣Z=z]=(0.5z,0.4z)T,

残差协方差为

(10.60.61)−(0.50.4)(0.5,0.4)=(0.750.40.40.84).

因此 偏相关为

ρAB⋅Z=0.40.75⋅0.84=0.40.63≈0.503953.

它比边缘相关 0.6 小,但不是零。联合 Gaussian 条件下,这也表示给定 Z 后 A,B 仍不独立。若模型不是联合 Gaussian,单靠这个二阶矩计算不能得到条件独立结论。

解答八:样本相关的近似不确定性 ​

第二小问的 r=0.6 是另一份数据算出的统计量。Fisher 变换给出 z(r)=log⁡2,常用 n−3 修正的近似 95% 区间为

tanh⁡(log⁡2±1.95996427)=[0.305842,0.789590].

这里两个端点分别取 tanh。一阶定理是一般 n→∞ 时的根号样本量极限;n=30 只是代入近似公式,不是一个带 oP(30−1/2) 的“固定样本量极限”。

上一小问把总体矩阵 R 当作已知参数进行条件分布计算,没有抽样区间问题;本小问则把未知总体相关和观测到的样本相关分开。相同的数值 0.6 不会让两种逻辑自动合并。

解答九:两组方向的匹配 ​

CCA对白化后的 K 作 SVD。这里 K 对称正定,两个正交方向为

u1=v1=12(1,1)T,u2=v2=12(1,−1)T,

对应典型相关 0.8 与 0.4。整个四维协方差为 (IKKI),特征值为 1±0.8、1±0.4,全部为正,因此是合法的非退化联合模型。

两个组各自协方差都是单位矩阵,单独 PCA 无法偏爱任何方向;跨组相关却明确挑出了和与差方向。若只用四行样本估计两个二维组,样本中心化空间只有三维,两个二维列空间必相交,第一样本典型相关会被强迫为一。这个有限样本几何现象不能推翻总体 0.8 的设定。

任务四:把模型用于带成本的判别 ​

回到第一份两组数据,约定类别零、一的插件均值为 μ^0=(0,0)T、μ^1=d=(3,1)T,共同插件协方差使用无偏 Sp。目标总体先验为 π1=1/4,π0=3/4,误报一的成本为四,漏报一的成本为一,正确分类成本零。

  1. 写出完整 LDA 分数差和成本阈值,给新点 x=(2.5,1)T 分类。
  2. 若把第一类协方差改成 2Sp、零类仍为 Sp,写出 QDA 分数差并重新判断。
  3. 这份由八个观测拟合的分类器是否已经享有已知真实模型下的 Bayes 最优性?

解答十:先验和成本是两次不同的调整 ​

记 A=Sp−1,则 Ad=(3,−3/2)T、dTAd=15/2。LDA 分数差为

δ1(x)−δ0(x)=xTAd−12dTAd+log⁡π1π0=3x1−32x2−154−log⁡3.

正确的成本阈值是 log⁡4,而不是零。等价地,只有

3x1−32x2>154+log⁡12

才预测一。对 x=(2.5,1),分数差约为 1.151388,小于 log⁡4≈1.386294,所以预测零。

若忽略成本,只比较零阈值,则会预测一。模型内插件后验为 1/(1+e−1.151388)≈0.759764;误报成本为四要求后验超过 4/5=0.8,从而得到同一个决策。

解答十一:QDA 保留体积惩罚 ​

第一类协方差放大两倍,在二维中行列式放大四倍,因此分数差为

δ1Q(x)−δ0Q(x)=−log⁡2−14(x−d)TA(x−d)+12xTAx−log⁡3.

其中 −log⁡2 来自体积,不可遗漏。展开为

14xTAx+12xTAd−14dTAd−log⁡6.

对同一个新点,它约为 0.551991,仍小于 log⁡4,故仍预测零。虽然这一个点的决策未变,整个边界已从直线变成二次曲线,其他位置可以改变类别。

这些规则使用估计均值和估计协方差。已知真实分布与损失下的 Bayes 最优性不能直接赋给有限训练样本的插件规则;应检查模型假设并用独立验证或适当验证设计评价目标风险。八个训练单位尤其不足以把训练表现当成未来性能保证。

验收标准 ​

最终报告应能复算 E, Sp, T2=15, Λ=2/7 和精确 p≈0.0436345,解释六个残差自由度与奇异三响应支撑;应区分置信椭球与其外接矩形、总体偏相关与样本相关区间、总体典型相关与高维样本单位相关。分类部分必须同时包含先验、成本与协方差行列式项,并把插件规则和已知模型最优规则分开。