“典型相关分析问的是另一个问题:在两组变量中各选线性组合,先用组内协方差白化,再最大化跨组相关。它不以保留单组总方差为目标,高维样本甚至可能因列空间相交而产生必然的单位典型相关。”
形式陈述
两组变量分别描述同一批对象的不同方面,能否找到两组中最相互呼应的线性组合?设中心化随机向量
且两个组内矩阵
约束使
排列。每对可选相对符号使相关非负;同时反转
直觉
若直接最大化协方差,把某个变量的单位从米换成毫米就可能改变答案。单位方差约束先把尺度影响去掉,再问两个组合的起伏有多一致。
每组内部的相关还会导致重复计数。白化先把组内方向变成单位方差且彼此不相关,随后只剩下一个纯粹的跨组匹配问题。奇异值分解找出的第一对方向,是这个匹配最强的一对;后面的对在不重复前面组内信息的条件下继续匹配。
典型系数的正负、大小依赖变量尺度和坐标表示,典型相关却不随组内可逆线性换坐标而改变。解释时应同时看组合的含义,而不只看一个很大的相关数。
例子与边界
非对角协方差也能手工白化
设标准化潜在变量
于是
容易验证,
对应典型相关
高维样本里的“完美相关”可能只是几何必然
用
它们的列空间必有非零交集。因此存在非零样本得分向量同时写成
例如
奇异与不唯一
若组内协方差奇异,标准白化逆不存在,需要先限制到非退化支撑或明确采用正则化版本。若奇异值重复,对应典型方向只能确定到子空间旋转;系数的某一种数值写法不是唯一答案。
总体联合协方差只需半正定,因此允许典型相关为一,对应两个组共享某个几乎必然相同的线性分量。若整个联合协方差正定,则所有典型相关严格小于一。
推论与应用
白化把统计目标变成 SVD
利用正定矩阵的对称平方根,令
约束变成
作奇异值分解,最大值就是第一奇异值,第一对系数为
正交的后续奇异向量给出组内不相关的后续典型变量,并满足
任何两个单位方差变量的相关都不超过一,故
特征值形式与数值含义
消去
这是广义特征值问题,特征值是典型相关的平方。理论上它与白化 SVD 等价;在接近奇异的样本协方差下,显式求逆会放大误差,应使用合适分解并报告正则化假设,而非只输出一个相关值。
CCA 与 PCA 问的问题不同
PCA在一组变量中寻找方差大的方向;CCA 在两个组之间寻找方差归一化后的高相关方向。某方向在两组中都只有很小方差,却可能非常一致,因而被 CCA 选中;这不代表它必然解释很多原始总方差。
实际分析应把拟合样本的典型相关与新样本表现分开。系数一旦用数据选出,再在同一数据上评价,就包含选择带来的乐观偏差。高维情形中的单位相关尤其需要独立验证或有依据的正则化,不能按事先固定的单个相关系数解释。
参考资料
- Korbinian Strimmer,《Multivariate Statistics and Machine Learning》,Chapter 6,§§6.1–6.2,组内白化、交叉相关与 SVD 典型相关。