形式陈述
若不同类别的特征云团各自近似正态,怎样把一个新观测分到某一类?设类别 ,先验概率 、,并设
这里的多元正态公理库多元正态分布Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。是类别条件分布,混合后的总体一般不是单个正态。由Bayes 公式公理库Bayes 定理Bayes' theorem · Bayes' rule用先验与证据在各假设下的可能性反转条件方向,得到归一化后验。,在误分一次损失一、正确分类损失零的规则下,选择后验概率最大的类别,等价于最大化
这称为二次判别分析 QDA。若所有类别共享同一个协方差公理库协方差Covariance两个随机变量中心化乘积的期望,衡量线性共同变化。矩阵 ,与类别无关的二次项抵消,得到线性判别分析 LDA:
取分数最大的类别,等分时预先规定处理规则。已知真实参数时,这是相应模型与损失下的 Bayes 规则;用训练数据估计参数后,得到的是插件分类器。
直觉
分数由三部分组成:离该类中心的标准化距离、该类云团的总体体积,以及该类在目标总体中有多常见。
仅挑欧氏距离最近的中心,忽略了哪些方向本来波动大。仅挑 Mahalanobis 距离最小的类,也会漏掉不同云团体积和先验的影响。一个很宽的类虽然能容纳远处观测,但在每个局部位置的密度会因分散而降低,这正由行列式项补偿。
共享协方差时,各类采用相同的度量,二次弯曲部分在两类比较中相消;协方差不同则相消不掉,边界一般弯曲。
例子与边界
相关坐标使线性边界倾斜
考虑两类 与 ,均值为 、,共享
若先验各一半,两个常数均值二次项相同,分数差为
因此选择 的条件是 。即使均值只在第一坐标不同,第二坐标仍会帮助判断共同噪声方向,边界不是简单的 。
若 ,条件变为
较少见的正类需要更强的密度证据,先验改变阈值而不是均值本身。
只改变一个类的尺度,就出现二次边界
保持均值和等先验不变,令 、。展开 QDA 分数差,得到
原点处分数差为 ,所以归到负类;足够远的尾部则可能归到更宽的正类。边界的形状变化来自不同协方差,而非仅仅把直线截距移动。
训练先验、目标先验与可逆性
若训练样本按人为比例抽取两类,训练频数比例未必是未来目标总体的先验。是否采用 ,必须由采样机制决定,而不是默认所有训练表都具有代表性。
每类中心化散布的秩至多为 ,所以普通 QDA 至少需要每类 才可能得到可逆样本协方差;实际还可能病态。LDA 合并组内散布的自由度为 。使用收缩、降维或正则化后得到新插件规则,其表现需要单独验证。
推论与应用
从密度推到分数
由 Bayes 公式,后验为
分母对所有类别相同。取对数后,正态密度中的 也共同相同,删去它便得到 QDA 分数。共享协方差时展开
其中第一项不依赖类别,再删去共同的对数行列式,即得 LDA。已知模型下,归一化 还能恢复后验概率;只做最大值比较时则无需归一化。
不同误分类成本怎样改变规则
Bayes 风险最小化公理库Bayes 预测器与 Bayes 风险Bayes predictor · Bayes classifier · Bayes risk已知真实联合分布时逐点最小化条件损失所得的最优决策。要求选择条件期望损失最小的行动,而不总是选择概率最大的类。二分类中,用 表示“预测为一、真实为零”的成本, 表示“预测为零、真实为一”的成本,正确分类成本为零。预测一的条件风险为 ,预测零的为 。
因此应在
时预测一。若误报更贵,右边增大,预测一就更谨慎。前面的等先验 LDA 例子若误报成本为三、漏报成本为一,则边界变成 。
多分类的一般损失矩阵需要比较 ;不能假定任意成本都只是在每个类别分数后加一个固定常数。
参数估计和最终性能不是同一件事
假设每类都有 个训练观测,且给定类别后观测独立并服从所设模型。固定正定协方差矩阵时,每类均值的似然极大点公理库最大似然估计Maximum likelihood estimation · MLE在参数空间内选择使已观测数据似然达到上确界的参数估计方法。为该类样本均值。当该类中心化散布正定时,QDA 在正定协方差参数空间中的极大似然估计为
LDA 在合并组内散布正定时,也将该散布除以 得到共同协方差的极大似然估计。若相应散布奇异,沿其零方向把方差压向零会使似然无界,此时不存在正定协方差 MLE;不能把公式算出的奇异矩阵仍称为该参数空间内的解。实践中也常使用除以 的无偏合并估计;应说明约定,尤其先验或成本不相等时,尺度变化会影响阈值和后验数值。
真实参数下的 Bayes 最优性不会自动传给有限训练样本估计出的规则。模型误设、协方差估计误差和选择步骤都会影响新样本风险,应在独立验证数据或适当的验证设计下评价,而不能用训练集正确率替代泛化表现。
参考资料