Skip to content

方法Method

Gaussian 判别分析

Gaussian discriminant analysis · Linear discriminant analysis · Quadratic discriminant analysis · LDA · QDA

从类别条件正态密度与先验推导 LDA/QDA 分数,明确误分类成本、协方差假设和估计参数后的插件规则。

形式陈述 ​

若不同类别的特征云团各自近似正态,怎样把一个新观测分到某一类?设类别 C∈{1,…,K},先验概率 πk>0、∑kπk=1,并设

X∣C=k∼Np(μk,Σk),Σk>0.

这里的多元正态是类别条件分布,混合后的总体一般不是单个正态。由Bayes 公式,在误分一次损失一、正确分类损失零的规则下,选择后验概率最大的类别,等价于最大化

δkQDA(x)=−12log⁡det⁡Σk−12(x−μk)TΣk−1(x−μk)+log⁡πk.

这称为二次判别分析 QDA。若所有类别共享同一个协方差矩阵 Σ,与类别无关的二次项抵消,得到线性判别分析 LDA:

δkLDA(x)=xTΣ−1μk−12μkTΣ−1μk+log⁡πk.

取分数最大的类别,等分时预先规定处理规则。已知真实参数时,这是相应模型与损失下的 Bayes 规则;用训练数据估计参数后,得到的是插件分类器。

直觉

分数由三部分组成:离该类中心的标准化距离、该类云团的总体体积,以及该类在目标总体中有多常见。

仅挑欧氏距离最近的中心,忽略了哪些方向本来波动大。仅挑 Mahalanobis 距离最小的类,也会漏掉不同云团体积和先验的影响。一个很宽的类虽然能容纳远处观测,但在每个局部位置的密度会因分散而降低,这正由行列式项补偿。

共享协方差时,各类采用相同的度量,二次弯曲部分在两类比较中相消;协方差不同则相消不掉,边界一般弯曲。

例子与边界

相关坐标使线性边界倾斜 ​

考虑两类 + 与 −,均值为 μ+=(1,0)T、μ−=(−1,0)T,共享

Σ=(11/21/21),Σ−1=(4/3−2/3−2/34/3).

若先验各一半,两个常数均值二次项相同,分数差为

δ+(x)−δ−(x)=83x1−43x2.

因此选择 + 的条件是 2x1−x2>0。即使均值只在第一坐标不同,第二坐标仍会帮助判断共同噪声方向,边界不是简单的 x1=0。

若 π+=0.2,π−=0.8,条件变为

2x1−x2>34log⁡4≈1.03972.

较少见的正类需要更强的密度证据,先验改变阈值而不是均值本身。

只改变一个类的尺度,就出现二次边界 ​

保持均值和等先验不变,令 Σ−=Σ、Σ+=2Σ。展开 QDA 分数差,得到

δ+(x)−δ−(x)=x12−x1x2+x223+2x1−x2+13−log⁡2.

原点处分数差为 1/3−log⁡2<0,所以归到负类;足够远的尾部则可能归到更宽的正类。边界的形状变化来自不同协方差,而非仅仅把直线截距移动。

训练先验、目标先验与可逆性 ​

若训练样本按人为比例抽取两类,训练频数比例未必是未来目标总体的先验。是否采用 nk/N,必须由采样机制决定,而不是默认所有训练表都具有代表性。

每类中心化散布的秩至多为 nk−1,所以普通 QDA 至少需要每类 nk>p 才可能得到可逆样本协方差;实际还可能病态。LDA 合并组内散布的自由度为 N−K。使用收缩、降维或正则化后得到新插件规则,其表现需要单独验证。

推论与应用

从密度推到分数 ​

由 Bayes 公式,后验为

P(C=k∣X=x)=πkfk(x)∑jπjfj(x).

分母对所有类别相同。取对数后,正态密度中的 −plog⁡(2π)/2 也共同相同,删去它便得到 QDA 分数。共享协方差时展开

(x−μk)TΣ−1(x−μk)=xTΣ−1x−2xTΣ−1μk+μkTΣ−1μk,

其中第一项不依赖类别,再删去共同的对数行列式,即得 LDA。已知模型下,归一化 eδk(x) 还能恢复后验概率;只做最大值比较时则无需归一化。

不同误分类成本怎样改变规则 ​

Bayes 风险最小化要求选择条件期望损失最小的行动,而不总是选择概率最大的类。二分类中,用 c10>0 表示“预测为一、真实为零”的成本,c01>0 表示“预测为零、真实为一”的成本,正确分类成本为零。预测一的条件风险为 c10P(C=0∣x),预测零的为 c01P(C=1∣x)。

因此应在

δ1(x)−δ0(x)>log⁡c10c01

时预测一。若误报更贵,右边增大,预测一就更谨慎。前面的等先验 LDA 例子若误报成本为三、漏报成本为一,则边界变成 2x1−x2>(3/4)log⁡3。

多分类的一般损失矩阵需要比较 ∑kL(a,k)P(C=k∣x);不能假定任意成本都只是在每个类别分数后加一个固定常数。

参数估计和最终性能不是同一件事 ​

假设每类都有 nk>0 个训练观测,且给定类别后观测独立并服从所设模型。固定正定协方差矩阵时,每类均值的似然极大点为该类样本均值。当该类中心化散布正定时,QDA 在正定协方差参数空间中的极大似然估计为

Σ^kML=1nk∑i:Ci=k(Xi−X¯k)(Xi−X¯k)T.

LDA 在合并组内散布正定时,也将该散布除以 N 得到共同协方差的极大似然估计。若相应散布奇异,沿其零方向把方差压向零会使似然无界,此时不存在正定协方差 MLE;不能把公式算出的奇异矩阵仍称为该参数空间内的解。实践中也常使用除以 N−K 的无偏合并估计;应说明约定,尤其先验或成本不相等时,尺度变化会影响阈值和后验数值。

真实参数下的 Bayes 最优性不会自动传给有限训练样本估计出的规则。模型误设、协方差估计误差和选择步骤都会影响新样本风险,应在独立验证数据或适当的验证设计下评价,而不能用训练集正确率替代泛化表现。

参考资料
关系图谱12 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系