形式陈述
标量正态平方和产生卡方分布;如果保留多个坐标之间的交叉乘积,会得到什么?设 Z 1 , … , Z ν 独立服从多元正态 公理库 多元正态分布 Multivariate normal distribution · Multivariate Gaussian distribution · Jointly Gaussian vector 以所有线性组合都正态刻画联合高斯向量,并由特征函数连接线性构造、退化支撑、全维密度与条件分布。 N p ( 0 , Σ ) ,其中 ν ≥ 1 为整数、Σ 正定。定义
W = ∑ i = 1 ν Z i Z i T . 称 W 服从自由度 ν 、尺度矩阵 Σ 的 Wishart 分布,记作 W p ( ν , Σ ) 。其律是对称矩阵空间上的一族概率分布 公理库 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 。W 是一个对称半正定随机矩阵,且
几 乎 必 然 rank ( W ) = min ( ν , p ) 几乎必然 , E W = ν Σ . 所以 ν ≥ p 时 W 几乎必然正定,ν < p 时必然奇异。自由度是独立高斯行的数目,不是矩阵元素的数目。
对任意非零固定向量 a ,
a T W a a T Σ a ∼ χ ν 2 . 这里的卡方分布 公理库 卡方分布 Chi-square distribution · Chi-squared distribution · χ² distribution 若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。 只是某一个方向的平方长度;完整 Wishart 矩阵同时记录全部方向,并保留它们之间的依赖。
直觉
每个外积 z z T 都是沿观测向量方向的一块秩一散布。把这些块加起来,得到一张描述各方向能量和交叉关系的矩阵。
一个向量只能贡献至多一个随机方向。若只有两条高斯观测,却要估计五维散布,所得矩阵无论如何都不可能满秩。增加维度并不会创造更多独立信息。
样本协方差先减去了估计的均值,等于消耗一个行方向。因此由 n 个观测形成的中心化散布只有 n − 1 个自由度。这个损失来自投影几何,可以精确证明,不只是无偏估计公式中的惯例。
例子与边界
两个二维向量的外积和
若一次观测到的高斯行向量为 z 1 = ( 1 , 2 ) T 、z 2 = ( 2 , − 1 ) T ,则
W = ( 1 2 2 4 ) + ( 4 − 2 − 2 1 ) = ( 5 0 0 5 ) . 这是某一次散布矩阵实现,不是它的期望。若生成模型为 Σ = I 2 、ν = 2 ,期望为 2 I 2 ,而任意单位方向的 a T W a 都有 χ 2 2 分布。
若只保留一个向量 z = ( z 1 , z 2 ) T ,则 W 12 2 = W 11 W 22 ,行列式恒为零。两个对角元即使都正,也不能说明矩阵可逆。
矩阵条目一般不独立
取 p = 2 , ν = 2 、Σ = ( 2 1 1 2 ) 。下面的矩公式给出
E W = ( 4 2 2 4 ) , Cov ( W 11 , W 22 ) = 4 , Var ( W 12 ) = 10. 即使 Σ = I p ,部分条目协方差可能为零,也不能把整个矩阵的所有条目当成相互独立;对称性和半正定约束已把它们联系起来。
非正态样本不能原样套用
任意有限二阶矩样本的散布都有相应期望,但精确 Wishart 分布依赖高斯性。重尾样本、行间相关、异方差行或非零均值未扣除,都会改变分布。非零均值的高斯外积和属于非中心版本,也不是本页的中心 Wishart。
此外,本文用整数自由度的高斯构造。某些资料通过矩阵密度把非奇异 Wishart 扩展到非整数自由度;那是进一步的参数扩展,不能再字面解释成“若干条独立行”的数目。
推论与应用
方向卡方、秩与矩公式
对固定 a ,a T Z i / a T Σ a 是独立标准正态,平方后求和即得方向卡方结论。把 Z i T 排成数据矩阵 Z ,则 W = Z T Z ,秩等于 Z 的秩。正定 Σ 使每行有全维密度,随机行或列除非落入一个零测度的线性依赖集合,否则会达到允许的最大秩。
高斯四阶矩满足
E [ Z a Z b Z c Z d ] = Σ a b Σ c d + Σ a c Σ b d + Σ a d Σ b c . 可从 E e t T Z = e t T Σ t / 2 对四个坐标求导验证。不同观测行独立,因此
Cov ( W a b , W c d ) = ν ( Σ a c Σ b d + Σ a d Σ b c ) . 这个式子保留随机协方差各条目间的共同波动,不能由各自的单变量方差替代。
正交投影精确决定自由度
令 Z ∼ MN n , p ( 0 , I n , Σ ) ,即矩阵正态 公理库 矩阵正态分布 Matrix normal distribution · Matrix-variate normal distribution 在列优先向量化约定下,以可分离的行列协方差描述联合正态矩阵,并明确密度、线性变换与参数尺度不识别。 的独立行模型。若 P 是对称幂等投影、秩为 r ≥ 1 ,用正交矩阵 公理库 正交矩阵与酉矩阵 Orthogonal matrix · Unitary matrix · 酉矩阵 在实或复内积空间中保持内积的方阵,其逆分别等于转置或共轭转置。 Q 对角化为 Q T P Q = diag ( I r , 0 ) 。
行正交变换 Q T Z 仍由独立 N p ( 0 , Σ ) 行组成,所以
Z T P Z ∼ W p ( r , Σ ) . 若 P 1 P 2 = 0 ,对应的投影高斯行分量独立,故 Z T P 1 Z 与 Z T P 2 Z 独立。零秩投影则产生恒零矩阵。
对独立 X i ∼ N p ( μ , Σ ) ,令
X ¯ = 1 n ∑ i X i , S = 1 n − 1 ∑ i ( X i − X ¯ ) ( X i − X ¯ ) T , n ≥ 2. 中心化矩阵 P = I n − 1 1 T / n 是秩 n − 1 的投影,与均值方向的投影正交。因此
( n − 1 ) S ∼ W p ( n − 1 , Σ ) , X ¯ ∼ N p ( μ , Σ / n ) , X ¯ ⊥ S . 这三个结论共同支撑精确的多变量均值推断;只知道 E S = Σ 还远远不够。
一个紧凑的变换刻画
对半正定矩阵 T ,独立行和高斯积分给出
E exp ( − 1 2 tr ( T W ) ) = det ( I p + Σ 1 / 2 T Σ 1 / 2 ) − ν / 2 . 证明只需先对单行白化,再对 Σ 1 / 2 T Σ 1 / 2 对角化;每个独立标准正态方向贡献 ( 1 + λ j ) − 1 / 2 ,最后乘上 ν 行。这个变换立即说明:同尺度且独立的 Wishart 矩阵相加,自由度相加;对固定 A 作 A W A T ,则尺度变成 A Σ A T ,可能退化。
参考资料
Stanford STATS305C,《Normal Theory》 ,Wishart distribution、Operations with Wisharts、Special case: projections 与中心化样本例子。