Skip to content

统计指数族

Exponential family · Natural exponential family

密度的参数依赖通过自然参数与统计量内积进入,并由对数配分函数归一化的分布族。

形式陈述

相对于共同支配测度 μ,统计模型若可写为

pη(x)=h(x)exp{η,T(x)A(η)},

则称为指数族。T(x)Rk 是自然统计量,ηN 是自然参数,h 是基准密度。对数配分函数

A(η)=logh(x)eη,T(x)dμ(x)

使密度积分为一;自然参数空间为该积分有限的所有 η。若模型采用参数 θ,自然参数可为映射 η(θ),不必等于原坐标。

对独立样本,联合密度为

i=1npη(xi)=(ih(xi))exp{η,iT(xi)nA(η)},

所以 iT(Xi) 由因子分解判据充分。这个固定维压缩来自模型的指数结构,而非大样本近似。

η 位于自然参数空间内部,并可把微分移入积分,则

A(η)=Eη[T(X)],2A(η)=Covη(T(X))0.

因此 A 凸;Hessian 正定与自然统计量不存在仿射冗余有关。

直觉

指数族把数据压缩成 T(x),把参数压缩成对该统计量的线性权重。A(η) 是为每个权重重新归一化所需的代价,同时编码统计量的全部累积量。

梯度映射把自然参数送到均值参数,Hessian 则记录该映射的局部敏感度和统计波动。这使似然优化、最大熵与凸共轭在同一几何中相遇。

例子与计算

Bernoulli(p) 质量函数可写为

px(1p)1x=exp{xηA(η)},

其中

η=logp1p,A(η)=log(1+eη),T(x)=x.

于是

A(η)=eη1+eη=p,A(η)=p(1p),

分别等于 Bernoulli 变量的均值和方差。n 个样本的自然充分统计量是成功次数。

已知方差的正态位置族也属于指数族:T(x)=xη=μ/σ2。若均值和方差都未知,自然统计量扩为 (x,x2),自然参数空间受第二坐标为负的约束。

Poisson(λ) 的自然参数是 η=logλT(x)=xA(η)=eη。于是 A(η)=eη=λA(η)=λ,同时恢复均值与方差。这个例子说明同一数值参数在原坐标和自然坐标中有不同曲率,不能把 A 直接当作任意坐标下的方差公式。

边界与失败情形

自然参数空间必须由积分有限性决定。只写形式 eηT(x) 而不检查 A(η)<,可能得到无法归一化的“密度”。在边界处微分与积分交换也可能失败。

full 指自然参数空间含 Rk 中开集且参数自由变化;curved 指 η(θ) 只落在低维曲面。curved 指数族仍有指数表达,却可能失去完备性和标准信息几何结论。

minimal 表示自然统计量没有非零向量 a 使 a,T(X) 在基准测度下几乎处处为常数。它不是“统计量坐标数最少”的朴素说法;冗余表示会让 A 的 Hessian 奇异。

混合分布、截断支持随参数变化的族通常不能直接塞进固定 h 的正则指数形式。指数族标签也不自动保证 MLE 存在;观测充分统计量落在均值参数空间边界时,极大点可能逃向无穷。

推论与应用

对数似然为 η,T(x)A(η) 加常数,得分方程把模型均值 A(η) 与观测统计量匹配。共轭先验则在 ηA(η) 上保留同一代数形式。

A 的 Legendre 共轭描述给定均值参数时的最大熵与大偏差率函数,但需要严格凸性和参数空间正则条件,不能只凭符号互换。

参考资料
  • Lawrence D. Brown, Fundamentals of Statistical Exponential Families, IMS, 1986,Ch. 1–2。
  • Ole E. Barndorff-Nielsen, Information and Exponential Families, Wiley, 1978,Ch. 2–4。
  • Martin J. Wainwright and Michael I. Jordan, “Graphical Models, Exponential Families, and Variational Inference,” Foundations and Trends in Machine Learning 1(1–2), 2008。