形式陈述
相对于共同支配测度 μ ,统计模型若可写为
p η ( x ) = h ( x ) exp { ⟨ η , T ( x ) ⟩ − A ( η ) } , 则称为指数族。T ( x ) ∈ R k 是自然统计量,η ∈ N 是自然参数,h 是基准密度。对数配分函数
A ( η ) = log ∫ h ( x ) e ⟨ η , T ( x ) ⟩ d μ ( x ) 使密度积分为一;自然参数空间为该积分有限的所有 η 。若模型采用参数 θ ,自然参数可为映射 η ( θ ) ,不必等于原坐标。
对独立样本,联合密度为
∏ i = 1 n p η ( x i ) = ( ∏ i h ( x i ) ) exp { ⟨ η , ∑ i T ( x i ) ⟩ − n A ( η ) } , 所以 ∑ i T ( X i ) 由因子分解判据充分。这个固定维压缩来自模型的指数结构,而非大样本近似。
若 η 位于自然参数空间内部,并可把微分移入积分,则
∇ A ( η ) = E η [ T ( X ) ] , ∇ 2 A ( η ) = Cov η ( T ( X ) ) ⪰ 0. 因此 A 凸;Hessian 正定与自然统计量不存在仿射冗余有关。
直觉
指数族把数据压缩成 T ( x ) ,把参数压缩成对该统计量的线性权重。A ( η ) 是为每个权重重新归一化所需的代价,同时编码统计量的全部累积量。
梯度映射把自然参数送到均值参数,Hessian 则记录该映射的局部敏感度和统计波动。这使似然优化、最大熵与凸共轭 公理库 凸共轭与 Fenchel–Young 不等式 Convex conjugate · Fenchel conjugate · Fenchel–Young inequality 以线性函数的最佳配对代价定义共轭,并导出原变量与对偶变量间的基本不等式。 在同一几何中相遇。
例子与计算
Bernoulli( p ) 质量函数可写为
p x ( 1 − p ) 1 − x = exp { x η − A ( η ) } , 其中
η = log p 1 − p , A ( η ) = log ( 1 + e η ) , T ( x ) = x . 于是
A ′ ( η ) = e η 1 + e η = p , A ″ ( η ) = p ( 1 − p ) , 分别等于 Bernoulli 变量的均值和方差。n 个样本的自然充分统计量是成功次数。
已知方差的正态位置族也属于指数族:T ( x ) = x 、η = μ / σ 2 。若均值和方差都未知,自然统计量扩为 ( x , x 2 ) ,自然参数空间受第二坐标为负的约束。
Poisson( λ ) 的自然参数是 η = log λ ,T ( x ) = x ,A ( η ) = e η 。于是 A ′ ( η ) = e η = λ 、A ″ ( η ) = λ ,同时恢复均值与方差。这个例子说明同一数值参数在原坐标和自然坐标中有不同曲率,不能把 A ″ 直接当作任意坐标下的方差公式。
边界与失败情形
自然参数空间必须由积分有限性决定。只写形式 e η T ( x ) 而不检查 A ( η ) < ∞ ,可能得到无法归一化的“密度”。在边界处微分与积分交换也可能失败。
full 指自然参数空间含 R k 中开集且参数自由变化;curved 指 η ( θ ) 只落在低维曲面。curved 指数族仍有指数表达,却可能失去完备性和标准信息几何结论。
minimal 表示自然统计量没有非零向量 a 使 ⟨ a , T ( X ) ⟩ 在基准测度下几乎处处为常数。它不是“统计量坐标数最少”的朴素说法;冗余表示会让 A 的 Hessian 奇异。
混合分布、截断支持随参数变化的族通常不能直接塞进固定 h 的正则指数形式。指数族标签也不自动保证 MLE 存在;观测充分统计量落在均值参数空间边界时,极大点可能逃向无穷。
推论与应用
对数似然为 ⟨ η , T ( x ) ⟩ − A ( η ) 加常数,得分方程把模型均值 ∇ A ( η ) 与观测统计量匹配。共轭先验则在 η 与 A ( η ) 上保留同一代数形式。
A 的 Legendre 共轭描述给定均值参数时的最大熵与大偏差率函数,但需要严格凸性和参数空间正则条件,不能只凭符号互换。
参考资料
Lawrence D. Brown, Fundamentals of Statistical Exponential Families , IMS, 1986,Ch. 1–2。
Ole E. Barndorff-Nielsen, Information and Exponential Families , Wiley, 1978,Ch. 2–4。
Martin J. Wainwright and Michael I. Jordan, “Graphical Models, Exponential Families, and Variational Inference,” Foundations and Trends in Machine Learning 1(1–2), 2008。