“在零膨胀Poisson模型中,E步只给零记录分配潜在来源责任度,正记录的直接零责任度必为零;M步据此更新混合比例和Poisson有效暴露分母。该页列出一次可复算更新、观察似然与全零/无零边界…”
看到一个零计数,有时只能知道“这次没有事件”,无法知道它来自永远关闭的部件,还是来自一次恰好为零的随机计数。零膨胀Poisson模型把这两种来源都放进似然;它估计各来源的后验概率,而不会把每一个零自动贴上确定标签。
形式陈述
两个部件都可能解释零
设λ>0、0≤π<1。令潜变量Z以概率π取1,表示进入直接生成零的部件;以概率1−π取0,随后独立生成Pois(λ)。这是两个部件的有限混合模型,其观察质量为
π=0给普通Poisson。允许π↑1的闭包时得到恒零分布,此时任意λ产生同样观察,λ不可识别。本页非退化参数域保留π<1、λ>0。
在固定协变量下可以规定logλ_i=log e_i+x_iᵀβ、logit π_i=z_iᵀγ,e_i>0已知,且给定设计后全部观察独立。有限γ对应0<π_i<1,故π_i=0的普通Poisson边界不是一个有限logit系数。这个回归假设仍需为重复对象或共享环境另行说明联合关系。
均值、方差和“多零”的参照
记μ=EY。按Z使用全期望与全方差,
π>0时严格过离散;π=0时等离散。零次概率也至少等于均值相同的Pois(μ)的零概率:混合强度Λ取0、λ,因u↦e^−u凸,
总体参数可识别,不代表零标签已知
在本页参数域内,P(Y=1)>0,而且
所以完整总体质量唯一决定λ和π。它没有承诺有限样本里一定出现1和2,也没有说比频数估计在小样本中可靠;式(3)是总体可识别性的证明。
对于一个已经观察为零的对象,Bayes公式却只给责任度
若0<π<1、λ有限,τ(0)严格介于0和1。总体参数可识别与单个潜标签可确定,是两件不同的事。
直觉
“零膨胀”不是把已有Poisson概率中的零项直接放大而其余不变。增加零点质量时,所有Poisson部件概率同时乘1−π,才能使总和仍为1。非零计数的相邻概率比保留λ的形状,因此正数告诉我们计数部件的强度,整体零/正比例再约束π。
λ描述进入Poisson部件以后的均值;其中仍可能得到零。完整总体均值是(1−π)λ,而正计数条件均值为λ/(1−e^−λ)。这三个平均数对应三个不同的条件,解释回归系数时要先指出目标是哪一个。
例子与边界
一个零的责任度可以精确复算
取π=1/3、λ=log2。因为e^−λ=1/2,P(Y=0)=2/3,且τ(0)=1/2。于是观察到的零中,有一半后验概率来自直接零部件,另一半来自Poisson部件;不能将全部2/3的零频率当成π。
总体均值为
同样的两个矩不唯一决定模型家族
对任意π∈(0,1),式(2)与均值μ、形状
与门槛模型的相同观察、不同标签
Poisson门槛模型的正概率q和母参数λ若满足
反过来,q>1−e^−λ的零缩减门槛需要负的π,因此不属于本页模型。这里说的是固定条件下的质量对应;加上不同的线性回归链接之后,还需检查转换后的系数函数是否仍在所规定的回归类中。
推论与应用
EM每一步究竟在更新什么
观察独立计数y_1,…,y_n,至少一个为正。用EM算法,从0<π<1、λ>0开始。E步由式(4)算每个τ_i;M步最大化条件完整对数似然
τ_i是旧参数下的数,M步不能一边求导一边把它随新参数改变。对两块分别求导,得到
最后一个等号利用正计数的τ_i=0。至少一个正记录使分母和分子都正,也使π新<1。如果没有零,π新=0,应允许此边界而不是要求一个有限logit截距。如果全为零,式(6)推向λ=0等退化边界,不能继续假装在非退化参数域内得到唯一估计。
例如资料为0、0、0、1、2,起点π=1/3、λ=log2。三个零的τ_i都为1/2,故Στ_i=3/2,π新=3/10、λ新=6/7。真正检查的是观察对数似然
其中n_0为零记录数、S为全部计数之和。旧EM定理保证精确E步、增加Q的M步不会使ℓ下降;它不保证全局极大或固定迭代次数。这个标量模型先用O(n)累计n_0、S和常数项,以后每轮可用O(1)时间、O(1)额外空间;有协变量时则要逐条计算责任度。
带协变量的两个加权问题
在回归版中,M步的零部件是“软响应”τ_i的logistic目标;Poisson部件的权重是1−τ_i。前者得分为Σz_i(τ_i−π_i新),后者为Σx_i(1−τ_i)(y_i−λ_i新)。分别求两块的增大步,再检查Q和观察似然,才是一轮可追踪的广义EM。
若零部件维数a≥1、计数部件维数d≥1,稠密一次Newton内步形成与分解的总成本为O(n(a²+d²)+a³+d³),额外矩阵存储O(a²+d²),另存全部责任度需O(n),也可重新计算以节省这部分存储。每个M步可能需要多次内迭代,所以这个成本不是整个EM收敛的复杂度定理。
如果一个协变量x在logitπ和logλ中的系数分别为γ、β,暴露量固定,则
β独自描述Poisson部件的强度变化,完整均值还要乘部件被选中的概率。拟合后应同时报告π、λ、完整均值和零预测,而不是只把两个系数表合并成一个“计数效应”。
边界检验还需要自己的校准
检验π=0位于参数空间边界;回归中的某些零部件参数在该边界也可能失去识别。因此不能只因ZIP多了一组参数,就无条件引用普通内部点的χ²似然比校准。选择检验或模型比较办法前,应另外证明其零模型极限或构造适用的校准程序。
计数观测机制终点给一份同时达到门槛与ZIP全局极大的小表,并要求证明这种观察等价为何不能恢复每个零的真实标签。
参考资料
- Achim Zeileis、Christian Kleiber、Simon Jackman,Regression Models for Count Data in R,Journal of Statistical Software 27(8),2008,pp.1–25,§2.3,零膨胀混合与均值。
- Diane Lambert,Zero-Inflated Poisson Regression, With an Application to Defects in Manufacturing,Technometrics 34(1),1992,pp.1–14,DOI,原始模型论文;本页式(4)–(7)直接推导责任度与EM。