Skip to content

模型Model

零膨胀Poisson模型

Zero-inflated Poisson model · ZIP model · Zero-inflated Poisson regression · 零膨胀泊松回归

将零点质量与Poisson部件混合,推导零责任度、EM和可识别条件,并区分观测分布、潜在标签以及门槛模型的概率范围。

看到一个零计数,有时只能知道“这次没有事件”,无法知道它来自永远关闭的部件,还是来自一次恰好为零的随机计数。零膨胀Poisson模型把这两种来源都放进似然;它估计各来源的后验概率,而不会把每一个零自动贴上确定标签。

形式陈述 ​

两个部件都可能解释零 ​

设λ>0、0≤π<1。令潜变量Z以概率π取1,表示进入直接生成零的部件;以概率1−π取0,随后独立生成Pois(λ)。这是两个部件的有限混合模型,其观察质量为

(1)pπ,λ(y)={π+(1−π)e−λ,y=0,(1−π)e−λλy/y!,y≥1.

π=0给普通Poisson。允许π↑1的闭包时得到恒零分布,此时任意λ产生同样观察,λ不可识别。本页非退化参数域保留π<1、λ>0。

在固定协变量下可以规定logλ_i=log e_i+x_iᵀβ、logit π_i=z_iᵀγ,e_i>0已知,且给定设计后全部观察独立。有限γ对应0<π_i<1,故π_i=0的普通Poisson边界不是一个有限logit系数。这个回归假设仍需为重复对象或共享环境另行说明联合关系。

均值、方差和“多零”的参照 ​

记μ=EY。按Z使用全期望与全方差,

(2)μ=(1−π)λ,VarY=(1−π)λ+π(1−π)λ2=μ+π1−πμ2.

π>0时严格过离散;π=0时等离散。零次概率也至少等于均值相同的Pois(μ)的零概率:混合强度Λ取0、λ,因u↦e^−u凸,E(e−Λ)≥e−EΛ=e−μ,非退化混合时严格大于。比较时要固定相同的均值,而不能任意选另一个Poisson参数。

总体参数可识别,不代表零标签已知 ​

在本页参数域内,P(Y=1)>0,而且

(3)λ=2P(Y=2)P(Y=1),1−π=P(Y=1)eλλ.

所以完整总体质量唯一决定λ和π。它没有承诺有限样本里一定出现1和2,也没有说比频数估计在小样本中可靠;式(3)是总体可识别性的证明。

对于一个已经观察为零的对象,Bayes公式却只给责任度

(4)τ(0):=P(Z=1∣Y=0)=ππ+(1−π)e−λ;τ(y)=0(y>0).

若0<π<1、λ有限,τ(0)严格介于0和1。总体参数可识别与单个潜标签可确定,是两件不同的事。

直觉

“零膨胀”不是把已有Poisson概率中的零项直接放大而其余不变。增加零点质量时,所有Poisson部件概率同时乘1−π,才能使总和仍为1。非零计数的相邻概率比保留λ的形状,因此正数告诉我们计数部件的强度,整体零/正比例再约束π。

λ描述进入Poisson部件以后的均值;其中仍可能得到零。完整总体均值是(1−π)λ,而正计数条件均值为λ/(1−e^−λ)。这三个平均数对应三个不同的条件,解释回归系数时要先指出目标是哪一个。

例子与边界

一个零的责任度可以精确复算 ​

取π=1/3、λ=log2。因为e^−λ=1/2,P(Y=0)=2/3,且τ(0)=1/2。于是观察到的零中,有一半后验概率来自直接零部件,另一半来自Poisson部件;不能将全部2/3的零频率当成π。

总体均值为 (2/3)log⁡2≈0.46209812,方差为 μ+(2/9)(log⁡2)2。正记录中的条件均值却是2log2,约1.3863。把后者放进总体均值公式,会混淆条件化与混合。

同样的两个矩不唯一决定模型家族 ​

对任意π∈(0,1),式(2)与均值μ、形状 k=(1−π)/π 的NB2有相同的均值和方差。不过这不使整个质量相同:ZIP正概率比为λ/(y+1),NB2则为 (k+y)μ/{(y+1)(k+μ)},对y的依赖不同。两个矩只能排除某些模型,不能一般识别全部生成机制。

与门槛模型的相同观察、不同标签 ​

Poisson门槛模型的正概率q和母参数λ若满足 q=(1−π)(1−e−λ),就与式(1)逐点相同。门槛标签是观察到的1{Y>0};ZIP标签Z却是未观察的零来源。同一份完整计数分布因此可以支持两套描述,单靠计数无法在这两个相同分布的解释中作出因果选择。

反过来,q>1−e^−λ的零缩减门槛需要负的π,因此不属于本页模型。这里说的是固定条件下的质量对应;加上不同的线性回归链接之后,还需检查转换后的系数函数是否仍在所规定的回归类中。

推论与应用

EM每一步究竟在更新什么 ​

观察独立计数y_1,…,y_n,至少一个为正。用EM算法,从0<π<1、λ>0开始。E步由式(4)算每个τ_i;M步最大化条件完整对数似然

(5)Q(π′,λ′)=∑i{τilog⁡π′+(1−τi)log⁡(1−π′)}+∑i(1−τi){yilog⁡λ′−λ′−log⁡(yi!)}.

τ_i是旧参数下的数,M步不能一边求导一边把它随新参数改变。对两块分别求导,得到

(6)πnew=1n∑iτi,λnew=∑i(1−τi)yi∑i(1−τi)=∑iyin−∑iτi.

最后一个等号利用正计数的τ_i=0。至少一个正记录使分母和分子都正,也使π新<1。如果没有零,π新=0,应允许此边界而不是要求一个有限logit截距。如果全为零,式(6)推向λ=0等退化边界,不能继续假装在非退化参数域内得到唯一估计。

例如资料为0、0、0、1、2,起点π=1/3、λ=log2。三个零的τ_i都为1/2,故Στ_i=3/2,π新=3/10、λ新=6/7。真正检查的是观察对数似然

(7)ℓ(π,λ)=n0log⁡{π+(1−π)e−λ}+(n−n0)log⁡(1−π)−λ(n−n0)+Slog⁡λ−∑yi>0log⁡(yi!),

其中n_0为零记录数、S为全部计数之和。旧EM定理保证精确E步、增加Q的M步不会使ℓ下降;它不保证全局极大或固定迭代次数。这个标量模型先用O(n)累计n_0、S和常数项,以后每轮可用O(1)时间、O(1)额外空间;有协变量时则要逐条计算责任度。

带协变量的两个加权问题 ​

在回归版中,M步的零部件是“软响应”τ_i的logistic目标;Poisson部件的权重是1−τ_i。前者得分为Σz_i(τ_i−π_i新),后者为Σx_i(1−τ_i)(y_i−λ_i新)。分别求两块的增大步,再检查Q和观察似然,才是一轮可追踪的广义EM。

若零部件维数a≥1、计数部件维数d≥1,稠密一次Newton内步形成与分解的总成本为O(n(a²+d²)+a³+d³),额外矩阵存储O(a²+d²),另存全部责任度需O(n),也可重新计算以节省这部分存储。每个M步可能需要多次内迭代,所以这个成本不是整个EM收敛的复杂度定理。

如果一个协变量x在logitπ和logλ中的系数分别为γ、β,暴露量固定,则

∂log⁡EY∂x=β−πγ.

β独自描述Poisson部件的强度变化,完整均值还要乘部件被选中的概率。拟合后应同时报告π、λ、完整均值和零预测,而不是只把两个系数表合并成一个“计数效应”。

边界检验还需要自己的校准 ​

检验π=0位于参数空间边界;回归中的某些零部件参数在该边界也可能失去识别。因此不能只因ZIP多了一组参数,就无条件引用普通内部点的χ²似然比校准。选择检验或模型比较办法前,应另外证明其零模型极限或构造适用的校准程序。

计数观测机制终点给一份同时达到门槛与ZIP全局极大的小表,并要求证明这种观察等价为何不能恢复每个零的真实标签。

参考资料
  • Achim Zeileis、Christian Kleiber、Simon Jackman,Regression Models for Count Data in R,Journal of Statistical Software 27(8),2008,pp.1–25,§2.3,零膨胀混合与均值。
  • Diane Lambert,Zero-Inflated Poisson Regression, With an Application to Defects in Manufacturing,Technometrics 34(1),1992,pp.1–14,DOI,原始模型论文;本页式(4)–(7)直接推导责任度与EM。
关系图谱10 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系