“Poisson门槛模型的正概率q和母参数λ若满足 $q=(1 \pi)(1 e^{ \lambda})$,就与式(1)逐点相同。门槛标签是观察到的1{Y 0};ZIP标签Z却是未观察的零来源…”
一本完整计数表中,第一件事是“有没有发生”,第二件事是“发生以后有多少次”。门槛模型分别给这两个问题一个概率部件。两个部件可以使用不同协变量,但它们都要对最后观察到的同一个计数负责。
形式陈述
一个零/正门槛和一个正计数分布
设q∈[0,1],B是成功概率为q的Bernoulli变量。令V独立于B,只取正整数,质量为p_θ^+(y)。定义Y=BV,便有
特别常见的选择,是从某个非负计数分布p_θ作零截断:
本页主要计算Poisson门槛模型:λ>0,
q与λ独立变化,概率总和恒为1。若q=1−e^−λ,就恢复普通Pois(λ);q更小时零更多,q更大时零更少。因而这个模型不只描述“额外零”。
全记录似然何时真的分成两块
固定设计后,假设全部n≥1个计数独立。写D_i=1{Y_i>0},并允许q_i=q_i(γ)、θ_i=θ_i(β)。全记录对数似然为
若参数空间是Γ×Β,第一项只含γ、第二项只含β,那么分别最大化两项就最大化它们的和。证明很直接:任意(γ,β)的两项分别不超过各自上确界;若两边极大点都存在,拼在一起便达到总上界。若只有上确界,也只能得到逼近总上界的序列,不能据分解保证有限解存在。
“使用相同的协变量”不破坏分离,只要两套系数仍独立。例如logit q_i=z_iᵀγ、logλ_i=log e_i+x_iᵀβ,完全可以z_i=x_i。反之,若强制γ=β、对两者施加共同约束或加入耦合惩罚,式(3)虽然仍成立,却不能各自选参数后拼接。
均值与方差属于完整计数
设正分布均值为m_+、方差为v_+。用全期望与全方差按B分解,
Poisson门槛中,
特别地,方差减均值为μ(λ−μ),其符号恰由q与1−e^−λ的大小决定。零缩减的Poisson门槛总体可以欠离散;其方差仍为非负,因为它来自式(4)的两个非负项。
直觉
门槛的B不是需要猜测的潜标签:只要完整Y已被观察,B=1{Y>0}也就知道了。正计数部件不可能再生成一个零,所有零都由门槛关闭产生。这是似然可以清楚拆成两块的原因。
不过“两个概率部件”不等于已证明两阶段现实因果过程。任何有正概率出现正计数的总体,都能写成零/正概率乘正条件分布。门槛表示法首先是一个观测概率分解;因果解释还需要额外设计和证据。
例子与边界
一份完整计数表的两个估计
观察0、0、1、1、2、4,n=6,其中m=4个正数,S=8。在独立、只有截距且q、λ无耦合约束的Poisson门槛模型中,式(3)给
因此λ约1.5936242600,完整计数均值预测为q̂×2=4/3,恰等于全表平均数。λ本身不是4/3,也不是2;它是正分布所用的Poisson母参数。
若所有记录均为零,q̂=0,而λ无法由这些记录识别;若全部记录为正,闭参数空间中的q̂=1,有限logit截距却不存在。若所有正记录都为1,λ的极大值只在λ↓0的边界逼近。这些情况不能用“拟合程序返回一个大数”来掩盖。
允许零缩减并不破坏概率
取λ=log2、q=3/4。母Poisson的正概率为1/2,而门槛要求3/4,所以P(Y=0)=1/4,比该母分布的一半更少。均值为
一个只允许额外零的混合模型不能自动接纳这组参数。要比较模型,需检查整个正质量的形状,而不是只比较某一个零频率。
与零膨胀Poisson逐点对应到哪里
零膨胀Poisson模型以概率π直接生成零,以1−π生成一个Pois(λ),因此其观察到的正概率为
对每个y≥1代入式(2),可见两个质量完全相同。反过来,一个λ>0、q>0的Poisson门槛分布能写成合法ZIP,当且仅当
必要性不是只靠使用同一个λ作猜测:正质量比
图右侧给出式(7)的全部合法区域。蓝点来自终点的完整记录拟合,红点是另一个零缩减总体;左侧同时说明,拟合同一张表并不使不同模型的零质量和尾部自动相等。
这一对应是单个分布或每个固定协变量值处的对应。若另外要求logit q(z)和logit π(z)都对同一z线性,式(6)一般不会保留这个线性形式。因此不能把两套有限维回归模型无条件写成等价模型。
推论与应用
分块拟合与代价
采用logit门槛和logλ线性预测时,第一块用Bernoulli–logit的得分和IRLS,响应是全部D_i;第二块只用正记录,并使用零截断得分。若门槛设计维数a≥1、正计数设计维数d≥1,稠密信息矩阵的一轮形成与求解分别需O(na²+a³)和O(md²+d³),额外矩阵存储O(a²+d²)。这按两边存在可用有限迭代方向计;分离、无正记录或退化设计应先单独报告。
只含截距时,无需把这一简单问题做成大矩阵:累计n、m、S用O(n),q̂=m/n;m>0且S/m>1时,再对正均值方程二分。m=0时不调用正部件求根,S/m也没有定义。
解释协变量时乘回门槛概率
完整均值是q_i m_+(λ_i)。假设一个连续协变量x同时进入logit q和logλ,系数分别为γ、β,且暴露量固定。由链式法则,
所以正部件的β既不是完整计数的固定log均值效应,也不一般等于正条件均值的log效应。式(8)逐项指出门槛和次数怎样共同影响预测,避免把两个系数表中的同名列误读成同一个目标。
计数观测机制终点要求给出合法ZIP转换或不可能性证书,并辨别只保留正记录以后哪些参数已经失去信息。
参考资料
- Achim Zeileis、Christian Kleiber、Simon Jackman,Regression Models for Count Data in R,Journal of Statistical Software 27(8),2008,pp.1–25,§2.2,门槛分布、两个似然部件与均值。
- A. Colin Cameron、Pravin K. Trivedi,Essentials of Count Data Regression,作者稿,1999,§3.3(pp.8–9),包括零缩减的计数模型。
- John Mullahy,Specification and Testing of Some Modified Count Data Models,Journal of Econometrics 33(3),1986,pp.341–365,DOI,历史原始论文;本页推导完整给出。