“特别常见的选择,是从某个非负计数分布p θ作零截断:$p \theta^+(y)=p \theta(y)/(1 p \theta(0))$。门槛中的q是观察到正计数的概率,不是母分布的均值,…”
数据库若只收录“至少发生过一次”的对象,表中没有零,并不意味着总体没有零。拟合前要先问:零记录从来没有进入表,还是它们确实被观察并保留为零?零截断模型回答前一种情形;它把抽样条件本身写进概率。
形式陈述
条件化后的完整分布
设总体计数N在非负整数上的质量为p_θ(y),且0≤p_θ(0)<1。一个对象入样的条件恰为N>0;在这个条件之外,不再按正计数的大小改变抽样机会。所见计数Y的分布是条件概率
对正整数求和即得1。若所见n≥1个对象独立、服从式(1),条件对数似然为
这里n是正记录数。只有这些记录而没有总体抽样框大小时,不能再添一个“已观察到零人的零记录”项;那会把条件实验换成完整实验。相反,若总体有已知M个独立对象,记录其中哪些为零且有n个正计数,则零的数量M−n本身携带参数信息。
Poisson母分布的均值和方差
用Poisson分布作式(1)的母分布,参数λ>0,得到
λ是截断前的均值,m(λ)才是所见正计数的均值。因为y=0对一阶矩和阶乘二阶矩没有贡献,
所以
对每个λ>0,这个方差严格为正;分布同时给1和2正概率即可证明。它又严格小于m(λ)。去掉零后得到的欠离散,不与截断前Poisson等离散矛盾。
有限MLE的精确条件
以下假设正记录数n≥1。空表没有样本均值,不适用本段的唯一根结论。取η=logλ,式(2)成为
从得分与信息的定义,
验证时先算
直觉
截断会提高剩余记录的均值。λ很小时,原总体大多数为零;在“已经非零”这个前提下,留下的大多为1,因此m(λ)接近1,而不是接近0。直接把所见平均数当λ,相当于把筛选后的对象当作未经筛选的总体。
归一化项也会影响估计。它不是一个与参数无关的常数:参数越大,入样概率越高,条件似然就越要除掉这个较大的概率。少写这一项,就遗漏了观察机制的责任。
例子与边界
正记录为1、1、2、4
n=4、S=8,所见均值为2。由式(5),截断前均值的MLE满足
普通Poisson拟合会给λ=2。两者都能在某个意义下使用“样本均值”,但对应的是不同分布:正确方程将样本均值与m(λ)相等,而不是与λ相等。在正确参数处,所见方差为
没有零,不能识别任意的零概率
对任何q∈(0,1],定义一个总体:P(N=0)=1−q,正整数质量为q p_λ^+(y)。条件于N>0以后,q完全消掉。因此正表即使无限大,也无法同时识别一个自由的q。门槛计数模型正是把q作为单独参数;它需要关于零/正比例的资料。
如果坚持未经混合的Poisson母模型,λ确实确定零概率e^−λ;这来自模型的约束,并非正表独立测出了零频率。若进一步估计未见对象数量,还要指定总体大小、捕获或抽样设计,不能只凭式(1)保证这种数量估计可靠。
按计数次数抽样会得到另一种分布
设抽样单位是事件,再回看该事件所属对象的总次数。次数为y的对象有y倍机会被遇见,因而所见质量是
这里要求0<EN<∞。它同样没有零,但并非式(1)。Poisson情形中
故所见Y分布是1+Pois(λ),均值λ+1。例如所见均值为2,按事件抽样给λ=1,而正对象均匀入样给约1.5936。仅看支持都是正整数,无法选择这两种似然。
这一按次数加权分布正是大小偏置在计数抽样中的实例;若入样概率还受未观测变量影响,必须另写选择机制,不能自动套上零截断。
截断与删失保留的资料不同
截断时某些对象根本未进表。删失时对象仍在表中,只把其值报告成一个范围。例如只报告N≥3而不报具体数,似然项是P(N≥3),不是把所有3以上计数删掉后再归一化。只有先明确保留了哪些对象与哪些数值,才能判断应使用哪一种概率。
推论与应用
给唯一根一份数值证书
ȳ>1时,可以在区间[0,ȳ]上对
先用O(n)时间累计S,此后每轮只需常数次函数计算与O(1)工作空间。若用浮点数认证端点符号,应控制数值误差,或用更高精度/包围计算;二分理论本身并不保证任意舍入后的符号都对。
小λ时直接相减1−exp(−λ)会消掉有效数字,可用−expm1(−λ)计算分母。极小时求m−1或v仍有消减,应从指数级数得到
带协变量的正计数
若λ_i=e_i exp(x_iᵀβ),且选择恰为每个N_i>0,独立记录的得分与负Hessian为
因此可以进行Newton迭代,但单参数ȳ>1的存在性判据不能不经证明就搬到任意设计。含截距方向时,响应全为1的逃逸边界已经说明:正计数、满列秩和有限次迭代都不自动等于有限极大点。
计数观测机制终点把全记录、正对象抽样与按事件抽样并列,要求先写似然,再解释每个参数能由什么资料识别。
参考资料
- Charles J. Geyer,Stat 3701 Lecture Notes: Zero-Truncated Poisson Distribution,2017,§2–4,正Poisson的得分与极端参数数值计算。
- A. Colin Cameron、Pravin K. Trivedi,Essentials of Count Data Regression,作者稿,1999,§2.3(p.4),截断与删失的观测机制。