Skip to content

模型Model

零截断计数模型

Zero-truncated count model · Zero-truncated Poisson distribution · 正Poisson分布 · 零截断Poisson模型

在只记录正计数的抽样条件下重新归一化分布,推导正Poisson均值与似然,并区分全为一边界、删失和按次数加权抽样。

数据库若只收录“至少发生过一次”的对象,表中没有零,并不意味着总体没有零。拟合前要先问:零记录从来没有进入表,还是它们确实被观察并保留为零?零截断模型回答前一种情形;它把抽样条件本身写进概率。

形式陈述 ​

条件化后的完整分布 ​

设总体计数N在非负整数上的质量为p_θ(y),且0≤p_θ(0)<1。一个对象入样的条件恰为N>0;在这个条件之外,不再按正计数的大小改变抽样机会。所见计数Y的分布是条件概率

(1)pθ+(y)=Pθ(N=y∣N>0)=pθ(y)1−pθ(0),y=1,2,….

对正整数求和即得1。若所见n≥1个对象独立、服从式(1),条件对数似然为

(2)ℓ+(θ)=∑i=1nlog⁡pθ(yi)−nlog⁡{1−pθ(0)}.

这里n是正记录数。只有这些记录而没有总体抽样框大小时,不能再添一个“已观察到零人的零记录”项;那会把条件实验换成完整实验。相反,若总体有已知M个独立对象,记录其中哪些为零且有n个正计数,则零的数量M−n本身携带参数信息。

Poisson母分布的均值和方差 ​

用Poisson分布作式(1)的母分布,参数λ>0,得到

(3)pλ+(y)=λyy!(eλ−1),m(λ):=EY=λ1−e−λ.

λ是截断前的均值,m(λ)才是所见正计数的均值。因为y=0对一阶矩和阶乘二阶矩没有贡献,

EY=λq0,E{Y(Y−1)}=λ2q0,q0=1−e−λ.

所以

(4)v(λ):=VarY=m(λ){1+λ−m(λ)}=λq0−λ2e−λq02.

对每个λ>0,这个方差严格为正;分布同时给1和2正概率即可证明。它又严格小于m(λ)。去掉零后得到的欠离散,不与截断前Poisson等离散矛盾。

有限MLE的精确条件 ​

以下假设正记录数n≥1。空表没有样本均值,不适用本段的唯一根结论。取η=logλ,式(2)成为

ℓ+(η)=Sη−nlog⁡(eeη−1)−∑ilog⁡(yi!),S=∑iyi.

从得分与信息的定义,

(5)dℓ+dη=S−nm(λ),−d2ℓ+dη2=nv(λ)>0.

验证时先算 λm′(λ)=v(λ)。m严格递增,在λ↓0时趋1,在λ→∞时趋∞,故:若样本均值ȳ>1,方程m(λ)=ȳ有唯一正根,也就是唯一有限MLE;若全部y_i=1,得分始终为负,上确界只在λ↓0取得,此时所见分布趋于恒为1。λ=0本身不是合法的原Poisson条件化参数,因为P(N>0)=0。

直觉

截断会提高剩余记录的均值。λ很小时,原总体大多数为零;在“已经非零”这个前提下,留下的大多为1,因此m(λ)接近1,而不是接近0。直接把所见平均数当λ,相当于把筛选后的对象当作未经筛选的总体。

归一化项也会影响估计。它不是一个与参数无关的常数:参数越大,入样概率越高,条件似然就越要除掉这个较大的概率。少写这一项,就遗漏了观察机制的责任。

例子与边界

正记录为1、1、2、4 ​

n=4、S=8,所见均值为2。由式(5),截断前均值的MLE满足

λ^1−e−λ^=2,λ^≈1.5936242600.

普通Poisson拟合会给λ=2。两者都能在某个意义下使用“样本均值”,但对应的是不同分布:正确方程将样本均值与m(λ)相等,而不是与λ相等。在正确参数处,所见方差为 2(λ^−1)≈1.18724852。

没有零,不能识别任意的零概率 ​

对任何q∈(0,1],定义一个总体:P(N=0)=1−q,正整数质量为q p_λ^+(y)。条件于N>0以后,q完全消掉。因此正表即使无限大,也无法同时识别一个自由的q。门槛计数模型正是把q作为单独参数;它需要关于零/正比例的资料。

如果坚持未经混合的Poisson母模型,λ确实确定零概率e^−λ;这来自模型的约束,并非正表独立测出了零频率。若进一步估计未见对象数量,还要指定总体大小、捕获或抽样设计,不能只凭式(1)保证这种数量估计可靠。

按计数次数抽样会得到另一种分布 ​

设抽样单位是事件,再回看该事件所属对象的总次数。次数为y的对象有y倍机会被遇见,因而所见质量是

pevent(y)=ypθ(y)EθN,y≥1,

这里要求0<EN<∞。它同样没有零,但并非式(1)。Poisson情形中

ye−λλy/y!λ=e−λλy−1(y−1)!,

故所见Y分布是1+Pois(λ),均值λ+1。例如所见均值为2,按事件抽样给λ=1,而正对象均匀入样给约1.5936。仅看支持都是正整数,无法选择这两种似然。

这一按次数加权分布正是大小偏置在计数抽样中的实例;若入样概率还受未观测变量影响,必须另写选择机制,不能自动套上零截断。

截断与删失保留的资料不同 ​

截断时某些对象根本未进表。删失时对象仍在表中,只把其值报告成一个范围。例如只报告N≥3而不报具体数,似然项是P(N≥3),不是把所有3以上计数删掉后再归一化。只有先明确保留了哪些对象与哪些数值,才能判断应使用哪一种概率。

推论与应用

给唯一根一份数值证书 ​

ȳ>1时,可以在区间[0,ȳ]上对 f(λ)=m(λ)−y¯ 使用二分法,其中m(0)=1只作连续延拓。左端f<0,右端因m(ȳ)>ȳ而f>0;每轮保留异号两端,区间宽度减半。要求宽度≤ε,轮数不超过 max{0,⌈log2⁡(y¯/ε)⌉}。这个区间是求根误差证书,不是参数置信区间。

先用O(n)时间累计S,此后每轮只需常数次函数计算与O(1)工作空间。若用浮点数认证端点符号,应控制数值误差,或用更高精度/包围计算;二分理论本身并不保证任意舍入后的符号都对。

小λ时直接相减1−exp(−λ)会消掉有效数字,可用−expm1(−λ)计算分母。极小时求m−1或v仍有消减,应从指数级数得到 m=1+λ/2+λ2/12+O(λ4)、v=λ/2+λ2/6+O(λ4),并按所需误差控制截断;不能把近似式冒充对全部λ的精确公式。

带协变量的正计数 ​

若λ_i=e_i exp(x_iᵀβ),且选择恰为每个N_i>0,独立记录的得分与负Hessian为

Uβ=∑ixi{yi−m(λi)},−∇2ℓ+=∑iv(λi)xixiT.

因此可以进行Newton迭代,但单参数ȳ>1的存在性判据不能不经证明就搬到任意设计。含截距方向时,响应全为1的逃逸边界已经说明:正计数、满列秩和有限次迭代都不自动等于有限极大点。

计数观测机制终点把全记录、正对象抽样与按事件抽样并列,要求先写似然,再解释每个参数能由什么资料识别。

参考资料
关系图谱7 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系