Skip to content

算法Algorithm

Turnbull 区间删失估计

Turnbull estimator

用区间概率建立非参数似然,再以自洽质量更新估计区间删失分布,不伪造精确事件日。

形式陈述 ​

在事件时间模型中,取整数 n≥1,设 T1,…,Tn 独立同分布于 F,观察到 Ti∈(Li,Ri],其中 Li<Ri,可令 Ri=∞ 表示右删失。设检查机制在相关条件下可忽略,目标分布函数为 F,则事件时间似然为

L(F)=∏i=1n{F(Ri)−F(Li)}.

这里 F(∞)=1。相同的符号 Li 在本页表示区间左端,不是延迟进入时间;有截断时必须再加入条件化分母,本页算法只处理无截断的区间删失。

将端点诱导的区域进一步整理为观测无法区分的候选支持区间 I1,…,IK,其中 K≥1。令 pj 为分配在 Ij 的概率质量,aij 表示整个候选区间是否落在第 i 个观察区间中。于是要在概率单纯形上最大化

ℓ(p)=∑ilog⁡(∑jaijpj),pj≥0,∑jpj=1.

这一凹目标允许不同支持分配取得同一最大值;资料往往只能识别某些区间的总质量,不能确定区间内部的具体跳跃位置。

自洽更新怎样工作 ​

每个观察区间须至少包含一个候选支持区间,否则这份离散表示与输入不相容。给所有可能需要的支持区间正的初始质量。第 r 轮先计算第 i 人的事件落在 Ij 中的条件权重

wij(r)=aijpj(r)∑kaikpk(r),pj(r+1)=1n∑iwij(r).

第一步按现有分布把每人的一单位概率分摊到兼容区间;第二步平均这些分摊。它是EM式更新。每轮保持非负性与总和一,并使似然不下降。每轮稠密成本为 O(nK);端点排序另需 O(nlog⁡n),区间关联可用稀疏结构节省存储。

停止时不能只看参数变化很小。对每行兼容概率 ri=∑jaijpj>0 的候选 p,记 gj=∑iaij/ri。因为 ∑jpjgj=n,负对数似然的凸性与一阶支撑不等式给出对任意单纯形中的 q,

ℓ(q)−ℓ(p)≤gT(q−p)≤maxjgj−n.

当某行在 q 下概率为零时,左侧为 −∞,不等式仍成立。因此 maxjgj−n 是可计算的全局对数似然差上界;它为零便认证全局最优,不需要从 EM 的单调性推断已经找到最大值。若开始把某个必要支持质量设为零,乘法更新永远无法使其复活。临近边界时 EM 也可能很慢。

直觉

一次检查未发现故障,下一次发现故障,只能确定事件发生在两次检查之间。把事件都放到第二次检查日,会怎样改变估计?Turnbull 方法保留整个可能区间,用区间概率构造非参数似然。

例子与边界

三个区间的实际更新 ​

观察区间是 (0,2]、(1,3] 和 (2,3]。先用三个端点单元 (0,1]、(1,2]、(2,3],赋质量 (1/3,1/3,1/3)。三人的兼容质量分别为 2/3,2/3,1/3。

条件分摊依次为 (1/2,1/2,0)、(0,1/2,1/2) 和 (0,0,1)。平均后得到 (1/6,1/3,1/2)。初始似然为 (2/3)(2/3)(1/3)=4/27;更新后为 (1/2)(5/6)(1/2)=5/24,确实增加。

可以直接检查最优解:把第一单元质量移到第二单元不会减少任何观测概率,因此最优时可取 p1=0。余下似然为 p2p3,在 p2+p3=1 下由 p2=p3=1/2 最大化,最大值 1/4。在 p=(0,1/2,1/2) 处,g=(2,3,3),上面的差界为零,给出同一个最优性证书。第一、二人仍没有被人为指定一个精确事件时刻。

边界与反例 ​

若同一组人实际上都在 1.1 发生事件,但下一次检查统一在 2,以检查日套用 KM 就会把事件推迟到 2。增加样本量不会消除这种时间分辨率错误。区间似然只承认 (1,2] 内发生,符合观察所能支持的精度。

若因症状恶化而提前检查,检查过程可能与潜在事件有关。此时“区间已经记录下来”并不足以使检查机制可忽略,需要额外模型或设计论证。

推论与应用

此方法是最大似然在不完整事件时间上的具体实现。输出图上的阶梯位置应配合可识别区间解释;看上去精细的画线不能替代资料没有提供的时间信息。

参考资料
关系图谱12 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系