形式陈述
在事件时间模型 公理库 生存分析基础 Survival analysis · Kaplan–Meier estimator 对事件时间、删失、survival 与 hazard 建模并估计生存曲线的基础框架。 中,取整数 n ≥ 1 ,设 T 1 , … , T n 独立同分布于 F ,观察到 T i ∈ ( L i , R i ] ,其中 L i < R i ,可令 R i = ∞ 表示右删失。设检查机制在相关条件下可忽略,目标分布函数为 F ,则事件时间似然为
L ( F ) = ∏ i = 1 n { F ( R i ) − F ( L i ) } . 这里 F ( ∞ ) = 1 。相同的符号 L i 在本页表示区间左端,不是延迟进入时间;有截断时必须再加入条件化分母,本页算法只处理无截断的区间删失。
将端点诱导的区域进一步整理为观测无法区分的候选支持区间 I 1 , … , I K ,其中 K ≥ 1 。令 p j 为分配在 I j 的概率质量,a i j 表示整个候选区间是否落在第 i 个观察区间中。于是要在概率单纯形上最大化
ℓ ( p ) = ∑ i log ( ∑ j a i j p j ) , p j ≥ 0 , ∑ j p j = 1. 这一凹目标允许不同支持分配取得同一最大值;资料往往只能识别某些区间的总质量,不能确定区间内部的具体跳跃位置。
自洽更新怎样工作
每个观察区间须至少包含一个候选支持区间,否则这份离散表示与输入不相容。给所有可能需要的支持区间正的初始质量。第 r 轮先计算第 i 人的事件落在 I j 中的条件权重
w i j ( r ) = a i j p j ( r ) ∑ k a i k p k ( r ) , p j ( r + 1 ) = 1 n ∑ i w i j ( r ) . 第一步按现有分布把每人的一单位概率分摊到兼容区间;第二步平均这些分摊。它是EM 公理库 期望最大化算法 Expectation-maximization algorithm · EM algorithm · EM 算法 交替计算潜变量的条件分布与提高完整数据期望对数似然,以迭代优化观测似然的算法。 式更新。每轮保持非负性与总和一,并使似然不下降。每轮稠密成本为 O ( n K ) ;端点排序另需 O ( n log n ) ,区间关联可用稀疏结构节省存储。
停止时不能只看参数变化很小。对每行兼容概率 r i = ∑ j a i j p j > 0 的候选 p ,记 g j = ∑ i a i j / r i 。因为 ∑ j p j g j = n ,负对数似然的凸性与一阶支撑不等式 公理库 凸函数 Convex function 函数在任意凸组合处不超过相同权重下函数值的凸组合。 给出对任意单纯形中的 q ,
ℓ ( q ) − ℓ ( p ) ≤ g T ( q − p ) ≤ max j g j − n . 当某行在 q 下概率为零时,左侧为 − ∞ ,不等式仍成立。因此 max j g j − n 是可计算的全局对数似然差上界;它为零便认证全局最优,不需要从 EM 的单调性推断已经找到最大值。若开始把某个必要支持质量设为零,乘法更新永远无法使其复活。临近边界时 EM 也可能很慢。
直觉
一次检查未发现故障,下一次发现故障,只能确定事件发生在两次检查之间。把事件都放到第二次检查日,会怎样改变估计?Turnbull 方法保留整个可能区间,用区间概率构造非参数似然。
例子与边界
三个区间的实际更新
观察区间是 ( 0 , 2 ] 、( 1 , 3 ] 和 ( 2 , 3 ] 。先用三个端点单元 ( 0 , 1 ] 、( 1 , 2 ] 、( 2 , 3 ] ,赋质量 ( 1 / 3 , 1 / 3 , 1 / 3 ) 。三人的兼容质量分别为 2 / 3 , 2 / 3 , 1 / 3 。
条件分摊依次为 ( 1 / 2 , 1 / 2 , 0 ) 、( 0 , 1 / 2 , 1 / 2 ) 和 ( 0 , 0 , 1 ) 。平均后得到 ( 1 / 6 , 1 / 3 , 1 / 2 ) 。初始似然为 ( 2 / 3 ) ( 2 / 3 ) ( 1 / 3 ) = 4 / 27 ;更新后为 ( 1 / 2 ) ( 5 / 6 ) ( 1 / 2 ) = 5 / 24 ,确实增加。
可以直接检查最优解:把第一单元质量移到第二单元不会减少任何观测概率,因此最优时可取 p 1 = 0 。余下似然为 p 2 p 3 ,在 p 2 + p 3 = 1 下由 p 2 = p 3 = 1 / 2 最大化,最大值 1 / 4 。在 p = ( 0 , 1 / 2 , 1 / 2 ) 处,g = ( 2 , 3 , 3 ) ,上面的差界为零,给出同一个最优性证书。第一、二人仍没有被人为指定一个精确事件时刻。
边界与反例
若同一组人实际上都在 1.1 发生事件,但下一次检查统一在 2 ,以检查日套用 KM 就会把事件推迟到 2 。增加样本量不会消除这种时间分辨率错误。区间似然只承认 ( 1 , 2 ] 内发生,符合观察所能支持的精度。
若因症状恶化而提前检查,检查过程可能与潜在事件有关。此时“区间已经记录下来”并不足以使检查机制可忽略,需要额外模型或设计论证。
推论与应用
此方法是最大似然 公理库 最大似然估计 Maximum likelihood estimation · MLE 在参数空间内选择使已观测数据似然达到上确界的参数估计方法。 在不完整事件时间上的具体实现。输出图上的阶梯位置应配合可识别区间解释;看上去精细的画线不能替代资料没有提供的时间信息。
参考资料