“统计学中,$X {(k)}$ 本身是统计量;在 iid 连续模型下,其抽样分布由 $F(X {(k)})$ 的 Beta 律刻画。样本中位数、极值和分位数的统计误差取决于总体密度与样本机制,…”
对象 ​
事件时间
累积风险
且
右删失观察
观测 likelihood 与识别条件 ​
在独立右删失下,单个观测
乘删失分布部分。若删失与事件条件独立,关于事件模型的 likelihood 可忽略删失因子;informative censoring 时该分解不成立。
hazard 与 survival 的关系来自
积分后得到
Kaplan–Meier ​
在事件时刻
每个因子估计条件生存概率,连乘重建整体生存。删失只在其后减少 risk set,不在删失时刻制造生存下降。
若事件时刻依次为
Greenwood 近似方差为
常对
例子 ​
若事件时刻风险集/事件数为
边界 ​
informative censoring 会偏倚 KM:病情恶化者更易失访时,独立删失不成立。竞争风险中把其他事件当普通删失会把 cause-specific 生存误作实际累计发生率。
左截断对象只有在进入研究后才可观察,risk set 必须要求已进入且尚未失败;把它当普通右删失会产生 immortal-time bias。
hazard ratio 不是生存概率比。比例风险失效时,Cox 单一系数只是加权平均效应,需查看时间交互或 restricted mean survival time。
最后事件后若只剩删失,尾部生存无法识别;中位生存可能“未达到”,不能外推为无限。ties 与左截断需相应 risk-set 规则。
KM 比较的是边缘曲线,不能自动调整混杂。观察研究中的组差需要协变量模型与因果识别条件。
应用 ​
Greenwood 公式估计 KM 方差;log-rank 比较组间 hazard;Cox 模型引入协变量。各自需要比例风险或删失条件,不能仅由 KM 定义推出。
Nelson–Aalen 累积风险估计
与 KM 满足
log-rank 检验在每个事件时刻比较观察与按 risk set 比例期望的组事件数,再按协方差标准化。它对 proportional hazards 型偏离较敏感;生存曲线交叉时正负差可能抵消,应预先选择 weighted log-rank 或 RMST 目标。
Kaplan–Meier 中位数定义为曲线首次不高于
competing risks 下,cause-specific hazard 可分别建模,但累计发生率
同时依赖所有原因 hazard。把其他原因删失后用
time-dependent covariates 必须只使用时刻
参考资料
- Edward Kaplan and Paul Meier, “Nonparametric Estimation from Incomplete Observations,” JASA 53, 1958。
- John Klein and Melvin Moeschberger, Survival Analysis, 2nd ed., Springer, 2003。
- Per Kragh Andersen et al., Statistical Models Based on Counting Processes, Springer, 1993。