Skip to content

贝叶斯诊断推断

Bayesian diagnostic inference · Diagnostic testing

把患病率、检测灵敏度和假阳性率组合为观察结果后的后验风险。

条目类型
应用

形式陈述

D 表示待判定的目标状态(如患病),+ 表示检测阳性。诊断推断的三个输入是:患病率(先验)P(D)、灵敏度 P(+D),以及假阳性率 P(+¬D)(等于 1 减特异度)。由 Bayes 定理的划分形式,阳性结果后的后验概率(阳性预测值)为

P(D+)=P(+D)P(D)P(+D)P(D)+P(+¬D)P(¬D),

其中 P(¬D)=1P(D)。对阴性结果同理可写出 P(D),只需把两个似然分别换成 1P(+D)1P(+¬D)

直觉

检测结果从来不是脱离人群背景的孤立结论。阳性人群由两股来源汇成:一股是真患病且被测出的人,另一股是健康却被误报的人;当目标状态罕见时,健康人的基数非常大,第二股的绝对人数即使只占很低比例,也可能压过第一股。因此诊断推断不能只盯着灵敏度、特异度或笼统的“准确率”,还必须把先验患病率纳入计算。后验概率回答的是“我在阳性人群中属于哪一股”,所以 P(+D) 表示检测对患病者有多灵敏,P(D+) 才表示阳性者实际患病的概率,两者方向绝不能互换。用赔率表达时,Bayes 更新就是“先验赔率乘以证据的似然比”;这也解释了为什么罕见疾病即使配上高灵敏度、高特异度的检测,仍可能因假阳性基数庞大而得到不高的阳性预测值。

例子与边界

取患病率 1%、灵敏度 99%、假阳性率 5%,用自然频数最容易算清:设想 10000 人接受筛查,约 100 人患病,其中约 99 人呈阳性;9900 名健康者中约 495 人被误报。阳性者合计约 594 人,真正患病的比例为

P(D+)=9999+49516.7%,

远低于直觉中的 99%。同一组数据里,阴性者约 9406 人而漏诊只约 1 人,阴性预测值超过 99.9%:这类检测"排除疾病"的能力远强于"确诊"的能力。

同一计算也可用赔率看得更紧凑:先验赔率为 1:99,阳性似然比为 0.99/0.05=19.8,所以后验赔率为 19.8:99=1:5,换回概率正是约 16.7%。赔率写法在连续纳入多条证据时尤其方便,但每次相乘似然比仍要求相应的条件独立假设。

结论对输入高度敏感,而输入必须来自与被检者匹配的人群:无症状普查人群与因症状就医人群的 P(D) 可以相差一个数量级,同一份阳性报告的含义随之完全不同。重复检测时把多次阳性当作独立证据连乘似然,只有当"给定病情状态后各次结果条件独立"成立才合法;由同一机制引起的系统性误报(如交叉反应)会让这种连乘严重高估风险。此外,计算给出的只是概率更新,不是临床决策:行动还需叠加两类错误的代价与后续确认检查的成本。

推论与应用

这个二状态基率计算是Bayesian 统计模型的一个有限状态实例:先验、诊断条件分布与观测共同定义联合律,后验则是该联合律给出的条件分布。若要从概率更新走到治疗、复检或放弃检查,还必须加入行动空间与损失,并在后验下比较行动,见Bayes 估计量与后验风险。因此后验疾病概率本身不会自动决定治疗阈值,也不能替代模型失配和选择偏差审计。

在这一模型层次内,Bayes 定理给出后验更新公式,条件概率则澄清灵敏度 P(+D) 与预测值 P(D+) 的方向差别;同一套基率校正远不止用于医学筛查。垃圾邮件过滤中“包含某关键词”扮演阳性证据,运维故障告警、安检报警、取证 DNA 匹配和序贯试验也都对应同一张表:先验来自目标在人群或样本中的基数,似然来自设备或模型的混淆行为。串行处理多条证据时,可以把上一轮后验作为下一轮先验;若再假设各证据在给定真实状态后相互独立,便得到朴素 Bayes 分类器一类可扩展推断器,但该假设失真会让结果系统性地过度自信。

诊断指标能否跨人群搬用,是另一个独立边界。灵敏度与特异度在目标定义、检测阈值和实施条件固定时,不会像预测值那样仅因先验改变就发生代数变化,却仍可能随人群疾病谱与选择机制漂移;阳性、阴性预测值则必须针对具体人群重新计算,不能直接从检测说明书抄取。

参考资料
  • David J. C. MacKay, Information Theory, Inference, and Learning Algorithms, Cambridge University Press, 2003, Chapter 3.
  • Howard Raiffa and Robert Schlaifer, Applied Statistical Decision Theory, Harvard University, 1961, Chapter 1.
关系图谱1 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:使用

类型化关系

使用的工具