“基准率谬误来自只看 $\mathbb P(B\mid A)$,忽略 $\mathbb P(A)$ 与替代原因。筛查、告警和异常检测面对的阳性样本往往混合了真阳性与大量背景误报;灵敏度再高,也…”
形式陈述 ​
设
其中
直觉
检测结果从来不是脱离人群背景的孤立结论。阳性人群由两股来源汇成:一股是真患病且被测出的人,另一股是健康却被误报的人;当目标状态罕见时,健康人的基数非常大,第二股的绝对人数即使只占很低比例,也可能压过第一股。因此诊断推断不能只盯着灵敏度、特异度或笼统的“准确率”,还必须把先验患病率纳入计算。后验概率回答的是“我在阳性人群中属于哪一股”,所以
例子与边界
取患病率
远低于直觉中的
同一计算也可用赔率看得更紧凑:先验赔率为
结论对输入高度敏感,而输入必须来自与被检者匹配的人群:无症状普查人群与因症状就医人群的
推论与应用
这个二状态基率计算是Bayesian 统计模型的一个有限状态实例:先验、诊断条件分布与观测共同定义联合律,后验则是该联合律给出的条件分布。若要从概率更新走到治疗、复检或放弃检查,还必须加入行动空间与损失,并在后验下比较行动,见Bayes 估计量与后验风险。因此后验疾病概率本身不会自动决定治疗阈值,也不能替代模型失配和选择偏差审计。
在这一模型层次内,Bayes 定理给出后验更新公式,条件概率则澄清灵敏度
诊断指标能否跨人群搬用,是另一个独立边界。灵敏度与特异度在目标定义、检测阈值和实施条件固定时,不会像预测值那样仅因先验改变就发生代数变化,却仍可能随人群疾病谱与选择机制漂移;阳性、阴性预测值则必须针对具体人群重新计算,不能直接从检测说明书抄取。
参考资料
- David J. C. MacKay, Information Theory, Inference, and Learning Algorithms, Cambridge University Press, 2003, Chapter 3.
- Howard Raiffa and Robert Schlaifer, Applied Statistical Decision Theory, Harvard University, 1961, Chapter 1.