形式陈述
把“也许有遗漏变量”变成一个可计算的问题
观察研究中,两人即使年龄、职业等已测条件相似,也未必有相同的处理机会。若较容易出现高结果的人更可能接受处理,正差就可能来自选择。敏感性分析不宣称找到这个遗漏变量,而是问:允许处理机会偏离公平分配到什么程度,原来的证据还保得住?
固定I 个不重叠匹配对,每对恰有一人处理。所有潜在结果和匹配名册固定,无干扰,概率只来自处理分配。检验逐人无效应的尖锐假设 理路 Fisher 尖锐零假设随机化检验 Fisher randomization test · Sharp null randomization test 把潜在结果固定、处理分配作为唯一随机源,在尖锐零假设下补全反事实,按已知分配概率计算加权尾部,并辨明平均效应零假设的边界。 ,因此每个人在两种处理下的结果都相同,可以从观察补全。
对第i 对,令Z i = 1 表示名册中的第一人处理。假定不同对的Z i 独立,且给定完整潜在表与协变量后,其未知概率π i 满足
(1) 1 Γ ≤ π i 1 − π i ≤ Γ , Γ ≥ 1. 等价地,π i ∈ [ l , h ] ,其中l = 1 / ( 1 + Γ ) 、h = Γ / ( 1 + Γ ) 。这里每对已限定恰有一人处理,π i / ( 1 − π i ) 是“第一人处理”相对于“第二人处理”的概率比,不是再对两人的条件odds作一次比值。
令d i 为实际处理者减对照者的差。对非零差取B i = 1 { d i > 0 } ;零差的权重规定为零。统计量为
(2) T = ∑ i = 1 I q i B i , q i ≥ 0. 权重可以是事前常数,或由全部绝对差决定的规则,但必须在尖锐假设下对每种对内交换保持不变。符号计数取q i = 1 ,符号秩取非零绝对差的秩,并列可用平均秩。
由于哪个人有较高固定结果也固定,B i 是成功概率仍在[ l , h ] 内的独立Bernoulli变量 理路 Bernoulli 随机变量 Bernoulli random variable 只取 0 与 1 且成功概率为 p 的基本随机变量。 。对观察值t ,定义
p Γ − ( t ) = P { ∑ i q i V i − ≥ t } , V i − ∼ iid Bernoulli ( l ) , (3) p Γ + ( t ) = P { ∑ i q i V i + ≥ t } , V i + ∼ iid Bernoulli ( h ) . 则允许模型中实际单侧尾概率的最小、最大值恰为这两端。尤其p Γ + ( T ) 是对全部允许分配律都有效的p值上界,按p Γ + ≤ α 拒绝的错误概率至多α 。
直觉
同一组均匀数把所有分配放到一起
设U i 是独立Uniform ( 0 , 1 ) 。在同一概率空间上构造
V i − = 1 { U i ≤ l } , B i = 1 { U i ≤ ρ i } , V i + = 1 { U i ≤ h } , l ≤ ρ i ≤ h . 逐项有V i − ≤ B i ≤ V i + 。非负权重使两个和也保持这个次序,故对每个阈值t 都有式(3)的尾界。这是共同概率空间的耦合 理路 耦合法 Coupling method · Probability coupling 在共同概率空间中构造具有指定边缘的随机变量,并用它们相遇的概率比较分布。 :不是只比较均值,而是让每一份实现都被上下夹住。
端点可以达到。令每对较高固定结果者都以概率h 接受处理,并使各对独立,便得到上端分配;全用l 得到下端。模型没有另外限制隐藏协变量与潜在结果的关系,因此不能排除这种最不利排列。若另加限制,界可能收窄,但那已是更小的模型。
为什么最坏尾仍是有效p值
对某一真实允许概率向量ρ ,其真实尾函数记为p ρ ( t ) 。旧Fisher页的离散尾部论证给出
P ρ { p ρ ( T ) ≤ α } ≤ α . 又因对每个t 都有p Γ + ( t ) ≥ p ρ ( t ) ,事件{ p Γ + ( T ) ≤ α } 包含于{ p ρ ( T ) ≤ α } ,有效性随之成立。并列仍全部计入“≥ ”,没有把一半并列质量删掉。
下端p Γ − 表示“最乐观的允许尾”,通常不能用于保证对全部模型有效的拒绝规则。报告一段尾概率范围时,应清楚指出稳健拒绝使用的是哪一端。
Gamma限制的是分配,不是效应大小
一种产生式(1)的模型是:匹配前两人的处理指示独立,处理odds为exp ( λ i + γ u i j ) ,其中0 ≤ u i j ≤ 1 、γ = log Γ 。条件于每对恰好一人处理后,第一人相对第二人的概率比为
exp { γ ( u i 1 − u i 2 ) } ∈ [ 1 / Γ , Γ ] . 共同的λ i 消去。因此Γ = 2 在这里允许一人的处理机会是另一人的两倍,条件概率最多为2 / 3 ;它不表示处理效应放大两倍,也不是“存在混杂的概率”。实际匹配程序是否支持条件独立模型仍需论证,匹配动作本身不会自动生成式(1)。
例子与边界
六个正差能承受多大的偏差
六对非零差全部为正,使用符号计数,观察T = 6 。达到至少六只能是六次全成功,所以
p Γ + = ( Γ 1 + Γ ) 6 . 在Γ = 1 , 3 / 2 , 2 时,它依次为
1 64 , 729 15625 , 64 729 . 前两者不超过0.05,第三者超过。临界偏差可以精确写为
(4) Γ ∗ = ( 1 / 20 ) 1 / 6 1 − ( 1 / 20 ) 1 / 6 . 按“p不超过0.05就拒绝”的约定,Γ = Γ ∗ 处仍拒绝。这个数描述当前统计量、当前资料与指定模型的稳健程度,不估计真实偏差,也不说明所有同样大小的研究都如此。
不等权重与并列仍可精确计算
取固定权重( 1 , 2 , 2 , 3 ) ,观察前三个中的第一项为负,其余为正,所以T = 7 、总权重八。尾事件T ≥ 7 必须包含权重二、二、三,权重一可取可不取。因此
(5) p Γ + ( 7 ) = h 3 , p Γ − ( 7 ) = l 3 . 在Γ = 2 ,范围为[ 1 / 27 , 8 / 27 ] 。重复权重二是两对不同单位,不能合并成一次硬币;只有卷积后相同总和的概率才能相加。
如果先看哪些差为正,再给正差大权重,就破坏了“交换标签后权重不变”。此时把观察权重固定再翻转符号,计算的是一个没有证明的检验。
对间独立和单侧单调性都不能省略
让六个符号完全相同,且以一半概率全正、一半概率全负。每个符号边缘上都是公平币,符合单个概率的Γ = 1 限制,但全正概率为1 / 2 ,而非1 / 64 。对间独立是联合概率模型的一部分,不由每个边缘界推出。
同样,非负权重保证尾事件逐坐标单调;若直接允许负权重,不能统一把所有成功概率调到h 。可以先翻转负权重对应的符号并加入常数,将统计量化为非负权重形式,但必须明确这个变换。
双侧有效不等于双侧最锐
对预先规定的两种相反单侧排序分别计算有效上界p r i g h t + , p l e f t + 。由并集界 理路 并集界 Union bound · Boole 不等式 多个坏事件中至少一个发生的概率,不超过各事件概率之和。 ,
(6) p t w o = min { 1 , 2 min ( p r i g h t + , p l e f t + ) } 是有效双侧p值。两端的最不利分配可能不同,所以不要将它称为某一个共同分配下的精确双侧尾。
例如q = ( 1 , 2 ) 、观察T = 3 ,预先按| T − 3 / 2 | 排序,尾事件为T ∈ { 0 , 3 } 。在Γ = 2 下,其最大概率为
max ρ 1 , ρ 2 ∈ [ 1 / 3 , 2 / 3 ] { ( 1 − ρ 1 ) ( 1 − ρ 2 ) + ρ 1 ρ 2 } = 5 9 . 目标分别对每个概率为仿射函数,最大值可在四个矩形顶点找;同向顶点给5 / 9 ,反向顶点给4 / 9 。式(6)在同一观察上给8 / 9 ,仍有效,但更保守。单侧耦合的答案不能未经推导就搬到非单调的双侧事件。
推论与应用
用卷积得到完整分布
非负整数权重时,令f j ( s ) 为前j 个权重和等于s 的概率,f 0 ( 0 ) = 1 ,其他位置为零。给定成功率h ,有
(7) f j ( s ) = ( 1 − h ) f j − 1 ( s ) + h f j − 1 ( s − q j ) . 越界下标视为零。此动态规划 理路 动态规划 Dynamic programming 在有限或良基的状态依赖上复用已计算结果的算法设计范式。 每次读取上一行,保留两个数组即可。设Q = ∑ q i ,则需O ( I ( Q + 1 ) ) 次算术、O ( Q + 1 ) 概率槽;这是关于权重数值的伪多项式界,不是关于二进制输入长度的多项式界。平均秩为半整数时,可把全部权重和阈值乘二。一般实权重可用完整2 I 符号枚举,不能擅自四舍五入并列。
对有理Γ 使用分数算术可得到精确尾值;分子分母增长的位成本另算。零权重可以直接跳过,因为两条分支落回同一个和,概率相加仍为一。全零时上尾p值为一。
对恒定效应候选重新建立权重
若另假定每个人的效应是同一个常数δ ∗ ,对候选δ 先计算调整差d i − δ 。在该尖锐假设下,调整后的两人基线差只会随标签交换而变号,绝对值及其秩才是固定的。每个候选都要重新确定零差、并列与权重,随后用同一个Γ 模型计算有效p值。
按检验反演 理路 置信集合与检验的对偶 Confidence set and test duality · Test inversion 逐参数反演 level 检验得到覆盖置信集合,并由置信集合反构造点零假设检验。 保留p δ > α 的候选,即得覆盖至少1 − α 的接受集合,前提是恒定效应模型和真实分配的Γ 限制都成立。只在真实候选处使用一次错误率,所以无须因为检查许多候选而额外Bonferroni。若效应异质,不能把这个集合改名为总体平均效应区间。
对于符号计数,候选经过某个d i 时会产生或移除零项,需在断点单独核算。秩权重还会在| d i − δ | = | d j − δ | 处改变。任意有限网格可以演示,却不能独立证明完整接受集合或端点开闭。
参考资料
Paul R. Rosenbaum, “Sensitivity Analysis for m-Estimates, Tests, and Confidence Intervals in Matched Observational Studies”作者全文 , Biometrics 63,456–464,2007,§§2.1–2.2和3.1、式(1)–(4):条件分配模型、配对固定权重与可达尾界。本文用0/1权重和重写其正负和,并给出耦合及有限卷积证明。
Paul R. Rosenbaum, “Sensitivity analysis for certain permutation inferences in matched observational studies” , Biometrika 74(1),13–26,1987。原始方法出处;本页实际全文核对以2007作者稿为准,不使用未取得的1987全文细节。