形式陈述
随机分配以后,留下来的人仍可能不同
某项培训随机分配给求职者。我们希望比较工资,但只有找到工作的人才有工资记录。若培训提高了就业率,处理组中的有工资者就包含一批“只有接受培训才就业”的人,而对照组没有对应人群。随机化保证分配前可比,却不能保证按就业筛选后仍可比。
Lee界先明确一个可以在两个世界比较的目标:无论是否处理,结果都可见的人。它不要求认出每个具体的人,而是从两组可见比例推断这个人群在混合物中的份额。
采用潜在结果理路潜在结果框架Potential outcomes framework · Rubin causal model用同一单位在各个明确干预下的潜在结果定义因果效应,并把观测机制与科学目标分离。和潜在选择指标。处理满足,观察
假定
第二项是选择单调性,不是结果单调性:允许个体的处理效应正负不一。令,要求。定义始终可见事件,目标为
假定两组可见结果的绝对一阶矩有限。令为的条件分布理路条件分布Conditional distribution · Regular conditional distribution给定观测值后随机量的概率律,以及它与原联合分布相容的核表示。,,保留比例为
从中保留恰好的概率质量,最低份额的均值记为,最高份额的均值记为。允许在并列值处保留一部分质量。则的锐识别集合理路部分识别与可达锐界Partial identification and sharp bounds · Identified set · Manski bounded-outcome bounds从完整观测律的相容补全出发构造识别集合,证明缺失均值与无交换性ATE的可达端点,并将识别宽度与有限样本覆盖分开。恰为
直觉
三种潜在人群与一份混合分布
式(1)只允许三种类型:始终可见、仅处理后可见、始终不可见。它们的总体质量依次为
所以对照组可见者全是;处理组可见者中,占。若分别为这两类人的处理结果分布,则
我们知道混合分布和份额,但不知道哪部分属于。让最低的份额属于,就把的处理均值压到最小;让最高份额属于,则推到最大。这是求相容人群,不是说应把实际数据中某些人的结果永久删除。
有原子时怎样“恰好保留”
先看。取下分位阈值,则
全部保留,在处只保留缺少的质量。因此
上端取,全部保留,再从阈值原子中补足,得到
若阈值处没有原子,需要补的质量为零。这些公式允许负结果和无界支持,只要求绝对可积。单列为,不必把无穷分位端点代进公式。
为什么任何其他保留方式都不会越界
任一相容的分配可写为保留概率,其中、。它的处理均值为。
令表示刚才的低端保留规则。对每个都有
因为以下,两个因子都非正;以上,两个因子都非负;在处乘积为零。积分并使用,便有
高端规则同理给反向不等式。这个证明同时涵盖连续值、并列原子和分数保留,并没有假设数据无并列。
如何造出达到端点的完整世界
给定任一合法,在总体中先按生成三种选择类型。在中令的分布为,在仅处理可见类型中令它的分布为;后者只在时需要。令中的具有观察到的对照可见分布,与其如何耦合可任选,因为这里目标只用边缘均值。其余从未可见的潜在结果任选可积值。
最后独立产生。这份完整律满足随机化与单调性,恢复全部观测律,并达到指定的效应。取、就得到两端;对两个规则作凸混合仍满足,给出每个内部值。于是式(4)确实是锐界。
例子与边界
截到一个原子的中间
设,故。处理组可见结果分布为
低端先取全部的零,再从结果二处取的质量。高端先取全部的六,再从二处取同样的。因此
处理可见者均值为,粗差为,位于界内,却没有被点识别为始终可见人群的效应。若低端直接保留所有,保留了而非,得到均值;这是另一种份额,不能替代。
图中每列高度是概率质量,取样界线穿过并列原子是数学上必要的分数分配;并不是把一个人的实际结果改小。
选择率相等,仍需单调性
在单调性下,若,则非负变量的期望为零,因而它几乎处处为零。两臂可见者对应同一潜在人群,,界缩成均值差。
去掉单调性,选择率相等却可能由反向转换抵消。构造四个各占的类型:始终可见者有;仅对照可见者有;仅处理可见者有;另有始终不可见者。随机化后,两臂可见均值分别为一和四,粗差为三,但始终可见者真实效应为零。表面的只是一条必要的边缘检查,不证明逐人的单调性。
方向、空人群和目标不能混淆
若合理假设是,应截尾对照可见分布,保留;处理可见均值已经属于。若对照截尾均值为,效应界是,相减会交换上下端。
若且假设,则,式(2)的条件效应没有定义,不能报告一个“无限宽Lee区间”。若总体,则它与所声明的向上单调模型矛盾;有限样本估计率逆序则可能只是抽样波动,需要另行推断,不能擅自交换处理标签。
本页目标不是整个总体ATE,也不是实际处理组全部可见者的效应。支持无界时仍可约束的均值,恰是因为这个人群的两份潜在结果都在相应可见混合物中,而非因为未见者的结果被设成零。
推论与应用
先在层内截尾,再用目标人群权重平均
设处理前协变量取有限多个值,,各层处理概率在零与一之间。将式(1)的独立性改为给定的条件独立,保留全体的选择单调性。写,假定。每层得到,但总体目标不是按简单平均。
由全期望公式理路全期望公式与全方差公式Law of total expectation · Law of total variance · Iterated expectation借助条件信息分解总体均值,并把总波动拆成组内与组间两部分。和Bayes公式,始终可见者中的层权重为
所以准确界为
每层可独立选择达到端点的完整律,再以混合并按各层既定概率分配处理,证明两端同时可达。若某层,它在目标中权重为零,应排除这一未定义条件效应;只需总分母为正。
若处理还独立于,不使用的总体Lee界也有效。加入全部层内限制只会删去相容律,因此条件化界不会更宽。若分配率本身随改变,直接混合两臂不能继续声称无条件随机化,比较粗界前须重新检查这一前提。
有限分布的可执行算法
对支持点及概率,从低端累加质量,最后一个点只取剩余所需质量;从高端反向做一次。排序需比较,排好序后各做次运算,输出保留质量向量,并检查
这三个等式和不等式构成可独立核验的截尾证书。原子概率为有理数时可全程精确计算。将经验频率代入可得到估计的界,但它本身不是置信区间;估计选择率、分位点及边界时的抽样误差需要独立处理,本页不把人口层面的锐性冒称有限样本覆盖。
参考资料