识别与选择终点:补全世界、截尾人群和偏差阈值
先读部分识别理路部分识别与可达锐界Partial identification and sharp bounds · Identified set · Manski bounded-outcome bounds从完整观测律的相容补全出发构造识别集合,证明缺失均值与无交换性ATE的可达端点,并将识别宽度与有限样本覆盖分开。、Lee选择界理路Lee 选择界与分数截尾Lee selection bounds · Lee trimming bounds · 单调选择下的锐界在随机处理和单调选择下,对始终可见人群的平均效应给出可达截尾界,保留原子分数质量,并推导条件化后的正确人群权重。和配对敏感性分析理路Rosenbaum 配对敏感性分析Rosenbaum matched-pair sensitivity analysis · Gamma sensitivity bounds · 配对隐蔽偏差界对独立匹配对的未知处理概率施加Gamma限制,证明非负固定权重单侧尾的可达最坏界,构造有效p值和精确卷积,并分清双侧与恒定效应反演的责任。。返回识别与选择学习路线。下载精确复算程序及结果JSON。
四项任务各自指定概率来自哪里。前三项先把观测总体律当成已知,求所有相容世界;第四项固定潜在结果,改变允许的分配律。除明确加入IID抽样的步骤外,数值界都不是置信区间。
任务一:不同人群拥有不同的已知支持
输入与要求
协变量对所有人可见,、。时结果的已知支持是,回答率;时支持是,回答率。两层所有回答者的结果均为一,不对未回答者作任何独立性假设。
求完整总体均值的锐界,给出端点完整律;再说明为什么先忘掉、只使用共同支持会丢失信息。
完整答案
层内均值区间分别为和,按原总体层权重平均得
可以用十二份等质量类型核验:四份属于,两份可见且为一、两份缺失;八份属于,六份可见且为一、两份缺失。下端把四份缺失都填零,总和八、均值;上端把第一层两份填一、第二层两份填四,总和十八、均值。两份世界保留同一个完整观测律,混合给每个中间均值。
忘掉后,总回答率为,。只用共同支持得到。被丢掉的约束是第一层未回答者不可能取四:无条件上端试图把这部分人也填成四,因此不能与原来已知支持同时成立。
再加入有限样本保护
现在设独立同分布抽取条,在每条记录中按自己的已知支持计算和。两者都在中,故给出
以至少的概率含住整个真实识别集合。这一保证针对随机样本;上面的十二类型是总体构造,不是恰好抽到十二人就自动取得某个置信水平。
若某份的样本恰有,取时只需按此公式增加抽样保护,不能把识别宽度也除以。
做任务二前,可先回顾条件分布:截尾使用的是处理组可见者内部归一化后的结果分布,并非这些人在原总体中的质量。恢复完整潜在人群时,要把两种质量分清;任务三还会在始终可见人群内部重新计算层权重。
任务二:从截尾质量恢复完整潜在人群
输入与要求
处理随机,,选择向上单调。处理可见分布为结果零、二、六各占;对照可见结果恒为一。先求界,再把低端和高端各写成总体类型质量表,核全部观测分布。
完整答案
始终可见、仅处理可见、从不可见的总体质量为。处理可见者中保留,两端均须把结果二的原子分开。
低端世界的非零质量为
| 类型 |
|
|
总体质量 |
|
0 |
1 |
|
|
2 |
1 |
|
|
2 |
任选0 |
|
|
6 |
任选0 |
|
|
任选0 |
任选0 |
|
高端世界把第一行的处理结果零换为六,同时把的六换为零,其余行不变。两张表的处理可见总体质量均为:零、二、六;除以就恢复指定分布。对照可见者都来自,总质量且结果为一。
在内归一化,低端处理均值为,高端为,所以效应界为。表格给出同时满足所有要求的端点世界,比只报两个截尾均值多完成了一步锐性认证。
如果保留全部,保留比例变成,而始终可见者实际只占。这份错误方案在可见样本上似乎容易执行,却不再满足潜在人群的质量合同。
改变选择方向
现在换一个独立实验:假设,。处理可见结果恒为四,对照可见分布改为刚才的零、二、六三点分布。应截尾对照,得到,所以
若直接沿用“截处理、减对照”的原公式,会针对错误的混合物;若相减时不交换上下端,又会写出倒置的区间。
任务三:正确的层权重能识别出正方向
输入与要求
两个处理前层各占一半,处理与及全部潜在量独立,选择向上单调。
- :;处理可见结果零、二各占一半,对照可见结果恒零
- :;处理结果恒十,对照结果恒九
求始终可见人群的锐界。再忘掉算粗Lee界,找出信息丢失在哪里。
完整答案
第一层保留一半处理分布,所以层内效应界;第二层没有选择变化,效应为一。始终可见者的两层总体质量为,归一化权重为,因此
不要按原总体权重各一半平均,那会得到,对应错误的目标人群构成。
忘掉后,处理分布为
对照可见均值为。低端保留:零、二、十,得到均值四;高端保留十和二,得到均值。所以粗界为
粗下端试图把一半的结果十排除出,但结果十所在的第二层始终全部可见,任何这种排除都违反已知层内选择率。条件化后这些相容世界被删掉,负效应不再可能。这是人口识别信息的加强,不是多做一次回归让标准误变小。
端点同样可构造:第二层不动;第一层从零或二中选择恰好一半作为,剩余半数作为仅处理可见者。按两层总体权重混合,即分别达到式(1)两端。
任务四:并列、零差和候选效应必须一起更新
输入与要求
四个固定匹配对的处理减对照差为。每对独立,处理概率满足同一个限制。检验逐人恒定效应候选,使用调整差的符号计数:删除零差,每个非零差权重一,大值更反对候选。分别计算、、、、、和的精确最坏上尾。
完整答案
令,非零对数为,正差数为。每个候选重新读取调整差,得到
| 候选位置 |
|
|
|
|
4 |
4 |
|
|
3 |
3 |
|
|
4 |
3 |
|
|
2 |
1 |
|
|
4 |
1 |
|
|
3 |
0 |
1 |
|
4 |
0 |
1 |
在时,七个值依次为
取教学水平,按拒绝,接受集合是。零处的对被删除,使从左侧的跳到,所以端点零保留。网格若没单独检查零,就可能误报开区间。
在真实表上检查覆盖,而不只检查一个观察
固定每对两人的基线分别为,其中,真实恒定效应为零。上面给出的观察对应所有非零对中较高结果者处理。现在改变所有种分配,保持潜在表不变。
在真候选零处,始终只有三个非零对。即使三者全为正,最坏p值也为,所以对这张真实表,该单侧反演程序在下总保留零,实际覆盖为一。理论保证是至少,离散程序没有必须用尽错误预算。
若换为权重和观察正和七,精确卷积给;用全部端点概率向量枚举可独立核验极值。若改成双侧绝对统计量,则尾事件不再逐坐标递增,必须重新优化;不能把同一个当作任意双侧答案。
提交检查
提交每个端点完整律或分配律,核它保持全部观测质量和假设;说明目标人群、总体还是有限表、概率源及原子处理。公开程序枚举有理补全、全部截尾顶点与隐藏分配角点,并与排序算法、卷积和候选断点交叉核验。有限枚举补充正文的一般证明,没有把有限测试提升为对任意总体律的证明。