“分层二元资料还有另一种问题:在明确的独立Bernoulli联合模型下,固定每层总成功数,以条件logistic似然消去层截距。它比较层内允许成功子集的相对权重,不能从GEE的边际均值与工作相…”
分层二元资料中,每层可能有自己的基准发生率,而我们关心的是层内协变量怎样改变成功优势。条件logistic回归保留每层已经观察到的成功总数,只比较这些成功出现在哪些成员上。这样可以严格消去层截距,代价是总数本身携带的信息也不再进入条件似然。
形式陈述
概率来自哪一个模型
固定J个层的全部协变量
共同斜率β∈R^d是目标,J个有限实数α_j是层截距。令
将一层的成功成员集合记为A。给定|A|=m_j,其质量是
这是一个有限子集上的概率分布,C_j是其归一化常数。给定各层总数后,各层仍相互独立,所以条件对数似然为
截距为何消失
在式(1)下,一层完整0–1向量的质量为
固定
条件化并没有估计α_j,也没有证明它们相等。它构造了一个不再含α_j的概率实验;目标是这个实验中的共同β。
得分、信息和可识别方向
有限支持允许直接逐项求导。由得分与信息的定义,
例如
某个方向v没有信息,当且仅当对每个层,
直觉
以每层两人为例,只保留恰有一人成为成功者的层。层截距可以同时把两人的发生概率推高或压低,却不会改变两种允许标记“第一人成功”和“第二人成功”的相对权重。相对权重只剩协变量差与β。
当一层有四个人、两个成功时,允许结果不是两次互不相关的选择,而是六个二人子集。成功总数固定,会使成员的成功指示相关;这正是归一化常数需要对所有合法子集求和的原因。
条件于总数以后,原来判断整层“为何多发或少发”的资料被放下了。因此共同斜率的条件推断与绝对发生率预测是不同任务。若要预测某层的实际成功概率,仍需关于截距和抽样机制的额外信息。
例子与边界
一成功配对:只有协变量差进入似然
取n_j=2、m_j=1。把该层观察到的成功者标为第一人,定义
因此该层对式(3)的贡献为
得分严格递减,在β→−∞时趋3,在β→∞时趋−1,故只有一个有限根。令z=e^β>0,根满足
正负差值共同阻止系数逃向一端。如果三层差值改成1、2、1,每项都会随β增加,条件似然仍然没有有限极大点。消去截距并不会自动消除分离造成的存在性问题。
二成功、四候选:核全部子集
现在只有一层,n=4、m=2,单个协变量为0、1、2、3。取β=log2,则各成员的权重
| 所选协变量 | T | 权重 |
|---|---|---|
| 0、1 | 1 | 2 |
| 0、2 | 2 | 4 |
| 0、3 | 3 | 8 |
| 1、2 | 3 | 8 |
| 1、3 | 4 | 16 |
| 2、3 | 5 | 32 |
总权重C=70。若观察到0与3成功,则该完整标记的概率为8/70=4/35;统计量T=3的概率却是16/70,因为另一个子集也给T=3。似然定义在原标记上,求T的分布时要合并所有产生同一T的结果。
直接求和给
负得分表示在这一观察下,从β=log2向较小β移动会提高条件似然。方差严格正,说明这层对该斜率确有局部信息。
哪些层和方向没有信息
m_j=0时只有空子集,m_j=n_j时只有全体子集;两种情况下式(2)都等于1,式(3)贡献0,式(4)贡献零矩阵。这些层没有条件斜率信息,并不是原始资料完全没有关于发生率的信息。
若给同一层所有协变量加同一个向量c_j,则每个允许T都增加m_jc_j,分子分母共同乘
即使原始含层指标的设计矩阵满秩,剩余条件差值也可能全零。例如两层各有两人:第一层的协变量为(0,0)、响应为(0,1),第二层的协变量为(0,1)、响应为(0,0)。以两列层指标和一列协变量组成设计,出现(1,0,0)、(0,1,0)、(0,1,1)三条线性独立的行,故原设计满列秩。但第二层总成功数为0,没有条件信息;第一层的两种允许结果各有1/2概率,也与β无关。对原设计做一次秩检查,不能替代式(4)中的条件信息检查。
相关配对和抽样标签不是自动许可证
本页从给定设计的独立Bernoulli模型推导式(2)。若实际层内存在未建模的依赖,只知道各人的边际logit满足式(1),并不能推出同一条件似然;不同联合分布可以有相同边际,却给不同的子集概率。
同样,把资料称为“配对”或“病例—对照”还不足以证明式(2)。在回顾性抽样下复用该似然,需要另给样本选择概率及消去相关因子的论证。随机试验中按设计交换标签的概率,则来自另一种随机机制;不能将其无条件换成由β控制的式(2)。
推论与应用
归一化不用枚举所有组合
对一层省略j下标,令
中z^m的系数。使用动态规划,定义E_{k,r}为前k人中选r人的总权重,初始化E_{0,0}=1,其余非法状态为0,递推
第一项不选第k人,第二项选它;两类互斥且覆盖所有子集,因此递推精确。只需保留r=0,…,m。原地更新时r必须从大到小,才能使右端读到加入第k人之前的状态。最后C=E_{n,m}。
在四候选例中,截到r=2的状态依次为
一次归一化需要O(n(m+1))次加乘、O(m+1)存储,而直接枚举需要处理
同一递推也算得分与信息
为每个状态同时维护未归一化的一阶向量M与二阶矩阵R:它们分别为该状态中各子集的“权重乘T”之和与“权重乘TT^T”之和。初始M、R全零。加入第k人时,记上一行r−1状态为
这些式子只是在选中第k人时将T换成T+x_k并展开外积。最终
大权重时不能直接依赖浮点乘积。可以对全部状态Z、M、R做共同的正比例缩放并累计对数因子,或用对数权重与稳定的归一化计算;缩放必须同时作用于三种状态,才保持矩比值。极端条件下还应检查方差的非负性与舍入误差。
把各层结果相加便得到式(3)、(4)。若条件信息正定,可解
参考资料
- Sean X. Chen and Jun S. Liu,Statistical Applications of the Poisson-Binomial and Conditional Bernoulli Distributions,Statistica Sinica 7,1997,pp.875–892,§2与§3.1;条件Bernoulli权重、组合递推与logistic条件化。
- Alan Agresti,A Survey of Exact Inference for Contingency Tables,Statistical Science 7(1),1992,pp.131–153,§5;通过条件化处理logistic干扰参数,以及条件样本空间的限制。