Skip to content

模型Model

条件logistic回归

Conditional logistic regression · 条件逻辑回归 · Stratified conditional logistic likelihood

固定每层的成功总数后消去logistic层截距,以有限子集分布估计共同斜率,并给出归一化、得分和信息的动态规划。

分层二元资料中,每层可能有自己的基准发生率,而我们关心的是层内协变量怎样改变成功优势。条件logistic回归保留每层已经观察到的成功总数,只比较这些成功出现在哪些成员上。这样可以严格消去层截距,代价是总数本身携带的信息也不再进入条件似然。

形式陈述 ​

概率来自哪一个模型 ​

固定J个层的全部协变量 xij∈Rd,其中1≤i≤n_j、n_j≥1。以Bernoulli–logit模型为起点,假设全部响应在给定设计与参数后相互独立,且

(1)log⁡pij1−pij=αj+xijTβ,Yij∼Bernoulli(pij).

共同斜率β∈R^d是目标,J个有限实数α_j是层截距。令 Mj=∑iYij。本页的条件模型是式(1)在事件 Mj=mj 上的条件分布,0≤m_j≤n_j。有限参数使这些事件都有正概率。

将一层的成功成员集合记为A。给定|A|=m_j,其质量是

(2)Pβ(A∣Mj=mj,Xj)=exp⁡(βTTj(A))Cj(β),Tj(A)=∑i∈Axij,Cj(β)=∑B⊆{1,…,nj}, |B|=mjexp⁡(βTTj(B)).

这是一个有限子集上的概率分布,C_j是其归一化常数。给定各层总数后,各层仍相互独立,所以条件对数似然为

(3)ℓc(β)=∑j{βTTj(Ajobs)−log⁡Cj(β)}.

截距为何消失 ​

在式(1)下,一层完整0–1向量的质量为

Pαj,β(Yj=yj∣Xj)=exp⁡{αj∑iyij+βT∑iyijxij}∏i[1+exp⁡(αj+xijTβ)].

固定 ∑iyij=mj 后,分子中的 eαjmj 与整个分母,对所有允许向量都相同。在条件概率的分子分母中约掉这些因子,就得到式(2)。不同层原本的联合质量是乘积,条件事件也是按层相乘,故条件分布继续分解为各层因子。

条件化并没有估计α_j,也没有证明它们相等。它构造了一个不再含α_j的概率实验;目标是这个实验中的共同β。

得分、信息和可识别方向 ​

有限支持允许直接逐项求导。由得分与信息的定义,

(4)Uc(β)=∇ℓc(β)=∑j{Tj(Ajobs)−EβTj(A)},−∇2ℓc(β)=∑jCovβ(Tj(A)).

例如 ∇Cj=∑BTj(B)eβTTj(B),除以C_j即为期望;再求导便得二阶矩减均值外积。因此ℓ_c是凹函数,但不一定严格凹。

某个方向v没有信息,当且仅当对每个层,vTTj(A) 在该层的全部允许子集上为常数。因为式(2)赋予每个允许子集严格正质量,零方差恰好等于这个逐点常数条件。它也说明为何层内恒定协变量不可识别:每次固定选择m_j人,总贡献不变。

直觉

以每层两人为例,只保留恰有一人成为成功者的层。层截距可以同时把两人的发生概率推高或压低,却不会改变两种允许标记“第一人成功”和“第二人成功”的相对权重。相对权重只剩协变量差与β。

当一层有四个人、两个成功时,允许结果不是两次互不相关的选择,而是六个二人子集。成功总数固定,会使成员的成功指示相关;这正是归一化常数需要对所有合法子集求和的原因。

条件于总数以后,原来判断整层“为何多发或少发”的资料被放下了。因此共同斜率的条件推断与绝对发生率预测是不同任务。若要预测某层的实际成功概率,仍需关于截距和抽样机制的额外信息。

例子与边界

一成功配对:只有协变量差进入似然 ​

取n_j=2、m_j=1。把该层观察到的成功者标为第一人,定义 Δj=x1j−x2j。式(2)给

Pβ(第一人成功∣Mj=1,Xj)=σ(βTΔj).

因此该层对式(3)的贡献为 log⁡σ(βTΔj)。单变量的三层差值取1、2、−1,有

ℓc(β)=log⁡σ(β)+log⁡σ(2β)+log⁡σ(−β),Uc(β)=3−2σ(β)−2σ(2β).

得分严格递减,在β→−∞时趋3,在β→∞时趋−1,故只有一个有限根。令z=e^β>0,根满足

z3−z2−z−3=0,z≈2.1303954348,β^c≈0.7563076126.

正负差值共同阻止系数逃向一端。如果三层差值改成1、2、1,每项都会随β增加,条件似然仍然没有有限极大点。消去截距并不会自动消除分离造成的存在性问题。

二成功、四候选:核全部子集 ​

现在只有一层,n=4、m=2,单个协变量为0、1、2、3。取β=log2,则各成员的权重 wi=eβxi 为1、2、4、8。六个子集、统计量T与未归一化权重为

所选协变量 T 权重
0、1 1 2
0、2 2 4
0、3 3 8
1、2 3 8
1、3 4 16
2、3 5 32

总权重C=70。若观察到0与3成功,则该完整标记的概率为8/70=4/35;统计量T=3的概率却是16/70,因为另一个子集也给T=3。似然定义在原标记上,求T的分布时要合并所有产生同一T的结果。

直接求和给

EβT=14135,VarβT=14341225,Uc(log⁡2)=3−14135=−3635.

负得分表示在这一观察下,从β=log2向较小β移动会提高条件似然。方差严格正,说明这层对该斜率确有局部信息。

哪些层和方向没有信息 ​

m_j=0时只有空子集,m_j=n_j时只有全体子集;两种情况下式(2)都等于1,式(3)贡献0,式(4)贡献零矩阵。这些层没有条件斜率信息,并不是原始资料完全没有关于发生率的信息。

若给同一层所有协变量加同一个向量c_j,则每个允许T都增加m_jc_j,分子分母共同乘 emjβTcj,条件分布不变。由此可在层内中心化协变量,也可看到“层的统一水平”为什么无法由本条件模型识别。

即使原始含层指标的设计矩阵满秩,剩余条件差值也可能全零。例如两层各有两人:第一层的协变量为(0,0)、响应为(0,1),第二层的协变量为(0,1)、响应为(0,0)。以两列层指标和一列协变量组成设计,出现(1,0,0)、(0,1,0)、(0,1,1)三条线性独立的行,故原设计满列秩。但第二层总成功数为0,没有条件信息;第一层的两种允许结果各有1/2概率,也与β无关。对原设计做一次秩检查,不能替代式(4)中的条件信息检查。

相关配对和抽样标签不是自动许可证 ​

本页从给定设计的独立Bernoulli模型推导式(2)。若实际层内存在未建模的依赖,只知道各人的边际logit满足式(1),并不能推出同一条件似然;不同联合分布可以有相同边际,却给不同的子集概率。

同样,把资料称为“配对”或“病例—对照”还不足以证明式(2)。在回顾性抽样下复用该似然,需要另给样本选择概率及消去相关因子的论证。随机试验中按设计交换标签的概率,则来自另一种随机机制;不能将其无条件换成由β控制的式(2)。

推论与应用

归一化不用枚举所有组合 ​

对一层省略j下标,令 wi=eβTxi>0。C是多项式

∏i=1n(1+wiz)

中z^m的系数。使用动态规划,定义E_{k,r}为前k人中选r人的总权重,初始化E_{0,0}=1,其余非法状态为0,递推

(5)Ek,r=Ek−1,r+wkEk−1,r−1.

第一项不选第k人,第二项选它;两类互斥且覆盖所有子集,因此递推精确。只需保留r=0,…,m。原地更新时r必须从大到小,才能使右端读到加入第k人之前的状态。最后C=E_{n,m}。

在四候选例中,截到r=2的状态依次为

(1,0,0)→(1,1,0)→(1,3,2)→(1,7,14)→(1,15,70).

一次归一化需要O(n(m+1))次加乘、O(m+1)存储,而直接枚举需要处理 (nm) 个子集。这里是给定权重后的算术成本;指数函数求值与数值精度另行计入。

同一递推也算得分与信息 ​

为每个状态同时维护未归一化的一阶向量M与二阶矩阵R:它们分别为该状态中各子集的“权重乘T”之和与“权重乘TT^T”之和。初始M、R全零。加入第k人时,记上一行r−1状态为 (Z−,M−,R−),上一行r状态为 (Z,M,R),则

(6)Znew=Z+wkZ−,Mnew=M+wk(M−+xkZ−),Rnew=R+wk(R−+xkM−T+M−xkT+xkxkTZ−).

这些式子只是在选中第k人时将T换成T+x_k并展开外积。最终 ET=M/Z、Cov(T)=R/Z−(M/Z)(M/Z)T。对于d维协变量,直接实现每层需要O(n(m+1)d²)次算术、O((m+1)d²)附加存储。这里保留m+1个状态,因此也覆盖m=0的空子集情形;当m≥1时,分别化为通常的O(nmd²)与O(md²)。

大权重时不能直接依赖浮点乘积。可以对全部状态Z、M、R做共同的正比例缩放并累计对数因子,或用对数权重与稳定的归一化计算;缩放必须同时作用于三种状态,才保持矩比值。极端条件下还应检查方差的非负性与舍入误差。

把各层结果相加便得到式(3)、(4)。若条件信息正定,可解 Icδ=Uc 并对条件对数似然回溯更新;若存在平坦方向或分离,则应先报告相应结构,不能将奇异信息或不断增大的系数仅解释为“多迭代几次”。二组计数资料进一步汇总后,得到优势比的精确条件推断,其中有限支持还允许直接反演检验。

参考资料
关系图谱12 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系