Skip to content

定理Theorem

Logistic分离与有限最大似然估计

Complete separation in logistic regression · Quasi-complete separation · 逻辑回归完全分离

用有符号设计方向刻画二元logistic模型何时存在有限唯一MLE,并将完全分离、准完全分离与不可识别的平坦方向区分开。

二元模型中的拟合概率可以越来越接近观测标签,同时回归系数越来越大。此时目标函数仍在改善,有限参数空间里却没有最后一个最优点。分离检查回答的是这个存在性问题;它应当先于对一次数值拟合结果的解释。

形式陈述 ​

固定设计、有限系数与有符号行 ​

考虑广义线性模型中的Bernoulli–logit模型。给定实矩阵 X∈Rn×d,n≥d≥1,行向量写为 xiT。本页假定X满列秩。条件于这份设计,各响应独立且

Yi∼Bernoulli(pi),pi=σ(xiTβ),σ(t)=11+e−t,β∈Rd.

截距若存在,就作为X的一列1。给定已经观测到的 yi∈{0,1},定义

(1)zi=(2yi−1)xi,L(β)=−ℓ(β)=∑i=1nlog⁡(1+e−ziTβ).

z_i把成功与失败统一成同一个要求:希望 ziTβ 较大。最大似然估计要求在有限参数空间 Rd 内真正取到最大值;仅有一列参数使似然趋近上确界,不算存在有限MLE。

存在性定理。 在上述满列秩条件下,以下两件事等价:

  1. ℓ有有限极大点;此时该点唯一。
  2. 不存在非零 v∈Rd,使所有 ziTv≥0。

令Z的第i行为 ziT,可以进一步分三类:

  • 完全分离: 存在v使 Zv>0,每个分量都严格正。
  • 准完全分离: 存在非零v使 Zv≥0,但不存在使所有分量严格正的方向。
  • 重叠: 不存在上述非零弱方向,因而存在有限唯一MLE。

这是一种有优先次序的分类。完全分离的数据也可能有某个带零间隙的弱方向,不能仅看到一个零间隙就宣布“准完全”。这里的重叠是有符号设计的条件,不是要求每个协变量位置都同时观察到两种标签。

证明:改善方向与统一增长界 ​

先设v是非零弱方向。由于X满列秩,Z也满列秩,所以Zv不能全零。沿任意起点β的射线,

(2)ddtℓ(β+tv)=∑iziTv1+exp⁡(ziTβ+tziTv)>0.

每项非负,至少一项严格正,故每个有限β都还能改善,没有有限极大点。若方向严格,令t趋无穷就使式(1)每项都趋零;原似然上确界为1,却没有有限参数达到它。

反过来,假设不存在非零弱方向。单位球面上的函数

g(v)=miniziTv,‖v‖2=1

连续且处处严格负。球面紧,极值定理保证它的最大值也严格负,记为−δ,其中δ>0。对任意β≠0,取 v=β/‖β‖2,总能找到某一行使 ziTβ≤−δ‖β‖2,从而

(3)L(β)≥log⁡(1+eδ‖β‖2)≥δ‖β‖2.

所以L在参数逃向无穷时趋向无穷。选足够大的闭球,使球外L大于L(0),再在球内使用极值定理,即得有限极小点。

最后,有限β下各 wi=pi(1−pi)>0,而

∇2L(β)=XTWX,W=diag(w1,…,wn).

任意非零a都满足 aTXTWXa=∑iwi(xiTa)2>0。因此L是严格凸函数,沿不同参数间的线段严格弯曲,极小点至多一个。这证明了唯一性,但没有给出全空间统一的强凸常数:某些w_i仍会在远处趋零。

直觉

成功行要求预测子向正方向走,失败行要求它向负方向走。把失败行翻转后,一条共同的有利方向就能使所有观测都不变差,并使至少一个观测持续变好。似然没有理由在某个有限步长停下。

没有这种方向时,每一次试图把参数推得很远,至少有一行会被推到错误的一侧。式(3)说明这种冲突是统一的:并非每条射线分别付一点代价,而是存在同一个δ,控制所有逃逸方向。这一步是从“看起来有冲突”走到有限极大点存在的关键。

严格凹的似然也可能没有极大点。例如本页完全分离时,ℓ在每个有限点的Hessian都负定,仍只在无穷远逼近上确界。曲率回答极大点若存在是否唯一;它不能代替存在性证明。

例子与边界

完全分离:每一行都有严格改善 ​

取带截距的两列设计 xi=(1,ti)T,并令

(ti)=(−2,−1,1,2),(yi)=(0,0,1,1).

方向 v=(0,1)T 给出的有符号间隙依次为2、1、1、2,故完全分离。沿β=(0,b),b→∞时,左侧两行的成功概率趋0,右侧两行趋1,且

ℓ(0,b)=−2log⁡(1+e−b)−2log⁡(1+e−2b)⟶0.

对每个有限b,这个值仍严格小于0。输出一个很大的b,只是选中了逼近过程中的一个位置。

准完全分离:相同协变量上的冲突留在内部 ​

现在取

(ti)=(−1,0,0,1),(yi)=(0,0,1,1).

同一v给间隙1、0、0、1。若要完全分离,t=0处的失败与成功会分别要求−v_0>0和v_0>0,不可能同时满足。因此这是准完全分离。

写β=(a,b)。t=0的两行对数似然之和为 log⁡σ(a)+log⁡(1−σ(a))≤−2log⁡2;另外两行的贡献严格小于0。因此所有有限参数都满足 ℓ(a,b)<−2log⁡2。沿a=0、b→∞,外侧两行贡献趋0,中间两行始终为1/2,故上确界恰为−2log2。部分概率留在内部,并不恢复有限MLE。

重叠:直接核一份有限解 ​

取

(ti)=(−1,−1,1,1),(yi)=(0,1,0,1).

若v=(a,b)满足所有弱不等式,在t=−1处有a−b同时非负、非正,在t=1处有a+b同时非负、非正。因此a=b=0,不存在非零弱方向。β=0给每行概率1/2,得分 XT(y−p)=0,由存在性与严格凹性得唯一MLE为0。

分离方向与有限极大点

图中只画选定射线,重叠设计的全空间结论仍由无弱方向与式(3)证明。不能仅凭一条曲线有峰值就判定一般设计存在MLE。

秩亏、有限约束与观测机制 ​

若X秩亏,可能存在v≠0却Xv=0,此时ℓ(β+tv)=ℓ(β)完全平坦。最简单的是把截距列复制一遍:只有两系数之和可识别,单个系数并不唯一。这样的v不是改善方向。应先选满秩的列空间坐标,再使用本页定理;若拟合值存在,原坐标下的极大点也可能组成整个仿射集合。

若人为限制 ‖β‖≤M,紧约束会使极大点存在,但所得是受限MLE,其位置和预测依赖M。Firth惩罚也能得到有限解,不过它明确改变了目标函数。这两种做法都不能被解释为原始无约束MLE已经存在。

定理的代数结论针对写在式(1)中的目标。把相关响应仍按独立乘积拟合,分离检查依旧能诊断这个计算目标;该乘积是否是真实联合似然、系数是否有原模型的统计含义,则需要另外证明。

推论与应用

用线性不等式交付可检查的证书 ​

因为行数有限,严格方向可缩放,所以完全分离等价于下面的线性规划可行性问题有解:

(4)Zv≥1.

在满列秩前提下,存在非零弱方向等价于

(5)Zv≥0,1TZv=1.

后一归一化合法,是因为任意非零弱方向的间隙和严格正。先检查式(4):可行即完全分离;若不可行,再检查式(5):可行即准完全分离;二者都不可行才是重叠。

给定候选方向,计算Zv及其和只需O(nd)次算术和O(n)附加存储;式(4)、(5)各有d个变量、O(n)个约束。这里区分验证成本与寻找方向的成本,不据此给一般LP求解器一个固定迭代次数。精确有理输入可逐项用有理数复核;浮点求解器报告“接近零”时,要保留容差与缩放信息,不能把微小负数直接抹成证明。

检查报告应包含设计秩、分类、方向及每一行间隙。若声称重叠,单凭“没有找到方向”不够,还需要可信的不可行证书或像前例那样推出v=0的论证。之后再报告拟合系数、得分残差与数值条件,才能将统计对象存在和算法近似精度分别核清。

参考资料
关系图谱16 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系