Skip to content

模型Model

广义线性模型

Generalized linear model · GLM

用链接函数把指数族响应的条件均值连接到协变量线性预测子。

形式陈述 ​

给定设计矩阵 X=(x1T,…,xnT)T 后,GLM 是对响应条件律的统计模型,假设 Y1,…,Yn 在给定 X 后相互独立;若协变量本身随机,以下陈述都理解为条件于 X。每个 Yi 来自具有共同支撑的指数分散族(exponential dispersion family),其密度或质量函数写为

p(yi∣θi,ϕ)=exp⁡{[yiθi−b(θi)]/a(ϕ)+c(yi,ϕ)}.

这里 a(ϕ)>0;固定 ϕ 后,θi 位于自然参数空间内部,b 为相应的光滑对数配分函数,非退化响应满足 b″(θi)>0。由指数族的配分函数导数,均值 μi=b′(θi)、方差 a(ϕ)b″(θi)。GLM 指定线性预测子

ηi=xiTβ

和单调可逆 link

g(μi)=ηi.

典范链接(canonical link)令 ηi=θi,非典范链接也可定义 GLM。参数取值须使每个 ηi 落在链接的值域内。

直觉

GLM 把三层职责分开:指数族规定响应噪声,线性预测子把协变量压成一个标量,链接函数再把该标量连接到条件均值。这样既保留线性模型的可解释方向,又不强迫二元、计数或正值响应服从同方差正态噪声。

例子与边界

Bernoulli 回归用 logit link:

log⁡pi1−pi=xiTβ.

Poisson 回归常用 log link:log⁡μi=xiTβ,保证预测均值为正。独立同方差 Gaussian 响应配恒等链接,得到正态线性模型。一般线性模型直接要求均值为 Xβ,却允许非 Gaussian 或相关误差;一般 GLM 的均值为 g−1(Xβ),并在本页假定条件独立的指数族响应。二者共享一个重要交集,不能仅凭名称把任一整类当成另一类。

似然、Score 与 IRLS ​

条件均值与方差写成

E(Yi∣xi)=μi,Var(Yi∣xi)=a(ϕ)V(μi).

以下评分迭代固定 ϕ,或在每一步代入当前的正尺度 a(ϕ);另要求逆链接在当前点附近为 C1,di=dμi/dηi 有限且非零。由条件对数似然求导,score 为

U(β)=XTdiag(dia(ϕ)V(μi))(Y−μ).

Fisher scoring 在第 r 步构造工作响应

zi(r)=ηi(r)+Yi−μi(r)di(r)

和正权重 wi=di2/[a(ϕ)V(μi)]。若 X 满列秩,信息矩阵 I=XTWX 正定,Fisher scoring 更新等于解加权最小二乘:

β(r+1)=(XTW(r)X)−1XTW(r)z(r).

这是把 W1/2X 与 W1/2z 代入正规方程。工作响应与权重会随迭代变化;它们不是另一批独立抽得的数据。

例如只有截距的 Bernoulli logit 模型,观测为 (0,1,1)。从 β(0)=0 开始,三项均值都为 1/2,di=V(μi)=1/4,故权重都为 1/4,工作响应为 (−2,2,2)。加权最小二乘给出 β(1)=2/3。原似然的极大点则满足预测概率等于 2/3,即 β^=log⁡2;一次二次更新接近了它,但还没有精确解出原问题。

估计 ​

最大似然估计要求达到原似然的全局上确界。Fisher scoring 每一步求解的是当前加权二次问题;若迭代收敛到权重有限、信息矩阵非奇异的内部点,由连续更新式才推出原 score 为零。驻点是否为全局最大、极大点是否存在,仍取决于链接、设计与观测结果。

Poisson log-link 中 μi=exiTβ、V(μ)=μ,canonical score 简化为 XT(Y−μ)。一个二元暴露系数 β1 的 eβ1 解释为条件 rate ratio,而非均值的加性差。

边界 ​

线性的是 link 后均值对参数的关系,不是响应必正态或方差恒定。Poisson 的方差等于均值是模型假设;overdispersion 会让常规标准误过小。

logistic 完全分离时有限 MLE 不存在。把大系数当收敛结果会错误;惩罚似然改变估计目标。

binomial overdispersion、Poisson overdispersion 会破坏模型方差。quasi-likelihood 可保留均值 link 并估计 dispersion,但不再有完整概率 likelihood,LR/AIC 解释也相应变化。

响应独立性若因重复测量失效,GEE 或混合模型处理不同相关目标。sandwich 标准误只在簇数等渐近条件下有效,不能让错误 link 变正确。

link 误设、遗漏非线性和相关观测会破坏均值或方差结构。robust sandwich 只能修正某些方差误设,不能恢复错误条件均值的参数解释。

固定同一个分散参数时,离差定义为 D=2{supsatℓ−ℓ(β^)},其中饱和模型让各观测的均值分别自由拟合;使用上确界也涵盖最优均值位于边界的情形。嵌套 GLM 的离差差对应同一似然下的拟合改善,在正则大样本下可作卡方校准;未知分散参数则须按所选似然共同处理。单个模型的残差离差用于拟合优度检验,还需另外检查稀疏计数与分散尺度条件。

Pearson residual (Yi−μ^i)/V(μ^i) 与 deviance residual 强调不同尾部。高 leverage 点的 raw residual 可能小,因为它强烈影响自身拟合;诊断要结合 hat values 与 Cook-type influence。

offset 是系数固定为一的预测项,例如 Poisson rate model 用 log⁡exposurei offset:

log⁡E(Yi∣xi)=log⁡exposurei+xiTβ.

遗漏 offset 会把观察时间差异误作协变量效应。

对稀有事件 logistic,分离和小样本 bias 常严重。Firth penalty 改善 bias 与存在性,但输出是 penalized likelihood estimator,不能继续声称普通 MLE 有限样本性质。

推论与应用

统计指数族给出似然结构,最大似然估计提供参数拟合接口;拟合后的 score、信息与渐近区间分别通向Score 与 Fisher 信息和Wald、Score 与 LR 检验。诊断离差与 Pearson 残差时仍须核对过度离散、链接错设和独立性,而不能只读一个拟合优度数值。

删失事件时间的回归还涉及随时间改变的风险集。Cox 比例风险模型通过每次事件来源的条件概率消去未知基线,得到一组风险集加权比较;它的部分似然和参数解释不同于固定观测响应上的 GLM。

重复响应的边际均值接口 ​

同一个人的多次二元或计数响应,可以保留链接与均值导数,同时放开本页的条件独立假设。广义估计方程预先指定工作相关,把一整个簇的残差加权成一个得分;它从两种二元工作相关的第一步算到最终根与稳健协方差,并迁移到带暴露量 offset 的计数率。零得分的理由需要完整簇条件均值;边际系数、条件随机效应系数和错误链接下的目标不能混用。

参考资料
  • Jonathan Taylor, Generalized linear models (Ch. 4), Stanford STATS 305B, 2021,Fisher scoring and IRLS:工作响应、信息权重与加权正规方程。
  • Peter McCullagh and John Nelder, Generalized Linear Models, 2nd ed., Chapman & Hall, 1989。
  • Annette Dobson and Adrian Barnett, An Introduction to Generalized Linear Models, 4th ed., CRC, 2018。
  • Fahrmeir et al., Regression, Springer, 2013,GLM chapters。
关系图谱17 个相邻概念 · 4 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
分类位置

上位 / 更一般

下位 / 直接特例

暂未标注直接特例。

类型化关系