Skip to content

广义线性模型

Generalized linear model · GLM

用链接函数把指数族响应的条件均值连接到协变量线性预测子。

领域
统计学
条目类型
模型

形式陈述

给定设计矩阵 X=(x1T,,xnT)T 后,GLM 假设响应 Y1,,Yn 条件独立;若协变量本身随机,以下陈述都理解为条件于 X。每个 Yi 来自指数离散族

p(yiθi,ϕ)=exp{[yiθib(θi)]/a(ϕ)+c(yi,ϕ)}.

其均值 μi=b(θi)、方差 a(ϕ)b(θi)。GLM 指定线性预测子

ηi=xiTβ

和单调可逆 link

g(μi)=ηi.

canonical link 令 ηi=θi,但非 canonical link 也合法。

直觉

GLM 把三层职责分开:指数族规定响应噪声,线性预测子把协变量压成一个标量,链接函数再把该标量连接到条件均值。这样既保留线性模型的可解释方向,又不强迫二元、计数或正值响应服从同方差正态噪声。

例子与边界

Bernoulli 回归用 logit link:

logpi1pi=xiTβ.

Poisson 回归常用 log link:logμi=xiTβ,保证预测均值为正。Gaussian identity link 退化为线性模型

似然、Score 与 IRLS

条件均值与方差写成

E(Yixi)=μi,Var(Yixi)=a(ϕ)V(μi).

di=dμi/dηi,score 可写为

U(β)=XTdiag(dia(ϕ)V(μi))(Yμ).

Fisher scoring 在第 r 步构造工作响应

zi(r)=ηi(r)+Yiμi(r)di(r)

和权重 wi=di2/[a(ϕ)V(μi)],再做 weighted least squares。IRLS 是优化 likelihood 的局部二次算法,不是新的抽样模型。

估计

MLE score 可写成加权残差和,Newton/Fisher scoring 产生 iteratively reweighted least squares。每一步用当前均值更新工作响应和权重,再解加权最小二乘;收敛只证明数值驻点,仍需检查分离、边界与 rank。

Poisson log-link 中 μi=exiTβV(μ)=μ,canonical score 简化为 XT(Yμ)。一个二元暴露系数 β1eβ1 解释为条件 rate ratio,而非均值的加性差。

边界

线性的是 link 后均值对参数的关系,不是响应必正态或方差恒定。Poisson 的方差等于均值是模型假设;overdispersion 会让常规标准误过小。

logistic 完全分离时有限 MLE 不存在。把大系数当收敛结果会错误;惩罚似然改变估计目标。

binomial overdispersion、Poisson overdispersion 会破坏模型方差。quasi-likelihood 可保留均值 link 并估计 dispersion,但不再有完整概率 likelihood,LR/AIC 解释也相应变化。

响应独立性若因重复测量失效,GEE 或混合模型处理不同相关目标。sandwich 标准误只在簇数等渐近条件下有效,不能让错误 link 变正确。

link 误设、遗漏非线性和相关观测会破坏均值或方差结构。robust sandwich 只能修正某些方差误设,不能恢复错误条件均值的参数解释。

deviance 定义为拟合模型与 saturated model 的两倍 log-likelihood 差。嵌套 GLM 的 deviance 差在正则大样本下近似卡方;单个模型 residual deviance 作为 GOF 统计量时,还需类别稀疏度与 dispersion 条件。

Pearson residual (Yiμ^i)/V(μ^i) 与 deviance residual 强调不同尾部。高 leverage 点的 raw residual 可能小,因为它强烈影响自身拟合;诊断要结合 hat values 与 Cook-type influence。

offset 是系数固定为一的预测项,例如 Poisson rate model 用 logexposurei offset:

logE(Yixi)=logexposurei+xiTβ.

遗漏 offset 会把观察时间差异误作协变量效应。

quasi-binomial 或 quasi-Poisson 只指定均值—方差关系,没有完整 likelihood;可估系数与 sandwich/dispersion 标准误,却不能原样使用 likelihood ratio、AIC 或概率预测。

对稀有事件 logistic,分离和小样本 bias 常严重。Firth penalty 改善 bias 与存在性,但输出是 penalized likelihood estimator,不能继续声称普通 MLE 有限样本性质。

推论与应用

统计指数族给出似然结构,最大似然估计提供参数拟合接口;拟合后的 score、信息与渐近区间分别通向Score 与 Fisher 信息Wald、Score 与 LR 检验。诊断离差与 Pearson 残差时仍须核对过度离散、链接错设和独立性,而不能只读一个拟合优度数值。

参考资料
  • Peter McCullagh and John Nelder, Generalized Linear Models, 2nd ed., Chapman & Hall, 1989。
  • Annette Dobson and Adrian Barnett, An Introduction to Generalized Linear Models, 4th ed., CRC, 2018。
  • Fahrmeir et al., Regression, Springer, 2013,GLM chapters。
关系图谱19 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组