形式陈述
给定设计矩阵 理路 矩阵 Matrix 以有限行列集合为索引、取值于半环,并以中间指标求和定义乘法的函数。 X = ( x 1 T , … , x n T ) T 后,GLM 是对响应条件律的统计模型 理路 统计模型与参数 Statistical model · Statistical parameter 对可观测数据候选分布族、参数化坐标与待推断分布泛函的统一刻画。 ,假设 Y 1 , … , Y n 在给定 X 后相互独立 理路 独立性 Statistical independence 从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。 ;若协变量本身随机,以下陈述都理解为条件于 X 。每个 Y i 来自具有共同支撑的指数分散族(exponential dispersion family),其密度或质量函数写为
p ( y i ∣ θ i , ϕ ) = exp { [ y i θ i − b ( θ i ) ] / a ( ϕ ) + c ( y i , ϕ ) } . 这里 a ( ϕ ) > 0 ;固定 ϕ 后,θ i 位于自然参数空间内部,b 为相应的光滑对数配分函数,非退化响应满足 b ″ ( θ i ) > 0 。由指数族 理路 统计指数族 Exponential family · Exponential family in natural parameters 密度的参数依赖通过自然参数与统计量内积进入,并由对数配分函数归一化的分布族。 的配分函数导数,均值 μ i = b ′ ( θ i ) 、方差 a ( ϕ ) b ″ ( θ i ) 。GLM 指定线性预测子
η i = x i T β 和单调可逆 link
g ( μ i ) = η i . 典范链接(canonical link)令 η i = θ i ,非典范链接也可定义 GLM。参数取值须使每个 η i 落在链接的值域内。
例子与边界
Bernoulli 回归用 logit link:
log p i 1 − p i = x i T β . Poisson 回归常用 log link:log μ i = x i T β ,保证预测均值为正。独立同方差 Gaussian 响应配恒等链接,得到正态线性模型 理路 线性回归统计模型 Linear regression model · Linear model 响应的条件均值由设计变量对未知系数线性表示,并显式规定误差结构的统计模型。 。一般线性模型直接要求均值为 X β ,却允许非 Gaussian 或相关误差;一般 GLM 的均值为 g − 1 ( X β ) ,并在本页假定条件独立的指数族响应。二者共享一个重要交集,不能仅凭名称把任一整类当成另一类。
似然、Score 与 IRLS
条件均值与方差写成
E ( Y i ∣ x i ) = μ i , Var ( Y i ∣ x i ) = a ( ϕ ) V ( μ i ) . 以下评分迭代固定 ϕ ,或在每一步代入当前的正尺度 a ( ϕ ) ;另要求逆链接在当前点附近为 C 1 ,d i = d μ i / d η i 有限且非零。由条件对数似然求导,score 理路 Score 与 Fisher 信息 Score function · Fisher information 对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 为
U ( β ) = X T diag ( d i a ( ϕ ) V ( μ i ) ) ( Y − μ ) . Fisher scoring 在第 r 步构造工作响应
z i ( r ) = η i ( r ) + Y i − μ i ( r ) d i ( r ) 和正权重 w i = d i 2 / [ a ( ϕ ) V ( μ i ) ] 。若 X 满列秩,信息矩阵 I = X T W X 正定,Fisher scoring 更新等于解加权最小二乘 理路 最小二乘与正规方程 Least squares · Normal equations 将目标向量正交投影到矩阵列空间,并以残差正交条件导出正规方程。 :
β ( r + 1 ) = ( X T W ( r ) X ) − 1 X T W ( r ) z ( r ) . 这是把 W 1 / 2 X 与 W 1 / 2 z 代入正规方程。工作响应与权重会随迭代变化;它们不是另一批独立抽得的数据。
例如只有截距的 Bernoulli logit 模型,观测为 ( 0 , 1 , 1 ) 。从 β ( 0 ) = 0 开始,三项均值都为 1 / 2 ,d i = V ( μ i ) = 1 / 4 ,故权重都为 1 / 4 ,工作响应为 ( − 2 , 2 , 2 ) 。加权最小二乘给出 β ( 1 ) = 2 / 3 。原似然的极大点则满足预测概率等于 2 / 3 ,即 β ^ = log 2 ;一次二次更新接近了它,但还没有精确解出原问题。
估计
最大似然估计 理路 最大似然估计 Maximum likelihood estimation · MLE 在参数空间内选择使已观测数据似然达到上确界的参数估计方法。 要求达到原似然的全局上确界。Fisher scoring 每一步求解的是当前加权二次问题;若迭代收敛到权重有限、信息矩阵非奇异的内部点,由连续更新式才推出原 score 为零。驻点是否为全局最大、极大点是否存在,仍取决于链接、设计与观测结果。
Poisson log-link 中 μ i = e x i T β 、V ( μ ) = μ ,canonical score 简化为 X T ( Y − μ ) 。一个二元暴露系数 β 1 的 e β 1 解释为条件 rate ratio,而非均值的加性差。
边界
线性的是 link 后均值对参数的关系,不是响应必正态或方差恒定。Poisson 的方差等于均值是模型假设;overdispersion 会让常规标准误过小。
logistic 完全分离时有限 MLE 不存在。把大系数当收敛结果会错误;惩罚似然改变估计目标。
binomial overdispersion、Poisson overdispersion 会破坏模型方差。quasi-likelihood 可保留均值 link 并估计 dispersion,但不再有完整概率 likelihood,LR/AIC 解释也相应变化。
响应独立性若因重复测量失效,GEE 或混合模型处理不同相关目标。sandwich 标准误只在簇数等渐近条件下有效,不能让错误 link 变正确。
link 误设、遗漏非线性和相关观测会破坏均值或方差结构。robust sandwich 只能修正某些方差误设,不能恢复错误条件均值的参数解释。
固定同一个分散参数时,离差定义为 D = 2 { sup sat ℓ − ℓ ( β ^ ) } ,其中饱和模型让各观测的均值分别自由拟合;使用上确界也涵盖最优均值位于边界的情形。嵌套 GLM 的离差差对应同一似然下的拟合改善,在正则大样本下可作卡方校准;未知分散参数则须按所选似然共同处理。单个模型的残差离差用于拟合优度检验,还需另外检查稀疏计数与分散尺度条件。
Pearson residual ( Y i − μ ^ i ) / V ( μ ^ i ) 与 deviance residual 强调不同尾部。高 leverage 点的 raw residual 可能小,因为它强烈影响自身拟合;诊断要结合 hat values 与 Cook-type influence。
offset 是系数固定为一的预测项,例如 Poisson rate model 用 log e x p o s u r e i offset:
log E ( Y i ∣ x i ) = log e x p o s u r e i + x i T β . 遗漏 offset 会把观察时间差异误作协变量效应。
对稀有事件 logistic,分离和小样本 bias 常严重。Firth penalty 改善 bias 与存在性,但输出是 penalized likelihood estimator,不能继续声称普通 MLE 有限样本性质。
推论与应用
统计指数族 理路 统计指数族 Exponential family · Exponential family in natural parameters 密度的参数依赖通过自然参数与统计量内积进入,并由对数配分函数归一化的分布族。 给出似然结构,最大似然估计 理路 最大似然估计 Maximum likelihood estimation · MLE 在参数空间内选择使已观测数据似然达到上确界的参数估计方法。 提供参数拟合接口;拟合后的 score、信息与渐近区间分别通向Score 与 Fisher 信息 理路 Score 与 Fisher 信息 Score function · Fisher information 对数似然的局部参数导数、其模型内二次平均,以及零均值和曲率等式成立的正则条件。 和Wald、Score 与 LR 检验 理路 Wald、Score 与 LR 渐近检验 Wald test · Score test · Lagrange multiplier test 用估计量距离、零点梯度或似然差构造的三类正则大样本检验。 。诊断离差与 Pearson 残差时仍须核对过度离散、链接错设和独立性,而不能只读一个拟合优度数值。
删失事件时间的回归还涉及随时间改变的风险集。Cox 比例风险模型 理路 Cox 比例风险模型与部分似然 Cox proportional hazards model · Cox partial likelihood 通过事件时刻的风险集比较消去未知基线风险,推导 Cox 部分似然、得分和解释边界。 通过每次事件来源的条件概率消去未知基线,得到一组风险集加权比较;它的部分似然和参数解释不同于固定观测响应上的 GLM。
重复响应的边际均值接口
同一个人的多次二元或计数响应,可以保留链接与均值导数,同时放开本页的条件独立假设。广义估计方程 理路 广义估计方程 Generalized estimating equations · GEE · Fixed-working-correlation GEE 在独立重复观测簇上解固定工作相关的非线性边际均值方程,区分期望敏感度、观测导数与稳健协方差。 预先指定工作相关,把一整个簇的残差加权成一个得分;它从两种二元工作相关的第一步算到最终根与稳健协方差,并迁移到带暴露量 offset 的计数率。零得分的理由需要完整簇条件均值;边际系数、条件随机效应系数和错误链接下的目标不能混用。