Skip to content

卡方拟合优度检验

Chi-square goodness-of-fit test · Pearson chi-square test

比较分类观测计数与零模型期望计数,并用渐近卡方律校准偏差。

统计量

n 个独立观测分入 k 类,计数 Oj,零假设概率 pj>0jpj=1。期望计数为 Ej=npj,Pearson 统计量

X2=j=1k(OjEj)2Ej.

pj 完全给定且 n、每个 npj,则

X2dχk12.

少一自由度来自 j(OjEj)=0 的线性约束。

推导骨架

多项计数向量的中心极限定理给标准化残差的奇异正态极限。协方差在总和为零的 k1 维子空间上投影,平方范数成为 k1 个独立标准正态平方和。

pj=pj(η) 且从同一数据估计 r 个正则参数,拟合后的自由度通常为 k1r,但需 Jacobian 满秩并正确计算 MLE。

例子

检验骰子公平,n=120,观测计数 (18,22,17,25,20,18),期望均为 20。则

X2=(4+4+9+25+0+4)/20=2.3.

χ52 比较,数值并不极端。这里每格期望为 20,渐近条件合理;结论是未发现与公平模型明显不协调,不是证明骰子绝对公平。

协方差推导与残差诊断

Zj=(Ojnpj)/npj。多项中心极限定理给极限协方差

Σ=Ip,pT,

它是秩 k1 的投影,因此 ZTZχk12。自由度来自计数总和约束,不是随意扣一。

pj=pj(η) 且从同一数据估计 r 个内部正则参数,拟合残差又投影掉 r 个切向方向,通常得到 k1r 自由度。参数在边界、Jacobian 不满秩或类别概率为零时不能使用该公式。

骰子例的 Pearson residual 为

(0.447,0.447,0.671,1.118,0,0.447).

总统计量只给偏离强度,带符号残差显示第四格正偏最大。检查 residual 不等于事后删除异常类别;若据此修改模型,应在新数据上验证或重新校准选择。

边界

小期望计数会让卡方近似失准。“每格至少 5”只是经验规则,稀疏程度、类别数增长和参数估计都会影响误差;可合并有科学意义的类别或用精确 multinomial/Monte Carlo 校准。

观测不独立、类别由看数据后挑选、概率参数估计却未扣自由度,都会破坏名义 level。连续数据先分箱还会丢信息,分箱边界必须预定。

类别数随样本增长或最小 npj 不发散时,固定维卡方极限失效。“每格至少五”只是经验筛查,不是一般定理。可用精确 multinomial Monte Carlo,但模拟也要复制参数拟合与分箱步骤。

X2 大只表示某些标准化计数偏差大,不指出模型为何错;应查看 signed residual 与具体类别。

应用

Pearson 统计量用于离散分布拟合、列联表与 GLM 诊断。似然比 deviance 在正则条件下有相同卡方极限,有限稀疏样本表现可不同。

与 likelihood-ratio deviance

G2=2j:Oj>0Ojlog(Oj/Ej)

相比,Pearson X2 用二次残差。Taylor 展开 ulogu 可见两者在 Oj/Ej1 时首阶等价,故共享卡方极限;稀疏格中数值可能明显不同。

拟合优度检验的 power 取决于偏离方向。固定备择 qj 下,X2 大致按 nj(qjpj)2/pj 增长;稀有类别被 1/pj 加权更重,但也更难满足正态近似。类别设计应与科学偏离相匹配。

若检验连续分布,可用预先指定的分位数箱使期望计数均衡;从当前数据估计分箱边界会引入额外随机性。Kolmogorov–Smirnov 等无分箱方法比较 CDF,校准条件和敏感方向不同。

在列联表中,“独立性检验”把 pij 估计为边缘乘积,自由度 (r1)(c1)。这属于参数拟合后的 GOF,但抽样方案是 multinomial、product multinomial 还是条件 hypergeometric 会影响精确解释。

效应大小可报告 Cramér's V=X2/[nmin(r1,c1)],但它只是归一化关联强度,不替代 cell residual。大样本可使微小 V 显著,稀疏表又会使其估计偏差增大。

缺失类别或零计数不能自动删除:零计数仍贡献期望偏差。只有模型本身给 pj=0 时该类别不在随机支持中;观测为零与结构零必须区分。

参考资料
  • Karl Pearson, “On the Criterion that a Given System of Deviations…,” Philosophical Magazine 50, 1900。
  • Alan Agresti, Categorical Data Analysis, 3rd ed., Wiley, 2013,Ch. 1–2。
  • Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 14。