统计量 ​
将
若
少一自由度来自
推导骨架 ​
多项计数向量的中心极限定理给标准化残差的奇异正态极限。协方差在总和为零的
若
例子 ​
检验骰子公平,
与
协方差推导与残差诊断 ​
令
它是秩
若
骰子例的 Pearson residual 为
总统计量只给偏离强度,带符号残差显示第四格正偏最大。检查 residual 不等于事后删除异常类别;若据此修改模型,应在新数据上验证或重新校准选择。
边界 ​
小期望计数会让卡方近似失准。“每格至少 5”只是经验规则,稀疏程度、类别数增长和参数估计都会影响误差;可合并有科学意义的类别或用精确 multinomial/Monte Carlo 校准。
观测不独立、类别由看数据后挑选、概率参数估计却未扣自由度,都会破坏名义 level。连续数据先分箱还会丢信息,分箱边界必须预定。
类别数随样本增长或最小
应用 ​
Pearson 统计量用于离散分布拟合、列联表与 GLM 诊断。似然比 deviance 在正则条件下有相同卡方极限,有限稀疏样本表现可不同。
与 likelihood-ratio deviance
相比,Pearson
拟合优度检验的 power 取决于偏离方向。固定备择
若检验连续分布,可用预先指定的分位数箱使期望计数均衡;从当前数据估计分箱边界会引入额外随机性。Kolmogorov–Smirnov 等无分箱方法比较 CDF,校准条件和敏感方向不同。
在列联表中,“独立性检验”把
效应大小可报告 Cramér's
缺失类别或零计数不能自动删除:零计数仍贡献期望偏差。只有模型本身给
参考资料
- Karl Pearson, “On the Criterion that a Given System of Deviations…,” Philosophical Magazine 50, 1900。
- Alan Agresti, Categorical Data Analysis, 3rd ed., Wiley, 2013,Ch. 1–2。
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 14。