形式陈述
将 个独立观测分入 类,计数为 。在零假设公理库统计假设检验Statistical hypothesis test · Test function在零假设与备择假设之间作出随机化决定,并对零假设下拒绝概率实施一致控制。下,各类概率 、,期望计数为 。Pearson 统计量定义为
若 完全给定, 且每个 ,则
极限由卡方分布公理库卡方分布Chi-square distribution · Chi-squared distribution · χ² distribution若干独立标准正态变量平方和的分布,以自由度记录独立平方方向的数量。校准。若 ,并从同一份数据中估计 个内部正则参数,则在参数映射 Jacobian 满秩等条件下,自由度通常变为 ;边界参数、不可识别方向或结构零不能直接套用这条扣减公式。
令 ,并把 记为坐标 组成的列向量。多项中心极限定理给出极限协方差
它是到 正交补上的秩 投影,因此 。估计 个正则参数时,拟合残差还会投影掉模型切空间中的 个方向,这给出 的几何来源。
直觉
每一项 都把计数偏差换算成该格自身随机波动的尺度; 再把这些标准化偏差的平方相加。总计数固定为 ,所以 个残差并不独立:知道前 个后,最后一个由总和约束决定。自由度少一来自这条约束,而不是经验性地“扣掉一格”。
总统计量只回答整体偏离有多强,不能指出偏离发生在哪里。带符号 Pearson residual 保留方向,适合定位贡献最大的类别;但看完 residual 后删除类别或改模型,会引入新的选择步骤,必须用新数据验证或重新校准。
例子与边界
检验骰子公平,取 ,观测计数 ,每格期望均为 。于是
它与 比较并不极端。对应 residual 约为
第四格给出最大的正向贡献。结论是数据没有显示与公平模型明显不协调,而不是“证明骰子绝对公平”。
小期望计数会破坏固定维正态近似。“每格至少 5”只是经验筛查;真正条件还受最小 、类别数是否随样本增长、参数拟合和稀疏方向影响。必要时可合并有科学意义的类别,或用精确 multinomial / Monte Carlo 校准;模拟必须复制参数拟合、分箱和选择步骤。
观测相关、看过数据后才决定类别、估计概率参数却不扣自由度,都会改变名义 level。连续数据先分箱还会损失信息,分箱边界应预先规定;从当前样本估计边界会额外引入随机性。
零观测不是结构零: 仍会贡献期望偏差。只有模型本身规定 时,该类别才不在随机支持中;此时原统计量中的除法也需要重新定义支持。
推论与应用
Pearson 统计量用于离散分布拟合、列联表和 GLM 诊断。与似然比公理库似然比检验Likelihood ratio test · Generalized likelihood ratio test以受限模型和完整模型的最大似然之比衡量零假设对数据的相对解释能力。 deviance
相比, 使用二次残差;对 的 Taylor 展开说明,当 时两者首阶等价,因而共享正则卡方极限,稀疏样本下数值却可能明显不同。观测到统计量后得到的尾部证据应按p 值公理库p 值p-value在零假设下校准的证据统计量,其小值事件的概率不超过对应阈值。的零分布语义解释,而不是当作零假设为真的概率。
固定备择 下, 大致按 增长;稀有类别受到 强调,却也最难满足渐近条件。在列联表独立性检验中, 由边缘概率拟合,自由度为 ;multinomial、product-multinomial 与条件 hypergeometric 抽样方案仍有不同的精确解释。
效应大小可报告 Cramér's ,但它只给归一化关联强度,不能替代 cell residual。大样本可能让很小的 显著;稀疏表又会使该估计偏差增大。连续分布若不愿承担分箱选择,可改用比较 CDF 的方法,但其校准条件与敏感方向属于另一类检验。
参考资料
- Karl Pearson, “On the Criterion that a Given System of Deviations…,” Philosophical Magazine 50, 1900。
- Alan Agresti, Categorical Data Analysis, 3rd ed., Wiley, 2013,Ch. 1–2。
- Erich L. Lehmann and Joseph P. Romano, Testing Statistical Hypotheses, 3rd ed., Springer, 2005,Ch. 14。