Skip to content

方法Method

回归杠杆与学生化残差

Regression leverage and studentized residuals · Externally studentized residual · 回归删除诊断 · Cook's distance

从投影对角元推导删行保秩、残差尺度、外学生化的精确t分布及Cook影响量,并辨认HC2和HC3修正能保证什么。

拟合后的残差很小,可能表示这一行确实接近规律,也可能表示拟合被这一行拉了过去。杠杆量出设计位置对拟合的敏感度;删行诊断再询问:没有这一条响应时,整份拟合会变多少?这两个问题不能只靠原残差的绝对值回答。

形式陈述 ​

先固定设计和诊断对象 ​

设固定设计线性模型Y=Xβ+ε,X∈R^(n×p)满列秩,1≤p≤n。记第i行的转置为x_i,定义

A=(XTX)−1,β^=AXTY,H=XAXT,e=(I−H)Y,(1)hi=Hii=xiTAxi.

h_i称为第i行的杠杆,只取决于X。H是设计列空间的正交投影,所以0≤h_i≤1、Σ_i h_i=p。若含截距列,进一步h_i≥1/n;不含截距时可出现h_i=0。

删除第i行后仍用同样p个特征,所得设计和估计记为X_{−i}、β̂_{−i}。它满列秩当且仅当h_i<1。在这个条件下,有精确代数恒等式

(2)β^−β^−i=Axiei1−hi,Yi−xiTβ^−i=ei1−hi,(3)RSS−i=RSS−ei21−hi,RSS=eTe.

这些等式不要求随机误差,也不要求正态。左边的RSS_{−i}只对剩下n−1条求平方和,不能把删除行的预测误差再加进去。

内部与外部学生化 ​

以下要求n>p、RSS>0和h_i<1。令ν=n−p、s²=RSS/ν,内部学生化残差为

(4)ri=eis1−hi.

若还满足ν>1、RSS_{−i}>0,令s_{−i}²=RSS_{−i}/(ν−1),外部学生化残差为

(5)ti=eis−i1−hi=riν−1ν−ri2.

两者使用不同尺度估计。只有再加上ε∼N_n(0,σ²I)、σ>0,并在观察Y之前固定诊断行i,才有精确结论t_i∼t_(ν−1)。内部r_i满足|r_i|≤√ν,通常不服从无界的Student t分布。

直觉

H把响应投成拟合值,故∂Ŷ_i/∂Y_i=h_i。高杠杆行对自己的拟合值有较大影响,留下的残差容易被压小。在同方差模型中,这一点表现为

(6)Ee=0,Cov(e)=σ2(I−H),Var(ei)=σ2(1−hi).

所以比较不同行残差前要考虑1−h_i。该因子不是凭经验为离群点加的惩罚,而是投影后实际剩余的方差。

为什么删除保秩恰好由1−h_i决定 ​

删行Gram矩阵为XᵀX−x_i x_iᵀ。用A的正定平方根作合同变换,得到

A1/2(XTX−xixiT)A1/2=I−vvT,v=A1/2xi.

沿v方向的特征值为1−‖v‖²=1−h_i,垂直方向均为1;v=0时整个矩阵就是I。因而删行后可逆恰好等价于h_i<1。原矩阵满秩只说明全部行合起来足够识别参数,未承诺去掉任一行仍足够。

减去完整数据的正规方程,删行方程变成

(XTX−xixiT)(β^−i−β^)=−xiei.

直接代入−Ax_i e_i/(1−h_i)即可核实,得到式(2),无需每次重新求逆。再把它代入剩余行的平方和:用Xᵀe=0、Σ_{j≠i}x_j e_j=−x_i e_i、以及删行Gram,展开交叉项和二次项,得到式(3)。

外部t分布来自哪一份独立性 ​

令u_i为第i个坐标单位向量,取

qi=(I−H)ui1−hi.

q_i是残差子空间里的单位向量,而且q_iᵀY=e_i/√(1−h_i)。将它扩成该ν维子空间的正交规范基。由各向同性联合正态在正交方向上的独立性,

Z=qiTYσ∼N(0,1),W=RSS−(qiTY)2σ2∼χν−12,Z⊥W.

剩余ν−1个独立标准正态平方和给卡方分布。由式(3),分子里的剩余平方和正是RSS_{−i},所以

ti=ZW/(ν−1)∼tν−1

符合Student t的定义。内部量却是r_i=√ν Z/√(Z²+W),分母仍包含同一个Z;这既解释其有界性,也指出不能直接套t分布的原因。ν>1时W>0几乎必然;确定性输入仍必须检查RSS_{−i}是否为零。

例子与边界

只有截距也能看见两种学生化的差别 ​

取三条响应(0,1,5),设计只有截距。均值β̂=2,h_i=1/3,残差(−2,−1,3),RSS=14,ν=2,s²=7。删除第三条后,均值为1/2,剩余RSS为1/2,核验

14−321−1/3=12.

第三行有

r32=2714<2,t32=27.

内部残差受到√2的上界限制,外部残差则因为删除后剩余尺度很小而变大。若模型真是同方差正态、第三行预先指定,则t_3参考t_1分布;自由度很小,不能把数值大直接等同于正态尾概率小。

h_i=1不是需要小修正的分母 ​

设X三行分别为(1,0)、(1,0)、(0,1)。X满列秩,但第三行h_3=1;第二个系数只由该行识别,删去它就失去识别。第三行残差恒为零,式(2)、(4)、HC2等分母都不可用。给分母添加一个小常数并不恢复原统计问题。

如果所有响应恰好在设计列空间中,RSS=0,s不能作为尺度;如果只在删除某行后完美拟合,RSS_{−i}=0,外部t公式同样不能给一个通常的实数统计量。精确正态模型下这些事件在正自由度时概率为零,但实际输入校验仍应处理。

扫描后选最大残差改变了检验对象 ​

单个预指定t_i的精确分布不意味着max_i|t_i|也服从相同t分布。所有t_i共享拟合资料,通常相关。若要同时检查n行,可按真实适用的多重检验规则校准;“先删掉看起来最异常的行,再用未选择模型的标准误”是一个额外选择过程。

非正态时式(2)–(3)仍成立,式(5)只是代数转换而非精确概率校准。异方差下残差协方差变成(I−H)Ω(I−H),也不再由同一σ²(1−h_i)描述。

推论与应用

Cook影响量汇总整个拟合的改变 ​

当s²>0、h_i<1时,定义

(7)Di=‖Xβ^−Xβ^−i‖2ps2=ei2hips2(1−hi)2=ri2phi1−hi.

第一式在原来全部n个设计位置上比较两条拟合曲线,包括被删位置。第二式由式(2)及A(XᵀX)A=A得到。它同时保留残差大小和设计杠杆;仅有高杠杆或仅有大残差,都不等于两者乘积一定大。

上面的截距例给D_3=27/28。D_i是影响诊断量,本页不把它宣称为某个精确F检验统计量,也不把某个经验阈值当作“必须删行”的数学结论。

图中另取x=(−1,0,1,2,8)、Y=(1,0,1,0,7)。第五行残差只有16/25,杠杆却为23/25;删除后斜率从19/25变成−1/5。内部平方96/37仍小于ν=3,外部平方64/5则使用删行后的尺度。完整终点逐步计算这些量,并检验特征换基后的不变性。

HC2与HC3是同一分母的两种使用 ​

HC0协方差把e_i²放在中间。若全部h_i<1,可进一步定义

(8)V^HC2=A(∑iei21−hixixiT)A,V^HC3=A(∑iei2(1−hi)2xixiT)A.

同方差不相关模型下,式(6)使E[e_i²/(1−h_i)]=σ²,因此E V̂_HC2=σ²A,具有有限样本无偏性;这不需要正态。HC3使用删除预测残差的平方,由式(2)还可写成

V^HC3=∑i(β^−β^−i)(β^−β^−i)T.

这里以完整估计为中心且没有额外倍数,不等于任何约定下都相同的、以删除估计均值为中心的jackknife方差。由于0≤h_i<1,有V̂_HC3−V̂_HC2半正定;“数值更大”不自动意味着覆盖率更准确。

一般异方差下HC2并非有限样本无偏。取无截距X=(1,2)ᵀ、独立零均值误差方差(1,4),真实Var(β̂)=17/25。此时h=(1/5,4/5),E e_1²=32/25、E e_2²=8/25,代入式(8)得到E V̂_HC2=8/25,明显不同。稳健渐近校准需要设计杠杆和矩条件,不能靠名称中的“修正”保证所有有限模型。

计算与迁移 ​

用薄QR分解X=QR,H=QQᵀ,h_i等于Q第i行平方和;不必存n×n的H。分解及各行求值需O(np²+p³)算术工作、O(np+p²)存储。解出β̂、e后,全部标量h_i、r_i、t_i、D_i可在O(n)附加工作内得到;若还输出每个删行系数向量,则要解相应p维三角系统并计入O(np²)工作和输出空间。病态设计应使用QR/SVD及秩判定,不把浮点1−h_i很小误判为精确零。

固定一个可逆p×p特征换基矩阵R,将X换成XR、系数换成R^(−1)β,列空间、H、e、学生化残差和D_i都不变。原始系数的欧氏差则会随坐标改变;Cook量使用XᵀX作为尺度,正好消除了这种表示依赖。

这些残差修正也可用在野生Bootstrap的逐行扰动尺度中。是否使用原残差、HC2型或HC3型残差必须写进生成规则,它们的有限条件协方差并不相同。

参考资料
关系图谱18 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系