“这个留一分母与普通回归删除残差的形式相似,但概率结构要另查。无惩罚满秩最小二乘的帽子矩阵H满足H²=H,同方差残差方差才化为σ²(1−h i);一般ridge平滑器的残差协方差是σ²(I−S…”
拟合后的残差很小,可能表示这一行确实接近规律,也可能表示拟合被这一行拉了过去。杠杆量出设计位置对拟合的敏感度;删行诊断再询问:没有这一条响应时,整份拟合会变多少?这两个问题不能只靠原残差的绝对值回答。
形式陈述
先固定设计和诊断对象
设固定设计线性模型Y=Xβ+ε,X∈R^(n×p)满列秩,1≤p≤n。记第i行的转置为x_i,定义
h_i称为第i行的杠杆,只取决于X。H是设计列空间的正交投影,所以0≤h_i≤1、Σ_i h_i=p。若含截距列,进一步h_i≥1/n;不含截距时可出现h_i=0。
删除第i行后仍用同样p个特征,所得设计和估计记为X_{−i}、β̂_{−i}。它满列秩当且仅当h_i<1。在这个条件下,有精确代数恒等式
这些等式不要求随机误差,也不要求正态。左边的RSS_{−i}只对剩下n−1条求平方和,不能把删除行的预测误差再加进去。
内部与外部学生化
以下要求n>p、RSS>0和h_i<1。令ν=n−p、s²=RSS/ν,内部学生化残差为
若还满足ν>1、RSS_{−i}>0,令s_{−i}²=RSS_{−i}/(ν−1),外部学生化残差为
两者使用不同尺度估计。只有再加上ε∼N_n(0,σ²I)、σ>0,并在观察Y之前固定诊断行i,才有精确结论t_i∼t_(ν−1)。内部r_i满足|r_i|≤√ν,通常不服从无界的Student t分布。
直觉
H把响应投成拟合值,故∂Ŷ_i/∂Y_i=h_i。高杠杆行对自己的拟合值有较大影响,留下的残差容易被压小。在同方差模型中,这一点表现为
所以比较不同行残差前要考虑1−h_i。该因子不是凭经验为离群点加的惩罚,而是投影后实际剩余的方差。
为什么删除保秩恰好由1−h_i决定
删行Gram矩阵为XᵀX−x_i x_iᵀ。用A的正定平方根作合同变换,得到
沿v方向的特征值为1−‖v‖²=1−h_i,垂直方向均为1;v=0时整个矩阵就是I。因而删行后可逆恰好等价于h_i<1。原矩阵满秩只说明全部行合起来足够识别参数,未承诺去掉任一行仍足够。
减去完整数据的正规方程,删行方程变成
直接代入−Ax_i e_i/(1−h_i)即可核实,得到式(2),无需每次重新求逆。再把它代入剩余行的平方和:用Xᵀe=0、Σ_{j≠i}x_j e_j=−x_i e_i、以及删行Gram,展开交叉项和二次项,得到式(3)。
外部t分布来自哪一份独立性
令u_i为第i个坐标单位向量,取
q_i是残差子空间里的单位向量,而且q_iᵀY=e_i/√(1−h_i)。将它扩成该ν维子空间的正交规范基。由各向同性联合正态在正交方向上的独立性,
剩余ν−1个独立标准正态平方和给卡方分布。由式(3),分子里的剩余平方和正是RSS_{−i},所以
符合Student t的定义。内部量却是r_i=√ν Z/√(Z²+W),分母仍包含同一个Z;这既解释其有界性,也指出不能直接套t分布的原因。ν>1时W>0几乎必然;确定性输入仍必须检查RSS_{−i}是否为零。
例子与边界
只有截距也能看见两种学生化的差别
取三条响应(0,1,5),设计只有截距。均值β̂=2,h_i=1/3,残差(−2,−1,3),RSS=14,ν=2,s²=7。删除第三条后,均值为1/2,剩余RSS为1/2,核验
第三行有
内部残差受到√2的上界限制,外部残差则因为删除后剩余尺度很小而变大。若模型真是同方差正态、第三行预先指定,则t_3参考t_1分布;自由度很小,不能把数值大直接等同于正态尾概率小。
h_i=1不是需要小修正的分母
设X三行分别为(1,0)、(1,0)、(0,1)。X满列秩,但第三行h_3=1;第二个系数只由该行识别,删去它就失去识别。第三行残差恒为零,式(2)、(4)、HC2等分母都不可用。给分母添加一个小常数并不恢复原统计问题。
如果所有响应恰好在设计列空间中,RSS=0,s不能作为尺度;如果只在删除某行后完美拟合,RSS_{−i}=0,外部t公式同样不能给一个通常的实数统计量。精确正态模型下这些事件在正自由度时概率为零,但实际输入校验仍应处理。
扫描后选最大残差改变了检验对象
单个预指定t_i的精确分布不意味着max_i|t_i|也服从相同t分布。所有t_i共享拟合资料,通常相关。若要同时检查n行,可按真实适用的多重检验规则校准;“先删掉看起来最异常的行,再用未选择模型的标准误”是一个额外选择过程。
非正态时式(2)–(3)仍成立,式(5)只是代数转换而非精确概率校准。异方差下残差协方差变成(I−H)Ω(I−H),也不再由同一σ²(1−h_i)描述。
推论与应用
Cook影响量汇总整个拟合的改变
当s²>0、h_i<1时,定义
第一式在原来全部n个设计位置上比较两条拟合曲线,包括被删位置。第二式由式(2)及A(XᵀX)A=A得到。它同时保留残差大小和设计杠杆;仅有高杠杆或仅有大残差,都不等于两者乘积一定大。
上面的截距例给D_3=27/28。D_i是影响诊断量,本页不把它宣称为某个精确F检验统计量,也不把某个经验阈值当作“必须删行”的数学结论。
图中另取x=(−1,0,1,2,8)、Y=(1,0,1,0,7)。第五行残差只有16/25,杠杆却为23/25;删除后斜率从19/25变成−1/5。内部平方96/37仍小于ν=3,外部平方64/5则使用删行后的尺度。完整终点逐步计算这些量,并检验特征换基后的不变性。
HC2与HC3是同一分母的两种使用
HC0协方差把e_i²放在中间。若全部h_i<1,可进一步定义
同方差不相关模型下,式(6)使E[e_i²/(1−h_i)]=σ²,因此E V̂_HC2=σ²A,具有有限样本无偏性;这不需要正态。HC3使用删除预测残差的平方,由式(2)还可写成
这里以完整估计为中心且没有额外倍数,不等于任何约定下都相同的、以删除估计均值为中心的jackknife方差。由于0≤h_i<1,有V̂_HC3−V̂_HC2半正定;“数值更大”不自动意味着覆盖率更准确。
一般异方差下HC2并非有限样本无偏。取无截距X=(1,2)ᵀ、独立零均值误差方差(1,4),真实Var(β̂)=17/25。此时h=(1/5,4/5),E e_1²=32/25、E e_2²=8/25,代入式(8)得到E V̂_HC2=8/25,明显不同。稳健渐近校准需要设计杠杆和矩条件,不能靠名称中的“修正”保证所有有限模型。
计算与迁移
用薄QR分解X=QR,H=QQᵀ,h_i等于Q第i行平方和;不必存n×n的H。分解及各行求值需O(np²+p³)算术工作、O(np+p²)存储。解出β̂、e后,全部标量h_i、r_i、t_i、D_i可在O(n)附加工作内得到;若还输出每个删行系数向量,则要解相应p维三角系统并计入O(np²)工作和输出空间。病态设计应使用QR/SVD及秩判定,不把浮点1−h_i很小误判为精确零。
固定一个可逆p×p特征换基矩阵R,将X换成XR、系数换成R^(−1)β,列空间、H、e、学生化残差和D_i都不变。原始系数的欧氏差则会随坐标改变;Cook量使用XᵀX作为尺度,正好消除了这种表示依赖。
这些残差修正也可用在野生Bootstrap的逐行扰动尺度中。是否使用原残差、HC2型或HC3型残差必须写进生成规则,它们的有限条件协方差并不相同。
参考资料
- Ingo Ruczinski,“Residuals and Influence”,Johns Hopkins 140.752课程讲义,Ch.14,印页45–46,14.1–14.10:残差协方差、杠杆、两类学生化及Cook量。本页补全删除保秩与正态投影证明。
- C. F. J. Wu,“Jackknife, Bootstrap and Other Resampling Methods in Regression Analysis”,Annals of Statistics14(4),1986,1261–1295正文,§5与§7:杠杆校正及保留逐行残差的重抽。
- Russell Davidson、Emmanuel Flachaire,“The Wild Bootstrap, Tamed at Last”,作者2007年4月稿,§2印页3–4;正式刊于Journal of Econometrics146,2008,162–169。HC0–HC3与不同残差变换的接口,本页不据此声称普遍有限样本优越性。