同一份“重抽很多次”的程序,可以在不同问题里逼近不同对象。本终点依次改变估计目标、目标的可微性、设计分组和特征坐标,要求每次都核对抽样单位与误差尺度。返回学习路线。
使用小规模有放回重抽、无放回子样本、野生回归重抽及杠杆和学生化残差的明确输入合同。以下小表的精确条件概率,不等于渐近区间已在小样本下具有精确覆盖。
任务一的端点定理限定均匀总体;若对输入条件还不熟悉,可先复习分布收敛,辨认子样本定理假设的原始根极限。
任务三的渐近合同还要求设计极限矩阵正定,并以标准正态分布作为对比根的极限。
任务四只有在另加联合正态误差时才使用精确Student t分布校准;杠杆与删行恒等式本身仍不需要正态。
任务一:未知两个端点时,指数极限还能原样使用吗
现在观察Uniform(a,b),a<b都未知,目标是宽度w=b−a。取n≥2,L_n=min X_i、U_n=max X_i、R_n=U_n−L_n。证明n(w−R_n)/w的极限,说明m条经验有放回重抽的相应修复,再用资料(1,2,4,5,8,10)、m=3列出完整条件分布。与无放回b_s=3比较,这里的b_s表示子样本大小,不是总体上端b。
答案:要保留两个边界间隙
对于固定s,t≥0且s+t≤n,所有观测都落在(a+sw/n,b−tw/n)的概率为
边界处严格不等号没有质量。结合两个边缘尾,这给两个间隙联合趋于独立Exp(1),故
G是Gamma(2,1),不是一个指数变量。它的两个独立贡献分别来自未看到的左端和右端。
重抽中令L_m^、U_m^为最小值和最大值,R_m^=U_m^−L_m^*。给定原来的两端与对应索引,其余n−2条资料独立均匀分布在(L_n,U_n)。对固定s,t>0,m>s+t时,落在左右宽度sR_n/m、tR_n/m的记录总数为
两个端点自己贡献2。所有m次重抽都避开这两段的条件概率为(1−N_n(s,t)/n)^m,恰为两份重抽边界间隙同时超过s、t的概率。若m→∞、m/n→0,则
沿正式页的对数余项估计,联合尾趋e^(−s−t)。单边计数也成立;零点原子的概率由抽中任一原端点的概率≤2m/n控制。因此
且因Gamma CDF连续,可取整条CDF的一致收敛。一般无放回子样本结论也适用:n(R_n−w)⇒−wG,b_s/n→0使中心误差可忽略,再利用R_n→w完成尺度换算。
完整小表与两个不同的原子
给定n个互异排序值,有放回m条的最小/最大索引i<j的概率为
这是先限定全部落在[i,j],再用容斥要求两个端点都出现。i=j时所有抽取都同一条,概率1/n^m。无放回取b_s≥2条,最小i、最大j的概率则是C(j−i−1,b_s−2)/C(n,b_s),因为两端已选定,内部还须取b_s−2条。
本次R_n=9,两种规则都看根3(9−R^*)/9。完整质量如下,空格项为零:
| 根值 | 0 | 1/3 | 2/3 | 1 | 4/3 | 5/3 | 2 | 7/3 | 8/3 | 3 |
|---|---|---|---|---|---|---|---|---|---|---|
| 有放回m=3 | 5/36 | 1/9 | 1/9 | 1/6 | 1/18 | 5/36 | 5/36 | 1/18 | 1/18 | 1/36 |
| 无放回b_s=3 | 1/5 | 3/20 | 3/20 | 1/5 | 1/20 | 3/20 | 1/10 | 0 | 0 | 0 |
根为零表示同时保留原最小和最大。有放回概率1−2(5/6)^3+(4/6)^3=5/36;无放回概率b_s(b_s−1)/(n(n−1))=1/5。只计算“至少保留一个端点”会得到错误事件。
两张表的3/4分位数分别为2和4/3。按原始n尺度构造上端R_n/(1−c^*/n),得到27/2与81/7;不能把分母n换成3。这些数只演示规则,不宣称有限六条资料已有75%覆盖。
用精确模型检查渐近声称的边界
Uniform样本极差的标准化V=R_n/w具有密度n(n−1)v^(n−2)(1−v),0<v<1。可从最小、最大联合密度n(n−1)(u−l)^(n−2)/w^n,对可行左端l积分得到。因此
若r_α是式(4)的α分位数,则[R_n,R_n/r_α]有精确1−α覆盖;总体位置a已被消掉。n=6、α=1/4时,式(4)在3/5的值为729/3125<1/4,在31/50的值为830245379/3125000000>1/4,故r_α∈(3/5,31/50)。精确区间上端落在(450/31,15),与前面两份小表上端不同。这里的额外保证来自已知Uniform模型的精确极差律,不是更多重抽次数。
任务二:绝对值尖点不用导数,怎样校准
X_i为公平±1,估计θ=|EX|,使用T_n=|X̄_n|。说明为什么普通光滑Delta方法不能在真实均值0处直接使用,而无放回子样本定理仍可用。给定八条资料中六个+1、两个−1,取b_s=3,求完整子样本根及3/5分位数,再与m=3有放回作对照。
答案:连续极限与可微线性化是不同要求
√nX̄_n⇒Z,因此√n|X̄_n|⇒|Z|,其CDF在z≥0为2Φ(z)−1,在负半轴为零,整条连续。绝对值在0处没有导数,不能把不存在的导数代入光滑Delta公式;但子样本定理只要求这份连续极限及√(b_s/n)→0。
固定表中T_8=1/2。设三元子集含k个正号;k=0、1、2、3的组合数为0、6、30、20,总数56。k=1、2时子样本绝对均值为1/3,k=3时为1。于是
有放回m=3时正号次数为Bin(3,3/4);绝对均值为1/3的概率9/16,为1的概率7/16。由于
无放回的3/5分位数为−√3/6,有放回则为√3/2,差异不只是某个分母多一位小数。
有限表的根可以为负,虽然极限|Z|非负;这并不矛盾,原中心T_8=1/2在如此小的b_s上还不微小。定理要求沿原始随机资料序列使√b_s T_n趋于零,而不是声称每张固定小表都长得像最终极限。若要构造原θ区间,应把所选根分位数除以√8,不能除以√3。
任务三:不平衡组均值差需要保存哪些波动
设计前三行是(1,0),后两行是(0,1),响应(1,2,3,5,9)。目标对比是第二组均值减第一组均值,c=(−1,1)ᵀ。求HC0、HC2、HC3,列出基础Rademacher重抽的完整对比误差分布,并用一次具体重抽比较“重新学生化”与“冻结原尺度”。最后判断混池残差在组间异方差下的长期尺度。
答案:逐行权重留在原组
XᵀX=diag(3,2),β̂=(2,7)ᵀ,原对比为5。残差e=(−1,0,1,−2,2),杠杆为前三行1/3、后两行1/2。于是
对应对比方差分别20/9、13/3、17/2。三者来自三份不同的残差生成尺度,不能在同一轮代码中随意切换而仍引用原来的条件律。
基础版本有
第二个乘子ξ_2乘的是零残差,但仍属于32份等概率符号记录。对比误差Δ_2^−Δ_1^的完整质量为
| 值 | 0 | 每个±2/3 | 每个±2 | 每个±4/3 | 每个±8/3 |
|---|---|---|---|---|---|
| 概率 | 1/4 | 1/8 | 1/8 | 1/16 | 1/16 |
由这张表直接算方差20/9,与式(6)的HC0一致。
取具体乘子(+1,−1,−1,+1,−1)。扰动为(−1,0,−1,−2,−2),得到β̂^*=(4/3,5),对比误差−4/3。重新拟合后的残差为(−1/3,2/3,−1/3,0,0),所以重抽HC0对比方差为2/27,学生化根为
若冻结原HC0对比方差20/9,则根为−2/√5。它们是两种统计量;正式页式(4)的证明对应前一种重新学生化规则。
混池残差为何会趋向错误尺度
当前残差池的平均平方是2。均匀有放回从这个池重抽并分回五行,会使两组都使用同一误差方差2,给对比条件方差2(1/3+1/2)=5/3,已经不同于基础野生重抽的20/9。
现在考虑组大小共同增长,比例分别趋3/5、2/5,真实独立误差方差分别为1、4,满足统一四阶矩。真实对比的n倍方差趋于
混池方差却趋于(3/5)·1+(2/5)·4=11/5,从而n倍对比方差趋于
比例为11/14,并不趋于1。有限样本的统一自由度修正n/(n−2)也趋于1,修不好这个结构差异。野生重抽保留每行属于哪组,通过得分平方平均恢复正确尺度;并不要求每条e_i²都成为该行方差的一致估计。
任务四:小残差、高影响与坐标变换
拟合带截距直线,x=(−1,0,1,2,8)、Y=(1,0,1,0,7)。最后一行的原残差并不最大,检查它的删除影响、外学生化与Cook量。再把特征从(1,x)改成(1,1+2x),核对哪些量应不变。最后说明只看原满秩为什么不能保证全部删除诊断可用。
答案:删除的是信息,不能只看竖直距离
直接计算
此处n=5、p=2、ν=3。最后行h_5=23/25、e_5=16/25。删除公式给
剩余方差估计s_{−5}²=(4/5)/2=2/5,进而
原残差最大的是第四行,绝对值9/5,远大于最后行16/25;但最后行几乎独自把拟合斜率从负数拉到正数。Cook量记录整条拟合的变化,所以会对这份几何敏感。
如果第五行在看Y之前已指定、且误差确为同方差正态,则t_5=8/√5参考t_2分布,其双侧尾概率为1−8/√74,约0.070。这既不同于正态尾,也不是扫描后选择最大诊断量的整体p值;很大的Cook量不等于一份自动删行的显著性结论。
换特征坐标,不应改变拟合诊断
令
新行正是(1,1+2x)。新系数β̂'=R^(−1)β̂=(−1/10,19/50),删行系数β̂'_{−5}=(7/10,−1/10)。它们的系数差欧氏平方为544/625;旧坐标下为640/625,两者不同。
但
因此拟合值、残差、h_5、t_5和D_5完全不变。只比较原始系数的欧氏距离,会把单位和坐标选择误当成统计影响。
若设计改为三行(1,0)、(1,0)、(0,1),原设计仍满秩,删第三行却只剩第一列方向,第二个系数不可识别。h_3=1恰好记录这件事;残差为零也不表示该行“不重要”。所有含1−h_3的诊断应报告前提不满足,而非加一个小常数继续。
复算与验收
公开精确程序和结果记录保留全部子集与符号枚举、极差端点容斥、删行重拟合和有理矩阵证书。根式比较用有理系数或平方恒等式,未用浮点相等冒充精确。
完成本终点,应能分别指出:原始资料的重复抽样律;给定资料后的重抽律;有限模拟近似的计算误差;学生化的分母来自哪一份拟合;以及哪些结论仅在n增长时成立。代码重放有限记录,完整概率极限仍由正文证明承担。