Skip to content

同一份“重抽很多次”的程序,可以在不同问题里逼近不同对象。本终点依次改变估计目标、目标的可微性、设计分组和特征坐标,要求每次都核对抽样单位与误差尺度。返回学习路线。

使用小规模有放回重抽、无放回子样本、野生回归重抽及杠杆和学生化残差的明确输入合同。以下小表的精确条件概率,不等于渐近区间已在小样本下具有精确覆盖。

任务一的端点定理限定均匀总体;若对输入条件还不熟悉,可先复习分布收敛,辨认子样本定理假设的原始根极限。

任务三的渐近合同还要求设计极限矩阵正定,并以标准正态分布作为对比根的极限。

任务四只有在另加联合正态误差时才使用精确Student t分布校准;杠杆与删行恒等式本身仍不需要正态。

任务一:未知两个端点时,指数极限还能原样使用吗 ​

现在观察Uniform(a,b),a<b都未知,目标是宽度w=b−a。取n≥2,L_n=min X_i、U_n=max X_i、R_n=U_n−L_n。证明n(w−R_n)/w的极限,说明m条经验有放回重抽的相应修复,再用资料(1,2,4,5,8,10)、m=3列出完整条件分布。与无放回b_s=3比较,这里的b_s表示子样本大小,不是总体上端b。

答案:要保留两个边界间隙 ​

对于固定s,t≥0且s+t≤n,所有观测都落在(a+sw/n,b−tw/n)的概率为

P{n(Ln−a)w>s,n(b−Un)w>t}=(1−s+tn)n⟶e−s−t.

边界处严格不等号没有质量。结合两个边缘尾,这给两个间隙联合趋于独立Exp(1),故

(1)n(w−Rn)w⇒G,P(G≤z)=1−e−z(1+z)(z≥0).

G是Gamma(2,1),不是一个指数变量。它的两个独立贡献分别来自未看到的左端和右端。

重抽中令L_m^、U_m^为最小值和最大值,R_m^=U_m^−L_m^*。给定原来的两端与对应索引,其余n−2条资料独立均匀分布在(L_n,U_n)。对固定s,t>0,m>s+t时,落在左右宽度sR_n/m、tR_n/m的记录总数为

Nn(s,t) =d 2+Bin(n−2,(s+t)/m).

两个端点自己贡献2。所有m次重抽都避开这两段的条件概率为(1−N_n(s,t)/n)^m,恰为两份重抽边界间隙同时超过s、t的概率。若m→∞、m/n→0,则

E[mNn/n]=2m/n+(n−2)(s+t)/n→s+t,Var(mNn/n)≤(s+t)m/n→0.

沿正式页的对数余项估计,联合尾趋e^(−s−t)。单边计数也成立;零点原子的概率由抽中任一原端点的概率≤2m/n控制。因此

(2)P∗{m(Rn−Rm∗)Rn≤z}⟶PP(G≤z)

且因Gamma CDF连续,可取整条CDF的一致收敛。一般无放回子样本结论也适用:n(R_n−w)⇒−wG,b_s/n→0使中心误差可忽略,再利用R_n→w完成尺度换算。

完整小表与两个不同的原子 ​

给定n个互异排序值,有放回m条的最小/最大索引i<j的概率为

(3)(j−i+1)m−2(j−i)m+(j−i−1)mnm.

这是先限定全部落在[i,j],再用容斥要求两个端点都出现。i=j时所有抽取都同一条,概率1/n^m。无放回取b_s≥2条,最小i、最大j的概率则是C(j−i−1,b_s−2)/C(n,b_s),因为两端已选定,内部还须取b_s−2条。

本次R_n=9,两种规则都看根3(9−R^*)/9。完整质量如下,空格项为零:

根值 0 1/3 2/3 1 4/3 5/3 2 7/3 8/3 3
有放回m=3 5/36 1/9 1/9 1/6 1/18 5/36 5/36 1/18 1/18 1/36
无放回b_s=3 1/5 3/20 3/20 1/5 1/20 3/20 1/10 0 0 0

根为零表示同时保留原最小和最大。有放回概率1−2(5/6)^3+(4/6)^3=5/36;无放回概率b_s(b_s−1)/(n(n−1))=1/5。只计算“至少保留一个端点”会得到错误事件。

两张表的3/4分位数分别为2和4/3。按原始n尺度构造上端R_n/(1−c^*/n),得到27/2与81/7;不能把分母n换成3。这些数只演示规则,不宣称有限六条资料已有75%覆盖。

用精确模型检查渐近声称的边界 ​

Uniform样本极差的标准化V=R_n/w具有密度n(n−1)v^(n−2)(1−v),0<v<1。可从最小、最大联合密度n(n−1)(u−l)^(n−2)/w^n,对可行左端l积分得到。因此

(4)P(V≤v)=nvn−1−(n−1)vn.

若r_α是式(4)的α分位数,则[R_n,R_n/r_α]有精确1−α覆盖;总体位置a已被消掉。n=6、α=1/4时,式(4)在3/5的值为729/3125<1/4,在31/50的值为830245379/3125000000>1/4,故r_α∈(3/5,31/50)。精确区间上端落在(450/31,15),与前面两份小表上端不同。这里的额外保证来自已知Uniform模型的精确极差律,不是更多重抽次数。

任务二:绝对值尖点不用导数,怎样校准 ​

X_i为公平±1,估计θ=|EX|,使用T_n=|X̄_n|。说明为什么普通光滑Delta方法不能在真实均值0处直接使用,而无放回子样本定理仍可用。给定八条资料中六个+1、两个−1,取b_s=3,求完整子样本根及3/5分位数,再与m=3有放回作对照。

答案:连续极限与可微线性化是不同要求 ​

√nX̄_n⇒Z,因此√n|X̄_n|⇒|Z|,其CDF在z≥0为2Φ(z)−1,在负半轴为零,整条连续。绝对值在0处没有导数,不能把不存在的导数代入光滑Delta公式;但子样本定理只要求这份连续极限及√(b_s/n)→0。

固定表中T_8=1/2。设三元子集含k个正号;k=0、1、2、3的组合数为0、6、30、20,总数56。k=1、2时子样本绝对均值为1/3,k=3时为1。于是

(5)3(T3,I−T8)={−3/6,概率 9/14,3/2,概率 5/14.

有放回m=3时正号次数为Bin(3,3/4);绝对均值为1/3的概率9/16,为1的概率7/16。由于

9/16<3/5<9/14,

无放回的3/5分位数为−√3/6,有放回则为√3/2,差异不只是某个分母多一位小数。

有限表的根可以为负,虽然极限|Z|非负;这并不矛盾,原中心T_8=1/2在如此小的b_s上还不微小。定理要求沿原始随机资料序列使√b_s T_n趋于零,而不是声称每张固定小表都长得像最终极限。若要构造原θ区间,应把所选根分位数除以√8,不能除以√3。

任务三:不平衡组均值差需要保存哪些波动 ​

设计前三行是(1,0),后两行是(0,1),响应(1,2,3,5,9)。目标对比是第二组均值减第一组均值,c=(−1,1)ᵀ。求HC0、HC2、HC3,列出基础Rademacher重抽的完整对比误差分布,并用一次具体重抽比较“重新学生化”与“冻结原尺度”。最后判断混池残差在组间异方差下的长期尺度。

答案:逐行权重留在原组 ​

XᵀX=diag(3,2),β̂=(2,7)ᵀ,原对比为5。残差e=(−1,0,1,−2,2),杠杆为前三行1/3、后两行1/2。于是

(6)V^HC0=diag(2/9,2),V^HC2=diag(1/3,4),V^HC3=diag(1/2,8).

对应对比方差分别20/9、13/3、17/2。三者来自三份不同的残差生成尺度,不能在同一轮代码中随意切换而仍引用原来的条件律。

基础版本有

Δ1∗=(−ξ1+ξ3)/3,Δ2∗=−ξ4+ξ5.

第二个乘子ξ_2乘的是零残差,但仍属于32份等概率符号记录。对比误差Δ_2^−Δ_1^的完整质量为

值 0 每个±2/3 每个±2 每个±4/3 每个±8/3
概率 1/4 1/8 1/8 1/16 1/16

由这张表直接算方差20/9,与式(6)的HC0一致。

取具体乘子(+1,−1,−1,+1,−1)。扰动为(−1,0,−1,−2,−2),得到β̂^*=(4/3,5),对比误差−4/3。重新拟合后的残差为(−1/3,2/3,−1/3,0,0),所以重抽HC0对比方差为2/27,学生化根为

−4/32/27=−26.

若冻结原HC0对比方差20/9,则根为−2/√5。它们是两种统计量;正式页式(4)的证明对应前一种重新学生化规则。

混池残差为何会趋向错误尺度 ​

当前残差池的平均平方是2。均匀有放回从这个池重抽并分回五行,会使两组都使用同一误差方差2,给对比条件方差2(1/3+1/2)=5/3,已经不同于基础野生重抽的20/9。

现在考虑组大小共同增长,比例分别趋3/5、2/5,真实独立误差方差分别为1、4,满足统一四阶矩。真实对比的n倍方差趋于

13/5+42/5=353.

混池方差却趋于(3/5)·1+(2/5)·4=11/5,从而n倍对比方差趋于

115(13/5+12/5)=556.

比例为11/14,并不趋于1。有限样本的统一自由度修正n/(n−2)也趋于1,修不好这个结构差异。野生重抽保留每行属于哪组,通过得分平方平均恢复正确尺度;并不要求每条e_i²都成为该行方差的一致估计。

任务四:小残差、高影响与坐标变换 ​

拟合带截距直线,x=(−1,0,1,2,8)、Y=(1,0,1,0,7)。最后一行的原残差并不最大,检查它的删除影响、外学生化与Cook量。再把特征从(1,x)改成(1,1+2x),核对哪些量应不变。最后说明只看原满秩为什么不能保证全部删除诊断可用。

答案:删除的是信息,不能只看竖直距离 ​

直接计算

(XTX)−1=(7/25−1/25−1/251/50),β^=(7/25,19/25)T,e=(37/25,−7/25,−1/25,−9/5,16/25)T,h=(19/50,7/25,11/50,1/5,23/25),RSS=148/25.

此处n=5、p=2、ν=3。最后行h_5=23/25、e_5=16/25。删除公式给

β^−5=(3/5,−1/5)T,RSS−5=148/25−(16/25)22/25=4/5.

剩余方差估计s_{−5}²=(4/5)/2=2/5,进而

(7)r52=96/37<3,t52=64/5,D5=552/37.

原残差最大的是第四行,绝对值9/5,远大于最后行16/25;但最后行几乎独自把拟合斜率从负数拉到正数。Cook量记录整条拟合的变化,所以会对这份几何敏感。

如果第五行在看Y之前已指定、且误差确为同方差正态,则t_5=8/√5参考t_2分布,其双侧尾概率为1−8/√74,约0.070。这既不同于正态尾,也不是扫描后选择最大诊断量的整体p值;很大的Cook量不等于一份自动删行的显著性结论。

换特征坐标,不应改变拟合诊断 ​

令

R=(1102),X′=XR.

新行正是(1,1+2x)。新系数β̂'=R^(−1)β̂=(−1/10,19/50),删行系数β̂'_{−5}=(7/10,−1/10)。它们的系数差欧氏平方为544/625;旧坐标下为640/625,两者不同。

但

X′(X′TX′)−1X′T=X(XTX)−1XT=H,

因此拟合值、残差、h_5、t_5和D_5完全不变。只比较原始系数的欧氏距离,会把单位和坐标选择误当成统计影响。

若设计改为三行(1,0)、(1,0)、(0,1),原设计仍满秩,删第三行却只剩第一列方向,第二个系数不可识别。h_3=1恰好记录这件事;残差为零也不表示该行“不重要”。所有含1−h_3的诊断应报告前提不满足,而非加一个小常数继续。

复算与验收 ​

公开精确程序和结果记录保留全部子集与符号枚举、极差端点容斥、删行重拟合和有理矩阵证书。根式比较用有理系数或平方恒等式,未用浮点相等冒充精确。

完成本终点,应能分别指出:原始资料的重复抽样律;给定资料后的重抽律;有限模拟近似的计算误差;学生化的分母来自哪一份拟合;以及哪些结论仅在n增长时成立。代码重放有限记录,完整概率极限仍由正文证明承担。