返回学习路线
一个数值结果,究竟凭什么支持推断?
核心任务
你需要交出估计值、所估目标、求解证书、标准误和适用条件。下面的数据表与总体模型分开使用:数据表验证算术,总体模型验证重复抽样下的保证。不能用五个残差的形状代替对总体假设的声明。
核心路线经过 M-估计理路M-估计M-estimation · M-estimator通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。、参数化一致大数律理路参数化一致大数律Parametric uniform law of large numbers用紧参数集和可积随机 Lipschitz 界,把逐点大数律提升为同一样本上的全参数控制。、Argmin 一致性理路Argmin 一致性定理Argmin consistency theorem用总体分离、随机一致逼近和近似求解容差,把样本准则的极小点定位到总体目标。、Z-估计理路估计方程与 Z 估计Z-estimation · Estimating equation区分求根和极小化,给出多根定位、近似残差与局部 Jacobian 线性化的完整接口。、sandwich 协方差理路Sandwich 协方差估计Sandwich covariance estimation从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。、数值误差预算理路统计与数值误差预算Statistical and numerical error budget将样本量、局部曲率与求解残差联动,判定近似算法是否保留目标估计量的一阶推断。及错配目标理路伪真参数与错配目标Pseudo-true parameter在真实分布不属于工作模型时,明确准则实际收敛的目标,并分开目标偏差、抽样方差和数值误差。。
A. 从五行数据算出一张协方差
使用截距与斜率模型,数据为 、。得分约定为 ,。
- 求OLS估计、残差、平均得分的 Jacobian 与未中心化 。
- 给出HC0协方差、两坐标标准误以及 处拟合均值的标准误。
- 与使用 的同方差公式比较。五行数据能否证明两种方法中某一种已有精确95%覆盖?拟合均值标准误能否当成新个体预测误差?
B. 给计算找到明确的总体保证
现在使用另一个、无截距的标量总体模型: 等概率取1或2, 独立等概率取 ,,每条 独立同分布。定义平均损失 。
- 写出总体风险 、总体极小点及分离裕度;说明所报参数是什么。
- 用显式解证明一致性与渐近正态,并算出 ;说明普通同方差公式错在哪。
- 给出可由样本计算的协方差公式,并验证插件一致性所需矩条件。
- 若求解器只交付平均准则差上界 ,要求什么数量级可保证计算结果保持精确估计量的一阶分布?
C. 四种相似外观,四个不同故障
逐项指出失效步骤,而不只写“正则条件不成立”:
- 的梯度求解器返回0,且残差完全为零。
- IID,估计方程为 。
- , IID,;平均二次损失求解器返回精确解加 。
- 对正偶数 的IID 样本,分别计算两个半样本均值,再挑较大者报告,仍使用固定半样本均值的标准正态校准。
D. 目标也可能变了
同一离散总体满足 。分别计算平方损失与固定阈值1的Huber位置目标。若研究问题是总体均值,可以不加说明地用其中另一个目标的区间代替吗?
核心完整解答
A. 每个矩阵与每一个 n 都要对齐
、、、,故 。残差为 ,满足 。
两坐标SE约为0.451664、0.332566。 处均值估计为3.3,SE为 ,必须保留两个非对角项。
,,同方差协方差为 。这些是不同的方差估计规则,不能由一份五行样本单独验证覆盖率。HC0依赖大样本校准;普通精确t区间还要求正确的固定设计正态同方差模型。新个体预测区间要再包含其响应噪声,均值响应SE没有那一项。
B. 明确总体,才能说明重复抽样
因为 ,
目标为真实条件均值 的系数 ;总体平均损失 的分离裕度为 。如果先限制在任意含真值的固定紧区间,数据有界给可积Lipschitz包络,故可用ULLN与argmin定理。全实轴无需强行证明平方损失全局一致收敛,可直接使用显式解。
分母趋于 ,分子趋零,得到一致性。得分 满足 、。有限方差CLT给
样本插件为
有界,样本解一致,所以残差与真实误差的差为 ;代入外积后交叉项和平方项均由有界经验矩乘一个趋零因子控制。故该插件乘以 趋于 。同方差公式却使用 ,漏掉误差大小与设计大小相关带来的加权效应。
平均准则满足精确恒等式 ,且 。因此 足以使计算误差为 。若优化总损失,则对应总gap为 。这项容差控制参数的一阶推断;风险超额则恰为 ,两个对象不可混写。
C. 定位、线性化、尺度与选择分开诊断
- 梯度真根0是严格局部极大点,。求根没有完成要求的全局极小化;最小点为 。
- 总体根0唯一且估计一致,但 。正确速率为 ,极限为标准正态变量的实立方根;失效的是非奇异一阶反演,不是总体识别。
- 曲率为 ,精确解SE为 。附加偏移恰为一个SE,尽管平均梯度残差只有 。要按真实尺度保护一阶分布,梯度残差需为 。
- 标准化后报告的是两个独立标准正态的最大值,分布函数为 。若采用标准正态上侧5%临界值,拒绝率为 ,直接显示错误校准。此特例对称双侧区间可偶然保持覆盖,不意味着整个枢轴仍为标准正态。固定配置的正态定理没有覆盖数据驱动选择;数值误差为零也不能修复此问题。
D. 稳健标准误并不更换目标
平方损失目标为均值1。Huber在 的总体得分为 ,故目标为 。若报告目标是总体均值,Huber固定阈值区间围绕另一个泛函,不应冒充均值区间;需要改变估计方法或明确更改目标。这里是损失投影比较,不把离散分布对连续正态的无穷KL误写为有限KL投影。
选读迁移题与答案
群标签改变哪一个矩阵
三个独立群的观测为 ,只拟合截距。由群总得分理路聚类稳健协方差估计Cluster-robust covariance estimation · CR0 covariance把独立群的总得分作为方差单位,计算回归 CR0 并识别少群、错误分组和秩不足的边界。计算CR0,并解释为何所有行合为一群会出现零。
答案:均值2,群得分 ,,CR0为 ;逐行HC0为 。所有行合为一群时,唯一群得分等于OLS总得分零,方差为零是缺少群间重复的故障。若 个系数、 个群,群得分和为零使协方差秩至多 。不得通过合并群来人为缩小标准误。
留出折是否真的被留出
使用交叉拟合理路交叉拟合与正交得分Cross-fitting and orthogonal score逐折隔离 nuisance 拟合,并用条件化与乘积余项说明何时样本外得分能进行根号样本量推断。的四行缺失均值数据:第一折已见结局2并有一个缺失,第二折已见4和6,观察概率已知为1/2。训练回归器是训练折已见结局的均值。
答案:用第二折训练的5评价第一折,得分为−1和5;用第一折训练的2评价第二折,得分为6和10,平均5。两个 nuisance 误差为 和 时,其乘积为 ;两个都只有 时不能由这条界排除一阶偏差。条件化按折进行,折间无需独立,所有调参也必须留在对应训练补集中。
影响小与难以崩溃是两种结论
对五点样本,中位数与两端各删一个观测的截尾均值,最少多少次替换能使输出无界?与替换崩溃点理路有限样本替换崩溃点Finite-sample replacement breakdown point明确最少破坏比例的约定,精确计算奇偶中位数和截尾均值,并区分局部影响与全局污染。定义对齐。
答案:中位数需要3次,截尾均值需要2次;相应最少失败比例为3/5和2/5。若改报最大仍保证有界比例,分别是2/5和1/5。这里比较固定样本的最坏替换,不是置信覆盖,也不是无穷小污染影响函数。
选读 HAC的窗口目标与迁移
本题是原核心验收后的独立选读,沿用平均得分的定标理路Sandwich 协方差估计Sandwich covariance estimation从得分与敏感度的样本矩阵算出可复核的协方差、对比标准误和异方差稳健推断。并调用HAC协方差接口理路HAC协方差估计与Bartlett窗口HAC covariance estimation · Newey–West covariance estimator · Bartlett HAC estimator将按时间排列的得分转成半正定Bartlett长期协方差,证明有限窗口恒等式,并在明确的高斯有限MA模型下完成一致性、均值标准误与失败诊断。。
任务:复算、换输入、找失效步骤
- 输入均值残差 ,。分别算共同分母的两个样本自协方差、硬截断与Bartlett结果、四个补零窗口和、均值方差及SE。说明哪一项结果有有限样本代数保证,哪一项还需总体条件。
- 独立高斯创新方差为1,。用协方差配对与创新系数平方和两种方法求 的精确均值方差,再求 。比较IID尺度及长期近似。永远固定 是否一致?
- 迁移到二维得分 ,先按列减样本均值,取 、平均敏感度 、对比 。给 、、对比方差;把所有原始得分加上 后结果改变吗?这次运算没有假定它们来自OLS正规方程。
- 在已冻结规则的有序损失差上迁移同一均值算法,需要补哪些条件?若把规则改成每天重选、数据发生结构突变,能否沿用有限高斯MA证明?再依次诊断:硬截断、逐滞后分母 、固定带宽、非零总体得分均值、长期方差为零。
完整答案
第一题:、。硬截断给 ,Bartlett给 ;窗口和为 ,平方和除以6也是 。,故均值方差为 ,SE为 。窗口平方和保证所有有限输入半正定;三点数据没有认证区间覆盖。
第二题:、、。一般有限均值方差为
另一算法按创新分解:端点创新系数是 ,中间 个系数是 ;独立性使方差等于系数平方和。两种算法在 给 ,在10与100分别给 。时IID公式为 ,长期近似为 。若 固定,Bartlett插件趋于 而非 。本模型可用确定性 ,例如 ,让估计噪声和窗口偏差都消失。
第三题:中心化后为 。四个窗口和为
外积和除以6得到
所以对比方差为 ,SE为 。删掉非对角项会误报 。平移原始输入后中心化得分相同,全部结果不变;不中心化则不是同一计算。若将敏感度改为求和形式 的正号面包矩阵,要同时把中间矩阵改为 ,最终协方差保持相同,不能多除一次3。
第四题:需声明损失差的目标均值、平稳/依赖模型、适用CLT、带宽与中心化一致性,以及正的长期方差。有限高斯MA只是其中一个已证明模型,普通损失差并不自动高斯或有限阶MA。每天改规则或结构突变后,相同目标与平稳结构都需重新证明;信息没有泄漏并不足以推出HAC有效。
- 硬截断会破坏半正定,第一题已经给负值
- 改分母会破坏窗口恒等式;对 共同分母给 ,改用滞后一阶分母3则给
- 固定 即使覆盖全部非零滞后仍留下Bartlett收缩,目标错成
- 非零总体得分均值使估计中心存在偏差;协方差替换和样本中心化都不能修复科学目标
- 使长期方差为零,普通根号样本量的正方差学生化失效
运行标准库复算器可核对标量、二维与有限MA结果。无参数运行会同时做非法输入、奇异敏感度、零方差、中心化平移和负矩阵测试;其算术成功与模型条件未认证分别报告。
验收标准
必须保留A的得分符号、B的非对角项和最后的样本量定标;解释拟合均值与预测、固定样本算术与总体重复抽样的区别。至少完成一次一般证明(argmin事件包含或Z积分Jacobian)并说明每项条件在B模型中如何检查。
关键失败包括:将所有真根称为极小点;把一致性当作正态性;以固定曲率残差阈值处理变弱识别;把普通方差更换成sandwich后宣称目标偏差被修复;把训练内预测当成交叉拟合;或在少数群上用总行数声称精度充分。