形式陈述
一项推断程序有两个不同输出:理论上定义的估计量 ,和计算机真正返回的 。设确定尺度 下
这里的 可以是渐近正态极限理路估计量的渐近正态性Asymptotic normality of estimators估计误差在明确中心、速率与协方差下趋于正态律,以及线性化、标准化和边界失效机制。,也可为其他分布。若计算误差满足
则 依分布收敛理路依分布收敛Convergence in distribution · Weak convergence分布函数在极限分布连续点处收敛的随机变量收敛概念。到同一个 。证明是在统计误差与计算误差的恒等分解中应用Slutsky 定理理路Slutsky 定理Slutsky's theorem依分布收敛随机量与依概率收敛常量组合时,和、积与合法商保持相应分布极限。。本页研究如何从实际可检查的数值证书推出这个条件,而非把它当成求解器默认保证。
从平均准则差到一阶可忽略性
设 为按样本量平均的随机准则理路M-估计M-estimation · M-estimator通过随机准则的精确或近似极值选择参数,并把样本准则与总体识别目标分开。。在概率趋于一的事件上,假定精确解 和计算输出 位于同一凸集合,且在该集合有已验证的二次增长
若可认证 ,则
因此 是充分条件。固定非退化曲率、 时,它成为平均准则差 。若程序优化未平均的和 ,同一要求写成总准则差 ;不能在两个定标之间沿用同一数字容差。
从梯度或方程残差到证书
若 可微、-强凸理路强凸性Strong convexity · Strongly convex function函数在一阶凸下界之外还保留统一二次增长量的曲率性质。,且精确极小点位于内点,则强单调性与 Cauchy–Schwarz 给出
故 足以保持极限。约束极小点的普通梯度不必为零,需要适当的投影梯度或 KKT 误差界,不能直接套用这个内点版本。
对一般向量方程,应另证局部逆界 ,再检验 。可逆 Jacobian 在解处只给局部信息;如果算法未进入该邻域,这不是全局证书。一般残差与误差估计理路残差、误差估计与停止准则Residual and error estimation · Stopping criterion区分可计算残差与未知真误差,并说明把缺陷转成误差界和停止证书所需的条件。解释这种数值转换,本页增加的是它与统计尺度的联动。
直觉
“计算误差比统计误差小”必须比较同一种单位。准则差、梯度残差、参数误差和标准误各用不同标尺;曲率或逆 Jacobian 负责转换。固定一个很小的数字容差,可能在小样本过度计算,在大样本又不足以保留区间的中心。
这项预算也不能改变统计目标。如果准则估计的是错配模型的伪真参数,数值精确只意味着更准确地求出那个参数,不意味着模型偏差消失。
例子与边界
一致性的容差不足以保护正态中心
取 独立同分布,。精确解为 ,曲率恒为1。若返回 ,则准则差恰为 ,所以计算输出仍一致。
但其标准化误差为 ,偏移发散,围绕该输出使用通常标准误 的固定水平区间覆盖趋于零。若偏移改为 ,准则差恰为 ,标准化极限为 。这说明 差也不够保证不变中心;若只凭这个 gap 上界保护同一中心,可采用小 这一充分条件;否则需要进一步分析并把可能的偏移纳入分布。
一次可审计的停止选择
仍取曲率1、标准误 。希望计算误差最多占一个标准误的 ,可要求
、 时,参数误差预算为 ,平均准则差上限为 ,平均梯度残差上限为 。总准则的 gap 上限则是 。实际程序还需证明 gap 上界,例如用可行对偶下界;只把当前目标减去上一轮目标不能当成 。
固定的 给“至多百分之一标准误”的数值控制,并不字面蕴含渐近可忽略。若要沿整个样本序列保持完全相同的一阶极限,需安排 。有限精度下若无法进一步下降,应报告当前误差预算和舍入平台,而非无限迭代。
弱识别时必须重新计算尺度
令第 个实验观察 , IID, 已知。平均二次准则的精确解为 ,曲率为 ,统计标准误为 。常规根号样本量方差稳定的假设在此失效,但有效尺度 仍给精确标准正态。
返回 时,平均梯度残差为 。它看似满足常规固定曲率下的残差要求,却恰好产生一个统计标准误的偏移。正确条件是
因为 。当 时,数据分布完全不依赖 ,连识别都不存在;把容差继续收紧无法解决。
数据复用还会改变选择后的分布
取正偶数 ,把 IID 的观测平均分成两半,得到两个独立半样本均值 。每一个预先固定的方法都满足 。若看过两者后挑大的那个报告为 ,则
不是标准正态。例如用标准正态上侧5%临界值 检验,真实拒绝概率为 。这个直接计算定位了错误校准;此特例的对称双侧区间可能碰巧保持覆盖,不能由此恢复完整的标准正态枢轴。优化器即使完全精确,选择步骤仍改变了推断对象的分布。把同一数据用于选择阈值、模型或估计规则后,固定配置下的点态定理不能直接套给选出的配置;需要隔离选择、联合分析或选择后的校准。
推论与应用
评价算法停止状态时,应同时记录:平均还是求和准则、目标参数或对比、统计抽样单位、可用误差证书、曲率或逆界、已达到的数值阈值,以及最大迭代数或非有限值退出。求解成本由算法另行报告;本页的阈值不预言达到它需要多少步。
近似 ERM理路近似 ERM 与优化误差approximate ERM · optimization error刻画训练目标未被精确最小化时,经验次优量如何进入总体超额风险。把准则差加入总体风险界;这里则要求计算误差不改变参数的一阶分布。风险保证足够的容差可能不足以做参数区间,反之继续求解到机器精度也不修复泛化、识别或数据选择问题。
自测与答案
- 若 、,认证平均 gap 为 ,是否足够?答案:足够,。
- 若只认证当前点和上轮点的目标差为 ,能否声称 gap 已达 ?答案:不能。缓慢变化、过小步长或舍入停滞都可能发生在远离最优处,尚缺最优值下界或有效残差误差界。
参考资料
- Whitney K. Newey 与 Daniel McFadden,Large Sample Estimation and Hypothesis Testing,1994,§2.1(印刷2121–2122页)近似极值的一致性,§3.1 局部渐近正态;本页的容差换算由二次增长不等式直接推导。
- A. W. van der Vaart,Asymptotic Statistics,1998,Ch.5:近似极值与近似方程估计。本页不把一般收敛容差等同于保留一阶推断的容差。