先写出要保护的概率,再选择校准程序
“覆盖90%”可以指训练与未来点共同平均后的覆盖,也可以指至少95%的校准资料都会产生覆盖不低于90%的部署规则。这两个任务需要不同的计算。下面还加入第三种目标:预测集合允许漏掉少量真实标签,但平均漏失比例必须受控。
所有拟合流程、评分、菜单和损失都在其校准资料之外预先固定。每个任务先给输入,再交出完整规则、可复算结果和可迁移的条件边界。
任务一:四个响应怎样复用训练资料
忽略输入,拟合器返回训练响应均值。历史响应为
端点必须和自己的模型配对
Jackknife+的四个模型值为
下秩为1、上秩为4,得到
CV+的两个折外模型分别预测3和0,对应残差为
同样的端点秩给出
所以本单元证明给出的覆盖下界是
若改要90%的最坏保证
Jackknife+按通用界可取内部
这不等于“CV+绝不可能覆盖90%”:小于1/5的内部α也会使本例输出整个实轴,此时可直接认证覆盖为一。正确结论是这项有限折通用下界不够锐,而无穷端点另有平凡但真实的保证。不能为得到有限区间而把不存在的秩夹到观测极值。
训练样本数跳变的拟合器还提供检查接口:响应恒零,偶数训练规模预测100、奇数规模预测0。取四个历史点且沿用
任务二:非等宽集合把覆盖资源分给了谁
采用CQR分数
A、B两组分数分别在
真实未来分数为s时,其被接受的概率为
A组覆盖约为0.871909,按9:1加权恰好为0.8。B组的预测集合甚至以约0.616854的校准概率为空。这三份数值均可由多项式积分和二项尾精确重算。
左图是另一份具体校准结果
修复目标时要改校准合同
若要求A、B分别受到保护,可以在校准前固定这份输入划分,再按分割共形的组内规则分别校准。假设实际九个校准观测中B组只有一个,则该组所需秩为
这确实避免当前群组漏盖,但也展示代价:稀有组资料太少,非平凡集合可能无从保证。原模型的两个边界很准确,并不能补出没有采到的校准信息;将两组重新混合取得有限阈值,则又回到仅保护边际的合同。
任务三:从零一覆盖改成多标签漏失损失
标签A、B、C的冻结排序为A、B、C。三个动作依次输出前一个、前两个、全部标签。真实标签集合依次为
要求
若改要求95%的校准资料产出真实风险不超过2/5的规则,则使用RCPS。Hoeffding半径是
两份结果并不冲突。一个精确小模型能看清差别:首动作损失Bernoulli(1/2),末动作零损失,仍取n=4。CRC在校准总损失至多1时选择首动作,这些校准资料占5/16。平均部署风险为5/32,低于2/5;但风险超标的资料比例是5/16,远大于0.05。
交付时顺手检查两个容易混淆的量
中间标签集合在四行中总共漏一个标签,真实标签共六个,合并计数为1/6;逐观测比例平均却是1/8。本任务保护后者,不能把前者写进证书。
另有100份真正IID资料且经验均值相同,Hoeffding半径约0.122387,RCPS即可选中间动作。把这四行复制25遍没有这个效果,因为有效抽样模型没有变成100份独立观察。
任务四:为一次长期部署选择校准秩
现在回到冻结的实值评分,校准及未来资料IID,分数CDF连续。可用99份校准观测,目标是至少95%的校准资料产出未来覆盖至少90%的规则。这里不固定未来输入x,只固定整份已实现校准资料。
普通边际90%校准会选
按双层目标重新选秩,比较相邻两个门槛:
故最小合格秩是95,部署阈值应取第95小校准分数。其平均覆盖提高为0.95;实际那份校准资料的覆盖仍未知,但至少95%的资料会达到0.9。这是通过校准样本的随机性给出的外层保证,不是直接观测到了总体覆盖率。
若只有很少校准数据,可先检查最大秩:同样的90%/95%合同,分布无关二项认证首次允许有限阈值是在n=29。连续F时这是当前有限秩规则的必要门槛;离散F可能更早合格,例如分数恒零时条件覆盖总为一。不能把29解释成每一种固定总体都必须支付的样本数。
复算、输入合同与停止位置
下载标准库精确复算脚本与运行结果。脚本用Fraction枚举留一/保折比较矩阵、单调损失表、风险后缀选择与二项概率,并以80位Decimal计算所列Hoeffding半径;CQR群组覆盖由有理多项式积分得到,不以随机模拟比例代替证明。
迁移时逐项填写:允许读取哪些训练/校准资料,拟合是否排列对称,折是否预固定,评分是否冻结,损失是否逐点单调且有界,阈值秩是否存在,所需概率是否固定了校准资料或输入群组。哪一项改变,便回到相应定理重新检查。
本单元没有给逐输入覆盖、非IID时间序列、标签依赖折划分、任意数据依赖损失菜单或无界损失的统一保证。脚本的有限枚举发现实现错误,分布无关和全部样本规模结论由正文证明承担。