“学习中的二阶量也需辨明对象。Rademacher 复杂度在线性类计算中用随机符号的二阶矩控制函数类对噪声的拟合能力;二阶专家界则用逐轮损失方差替代最坏时域项。两者都借助方差,却都不能把预测值…”
为什么看二阶量 ​
Hedge 的经典界把每轮损失范围都按最坏情况计费,最终得到
每轮记混合损失
以及相对差
相对专家
一个规范结论 ​
存在参数自适应的指数权重算法,例如 Squint,使对任意先验
其中
若只用一个固定学习率
前提是
势函数中的二次修正 ​
经典指数权重使用
若给专家权重乘上
二次项正好抑制过大的乐观累计。对专家求和的势函数不会爆炸,再与单个专家的权重下界比较,就得到“描述代价除以学习率,加学习率乘二阶量”的权衡。
这里的
一个容易序列 ​
假设所有专家每轮损失都落在某个共同值的
相反,若每轮有专家损失
与 small-loss 界的关系 ​
因为
AdaHedge 通过 mixability gap 自调学习率,Squint 通过对学习率积分得到专家逐一二阶界。它们共享目标但机制不同。本页保留一个规范定理,不并列堆砌算法名;若实现具体算法,应以所引用论文的更新式和常数为准。
边界 ​
二阶保证仍相对固定专家。环境发生制度切换时,某个固定专家的
参考资料
- Nicolò Cesa-Bianchi, Yishay Mansour, and Gilles Stoltz, “Improved Second-Order Bounds for Prediction with Expert Advice,” Machine Learning, 2007.
- Wouter Koolen and Tim van Erven, “Second-Order Quantile Methods for Experts and Combinatorial Games,” COLT, 2015.
- Steven de Rooij et al., “Follow the Leader If You Can, Hedge If You Must,” JMLR, 2014.