“在指数权重与 Hedge框架中,存在参数自适应算法,例如 Squint,使对任意先验 $\pi$ 和任意专家 $i$,同时有 $$ R {T,i} \le C 1\sqrt{V {T,i}\…”
形式陈述 ​
Hedge 实现全信息专家协议;势函数证明以指数矩控制累计损失,并在比较 log-sum-exp 时使用凸性与 Jensen 型不等式。
第
随后承受混合损失
Regret 证明 ​
令
求和给
知道时域
直觉
指数权重让累计损失差转成权重比:持续领先的专家会指数级获得质量,短期偶然失误却不会把任何候选永久删除。势函数一端保留最佳专家,另一端记录算法混合损失,夹逼后得到 regret。
例子与边界
概率预测例子 ​
多个天气模型各自给出明日降雨概率。只要采用一个共同的有界评分损失,Hedge 会根据累计表现形成混合分布,不必永久选定单一模型。若使用 log loss,专家报出零概率而事件发生会造成无穷损失;必须截断概率或使用专门的 mixability 分析,标准
边界与关系 ​
Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象这类更新供其他问题复用。
推论与应用
把负熵作为 FTRL 正则器可重新导出同一指数权重更新,说明 Hedge 是在线凸优化几何的一种特例。二阶专家界则用实际相对损失平方和替换最坏时域,在容易序列上给出更敏感的保证。
若只见所选专家损失,重要性加权把隐藏坐标恢复成无偏估计,但会引入动作数和方差代价;若损失具有 mixability,则还可能获得快于一般
参考资料
- Yoav Freund and Robert E. Schapire, “A Decision-Theoretic Generalization of On-Line Learning and an Application to Boosting,” Journal of Computer and System Sciences 55(1), 1997, pp. 119–139.
- Nicolò Cesa-Bianchi, Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.