“只有学习器犯错时才能断言至少一半权重被惩罚;正确轮也可能有大量专家犯错,但证明不靠这些轮。专家若输出概率或承担一般 $[0,1]$ 损失,应使用Hedge而不是强行阈值化。随机化 Weigh…”
协议与算法 ​
第
随后承受混合损失
Regret 证明 ​
令
求和给
知道时域
概率预测例子 ​
多个天气模型各自给出明日降雨概率。只要采用一个共同的有界评分损失,Hedge 会根据累计表现形成混合分布,不必永久选定单一模型。若使用 log loss,专家报出零概率而事件发生会造成无穷损失;必须截断概率或使用专门的 mixability 分析,标准
边界与关系 ​
Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象这类更新供其他问题复用。
参考资料
- Yoav Freund, Robert E. Schapire, A Decision-Theoretic Generalization of On-Line Learning, 1997.
- Nicolò Cesa-Bianchi, Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.