“Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象…”
算法 ​
有
错误界推导 ​
设学习器共犯
只在犯错轮使用这一收缩,得到
若专家
对最好的专家取最小值便得到经典 mistake bound。它通常含最好专家错误数的乘法系数,不应悄悄改写成 Hedge 的有界损失 regret 常数。
一个有结构的例子 ​
设专家分别依据短期、长期与季节性规则预测明日是否上涨。某类市场阶段让短期专家连续犯错,它的权重按
边界与相邻算法 ​
只有学习器犯错时才能断言至少一半权重被惩罚;正确轮也可能有大量专家犯错,但证明不靠这些轮。专家若输出概率或承担一般
参考资料
- Nick Littlestone, Manfred K. Warmuth, The Weighted Majority Algorithm, Information and Computation, 1994.
- Nicolò Cesa-Bianchi, Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.