“Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象…”
形式陈述 ​
算法 ​
在专家建议协议中,有
错误界推导 ​
设学习器共犯
只在犯错轮使用这一收缩,得到
若专家
对最好的专家取最小值便得到经典mistake bound。它通常含最好专家错误数的乘法系数,不应悄悄改写成 Hedge 的有界损失 regret 常数。
直觉
算法不会在专家第一次犯错时将其删除,而是让错误按乘法持续侵蚀影响力。只要学习器自己预测错,支持错误标签的权重至少占一半,因此总权重必按固定比例收缩;与此同时,任何具体专家仍保留与其累计错误数对应的
总权重的上、下界夹住学习器错误次数:上界由学习器每次犯错触发,下界可选择事后最好的专家。比较器无需预先知道,代价是最好专家错误数前出现由
例子与边界
一个有结构的例子 ​
设专家分别依据短期、长期与季节性规则预测明日是否上涨。某类市场阶段让短期专家连续犯错,它的权重按
边界与相邻算法 ​
只有学习器犯错时才能断言至少一半权重被惩罚;正确轮也可能有大量专家犯错,但证明不靠这些轮。专家若输出概率或承担一般
推论与应用
对任意专家
Weighted Majority 是乘法权重方法在二元错误反馈下的离散实例。推广到概率预测或一般有界损失时,Hedge 的指数更新和 regret 分析更自然;推广改变了反馈与目标,也必须改变定理,而不是只把“错误”替换成实数损失。
参考资料
- Nick Littlestone, Manfred K. Warmuth, The Weighted Majority Algorithm, Information and Computation, 1994.
- Nicolò Cesa-Bianchi, Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.