“Hedge 需要全损失反馈。只观察所选臂时,需重要性加权估计,方差项也会改变。Weighted Majority按二元错误乘固定因子并作多数表决;本页处理一般有界损失和混合损失。MWU则抽象…”
元方法而非单一算法 ​
乘法权重描述一种可复用结构:维护非负权重,把它们归一化为分布,观察反馈后按每个动作的损失成比例缩放。专家建议、某些 boosting、零和博弈和近似线性规划都可出现这套结构,但反馈范围、收益或损失符号不同,对应的更新和常数也不同。
指数损失版本 ​
对
并在观察
这里
势函数推导 ​
从上方看,Hoeffding 引理给
求和后得到
合并两式便有
这就是指数势函数的上下夹逼;取
线性化版本与范围 ​
有些文献采用
关系与边界 ​
Hedge是全信息有界损失上的清晰实例;Weighted Majority只在二元错误后乘固定因子。势能法在这里跟踪总权重的指数增长,而算法分析中的摊还势能通常比较单次真实成本,目的不同。不是任何“把数乘到权重上”的启发式都继承上述定理。
参考资料
- Sanjeev Arora, Elad Hazan, Satyen Kale, The Multiplicative Weights Update Method: A Meta-Algorithm and Applications, Theory of Computing, 2012.
- Nicolò Cesa-Bianchi, Gábor Lugosi, Prediction, Learning, and Games, Cambridge University Press, 2006.