Skip to content

乘法权重更新方法

multiplicative weights update · MWU

以指数方式降低高损失动作的权重,并用总权重势函数给出累计性能保证。

元方法而非单一算法

乘法权重描述一种可复用结构:维护非负权重,把它们归一化为分布,观察反馈后按每个动作的损失成比例缩放。专家建议、某些 boosting、零和博弈和近似线性规划都可出现这套结构,但反馈范围、收益或损失符号不同,对应的更新和常数也不同。

指数损失版本

N 个动作,初始 w1,i=1。第 t 轮使用

pt,i=wt,iWt,Wt=jwt,j,

并在观察 t,i[0,1] 后更新

wt+1,i=wt,ieηt,i.

这里 pt 是概率分布,η>0 是学习率。若实际只观察被选动作的损失,就不能直接使用全信息版本,必须构造估计量。

势函数推导

从上方看,Hoeffding 引理给

logWt+1Wt=logEipteηt,iηpt,t+η28.

求和后得到 logWT+1logNηLA+η2T/8,其中 LA=tpt,t。从下方看,对任意固定动作 i

WT+1wT+1,i=eηLi.

合并两式便有

LALilogNη+ηT8.

这就是指数势函数的上下夹逼;取 ηlogN/TO(TlogN) regret。

线性化版本与范围

有些文献采用 wt+1,i=wt,i(1ηt,i)。为保持权重非负,需 ηt,i1,并用 ex1x 的比较重新推导常数。收益版会提升高收益动作而不是惩罚高损失动作。把这些式子拼接,会得到错误的学习率范围。

关系与边界

Hedge是全信息有界损失上的清晰实例;Weighted Majority只在二元错误后乘固定因子。势能法在这里跟踪总权重的指数增长,而算法分析中的摊还势能通常比较单次真实成本,目的不同。不是任何“把数乘到权重上”的启发式都继承上述定理。

参考资料