Skip to content

Follow-the-Regularized-Leader

FTRL · 正则化跟随领先者

在历史累计损失上加入强凸正则器,以稳定下一轮决策并控制 regret。

定义

给定凸决策集 K、正则器 R 和学习率 η>0,FTRL 在第 t 轮选择

xtargminxK{s=1t1fs(x)+1ηR(x)}.

求和只到 t1,因为 ft 尚未揭示。若把 1/η 已写在正则项外,就不应又在 R 内重复缩放。

为什么正则化能稳定 leader

纯 FTL 每轮最小化历史损失,微小的新损失也可能让最优解在可行集两端跳动。强凸 R 让累计目标具有曲率,相邻两轮 minimizer 的移动可由新梯度控制。对线性损失 ft(x)=gt,x,最优性可写为

xt=R(ηGt1),Gt1=s<tgs,

其中 R凸共轭。若 R 相对某范数为 1-强凸,则 R 的梯度相对对偶范数光滑,累计线性 regret 可控制为

RegT(u)R(u)minKRη+η2t=1Tgt2.

负熵给出指数权重

在概率单纯形上取 R(p)=ipilogpi,线性损失向量为 t。解一阶条件并归一化得到

pt,iexp(ηs<ts,i),

正是Hedge。在欧氏空间取二次正则器,则得到与梯度更新密切相关的形式。FTRL 因而是共同优化框架,不是把几种算法只按名字并列。

失败边界与静态对应

没有正则器的 FTL 可在线性 regret:在区间上令线性损失梯度交替并刻意使历史和在零附近翻转,leader 会不断选到下一轮不利端点。argmin 的存在和计算效率也不是 regret 定理自动提供的。正则化 ERM在固定数据上最小化一次目标;FTRL 每轮只用过去损失重解累计目标,时间协议不同。

参考资料