形式陈述
固定有限和目标
SVRG要求可按索引 在任意查询点精确获得 ,并能重新访问同一个分量。仅能获得一个新鲜样本且随后丢弃的流式oracle,不自动提供这种权限。每次分量梯度求值计一次查询;整梯度则要 次。
第 个阶段以快照 开始。下面固定采用原始分析中的随机内迭代输出方式:
- 求 ,设置
- 对 ,独立于阶段历史均匀抽 ,计算
- 独立均匀抽 ,令 。运行预定 个阶段后输出
、 与初始快照 在运行前固定。两个分量梯度必须使用同一个 ,并冻结快照和其整梯度直到本阶段结束。均匀输出不包括 ;可以预先抽 ,运行中保存对应点,无需保存整条轨迹。
同一个索引使差分真的变小
给定阶段历史,当前点和快照已经确定,因此
它满足SGD的条件无偏接口理路随机梯度下降Stochastic gradient descent · SGD · 随机梯度法在已知历史下用无偏随机梯度更新,推导凸目标期望界与二次噪声底,并按真实梯度查询比较批量和停止保证。。把 当作控制量,其精确均值 已经算出,这正是控制变量理路控制变量估计Control variate estimator · 控制变元估计利用已知期望的相关量消去模拟波动,推导固定系数最优性,并区分同样本拟合、独立先导和交叉拟合的误差。在向量梯度中的应用。
如果 ,两个同索引分量逐点抵消, 恰好等于整梯度,方差为零;若两项分别抽独立索引,就失去了这条抵消性质。独立索引版本仍可能无偏,但不是这里的低方差估计器。
一阶段的可用收缩因子
假定每个 都凸理路凸函数Convex function函数在任意凸组合处不超过相同权重下函数值的凸组合。、在全空间有 -Lipschitz梯度,,平均函数 为$\mu$-强凸理路强凸性Strong convexity · Strongly convex function函数在一阶凸下界之外还保留统一二次增长量的曲率性质。,。令 为其唯一极小点,。若 ,并选择 使
则上述随机输出满足
例如 , 给 。条件只要求平均函数强凸,各分量可以仅凸。
直觉
普通SGD在最优点的分量梯度仍可能互相抵消:平均为零,每一项却不为零,所以随机抽一项仍会抖动。SVRG把快照时看到的那部分分量差异减掉,再补回准确的平均方向。随着当前点和快照都靠近解,剩余差分越来越小,噪声不再保持固定尺度。
快照与同索引双点查询 这项改善需要先支付整梯度费用。阶段太短时,频繁刷新快照可能比直接SGD更贵;阶段太长时,当前点与快照相距较远,差分噪声可能增大。式(2)给出一个可以核验的折中,而不是把“每步只抽一项”当成全部成本。
例子与边界
从光滑分量到方差随目标差下降
对每个分量定义
凸性给 、。对 使用下降引理理路下降引理Descent lemma · Quadratic upper-bound lemma以 Lipschitz 梯度常数给出函数相对一阶模型的全局二次上界。,在 处仍非负,故
对 平均时, 使线性项消失,于是
写 。SVRG方向可写为 。平方范数的两项上界及中心化不增二阶矩给
这是关键新信息:右侧随两点接近解而消失。它比一个永远不变的 噪声预算更适合有限和。
再展开到解的距离,利用式(1)、凸性及式(5):
从0加到 ,丢掉末点的非负平方距离。由于随机输出的条件平均目标差等于这 项的平均,再用强凸给 ,得到
除以左侧系数就是式(2),跨阶段递推得到式(3)。这里的平均目标差来自随机输出,不是声称最后一个内迭代满足同一证明。
两分量模型的完整调用账
取 、。平均为 ,最优点 ,,可取 。
快照为0,两个快照梯度为 ,整梯度为1。于是校正方向在分量1和2下分别为 、。取 ,首步无论抽谁都得到 ;若第二步抽分量2,则 ,。
在 ,两种校正方向为 ,均值 、方差 。普通分量梯度却是 ,均值仍为 ,方差 。同一均值并不意味着同一噪声。
随机输出从 中等概率选择,其期望目标差为
基线实现支付2次快照梯度及4次内步梯度,共6次查询;这个演示用很短阶段,式(2)给 ,所以它不满足几何收缩参数条件。若要应用式(3),可改用 ,此时 ,每阶段152次查询。算法能运行与这组定理常数合格是两个可分别检查的问题。
哪些改变需要重做分析
若把精确快照梯度换成 ,本阶段条件均值变为 。增加内步不会消除同一个冻结误差。比如 时,方向就是 ,固定步长稳定迭代趋向 ,原目标差为 。
若两个分量不凸,式(4)所用的 可失效,即使平均函数仍强凸,也不能直接使用上述证明。若输出改成 ,或每个阶段只打乱一次后顺序用分量,也分别改变输出或抽样条件。需要对应版本的分析,不能只保留SVRG名称便沿用式(3)。
推论与应用
把几何率换成总查询预算
在不缓存分量梯度的基线实现中,每阶段恰有 次查询,额外状态为 ,向量运算为 。若在快照阶段保存全部 个梯度,每个内步只需一次新梯度,总查询降为 ,却需 梯度表存储。部分线性模型可用更小的表示,但那是利用模型结构后的另一份账。
若已知初始上界 ,且 ,取
便保证期望目标差不超过 。选择上述常数后总查询为 。这里不是每轮的误差观测证书;如果不知道 ,还需另一个合法上界。oracle非有限、快照不完整或超出预算时应报告对应失败状态,不能输出这条定理认证。
非均匀抽样若按 选择分量,保持无偏的方向应改为
少了 ,条件均值实际变为
通常不等于 。仍用两分量例、快照0、,这个均值为 ,原目标梯度为 ;快照项使它也不只是加权目标的梯度 。重新加权后恢复无偏,新的方差和步长常数仍要重算,不能直接复制式(2)。
参考资料