形式陈述
沿用随机复合镜像理路随机复合镜像下降Stochastic composite mirror descent · 随机复合 Bregman 更新在非欧氏几何中分开随机次梯度和精确结构项,证明更新前平均的有限预算界,并计算熵正则单纯形的真实更新。的凸目标 、1-强凸镜像、精确子问题及更新前平均。已知 、已知正数 上界控制有效域直径,且 。本页用有限原始矩替代二阶矩:给定全部旧历史 ,原始 oracle 满足
这里约束 本身,不是 的中心矩。事先固定 、、阈值 与步长 ;裁剪后执行
零向量规定仍为零。裁剪在与镜像配对的对偶范数中做。令
返回 。本页证明以至少 的概率,
这是模型下的固定预算高概率误差上界。它不要求原始二阶矩存在,但要求式(1)的有效上界、有限域直径和精确可行更新;不是仅由输出点计算出来的对偶 gap。
直觉
裁剪把每次更新限制住,却同时改变平均方向。证明必须为三个来源付款:裁剪偏差、沿当前误差方向的随机波动、以及镜像势中出现的随机梯度平方和。
只对最后一项噪声做集中还不够。如果把 直接换成它的期望,就仍把一个随机量当成确定上界。式(3)先给这份平方和单独分配失败概率,再给方向噪声分配另一半。两份事件交集才支持式(4)。
裁剪并不消除偏差,两份随机账本分别集中 旧SGD理路随机梯度下降Stochastic gradient descent · SGD · 随机梯度法在已知历史下用无偏随机梯度更新,推导凸目标期望界与二次噪声底,并按真实梯度查询比较批量和停止保证。已经证明原始 阶矩下的裁剪期望界。这里新增的是非欧氏复合更新上的两份条件方差控制,以及显式 概率预算;不能把期望结论直接更名为95%保证。
例子与边界
一百万次调用,证书由哪些数构成
取单纯形负熵几何的合法上界 ,,固定 。选择
有 ,、、,步长约 。式(4)的五个非零项依次为
| 来源 |
上界 |
| 初始 Bregman 势 |
0.0083129033 |
| 裁剪平方和 |
0.0083129033 |
| 裁剪偏差 |
0.0309025855 |
| 方向噪声的方差项 |
0.0437028555 |
| 方向噪声的幅度项 |
0.0412034473 |
总和约0.1324346950,因此可报告“在所列模型条件下,固定一百万次调用后的平均输出,以至少95%的概率目标差不超过0.132435”。这不是模拟得到的通过率,也没有宣称一百万为最小充分预算。每轮还要一次 Bregman 子问题;若它很贵,查询数不是全部费用。
例如在 上取 、线性目标的真次梯度 ,就有最优顶点、。令原始 oracle 为 , 为满足 的重尾变量,便落入本模型。可取 Pareto 尾指数 、尺度 :其均值为1/2, 阶矩为 ,二阶矩却无穷。以上预算因此覆盖一个真正没有二阶矩的模型。
单次更新仍然可以手算
同样在两坐标单纯形,,本次取 。如果原始 oracle 恰为 ,按 裁后是 ,更新到 ;若下次原始返回 ,裁后是 ,更新回均匀点。两轮更新前平均为 。
这条轨迹展示阈值与输出位置,并未给这两个指定观察值赋予概率。要给它套式(4),仍需另外指定满足式(1)的完整条件分布,不能从两条观测反推有效的 。
哪些条件不能省略
仅有中心矩上界不提供式(1)。例如确定方向恒为100,中心噪声所有矩均为零,但原始 阶矩是 ;以中心尺度 填入式(3)就是错账。若另证 ,则由 ,中心矩上界 可转换为原始上界 ;这可能很保守,却需要明确补充梯度规模。
无界域上 不能用固定 控制,方向鞅的幅度与方差账本就失效。需要局部化或另一算法,本页未完成那个分支。改变 或根据途中效果选最有利预算,也不是当前固定参数证明自动允许的停止规则。
推论与应用
先做逐点裁剪计算
写 。由 及 ,
令 ,。中心化鞅差 上界为 ,条件方差至多 。对标量 Freedman理路标量 Freedman 不等式Scalar Freedman inequality · 可预测方差鞅尾界用有界鞅差及可预测条件方差控制预算内的全时间越界,证明指数过程并给出适应门控与分层方差预算的实际计算。使用确定方差预算 、单步上界 、失败概率 ,得到
这里 简记给定 的条件期望。定义第二组标量鞅差
它条件均值为零,绝对值至多 ;条件方差等于标量内积的条件方差,因而
这一步只对实标量中心化,没有假定一般范数享有 Hilbert 方差分解。再以失败概率 使用 Freedman,得
两个事件如何接上优化望远镜
复合镜像的一步式对实际输入 逐路径成立。真实次梯度与输入之差拆为
第一项由式(5)及直径界给每轮至多 ;第二项就是 。把一步式求和、保留结构首尾差,再由凸性处理平均输出,得到逐路径不等式
由并集界理路并集界Union bound · Boole 不等式多个坏事件中至少一个发生的概率,不超过各事件概率之和。,式(6)和式(7)同时成立的概率至少 ;代入便证明式(4)。不要求两份事件彼此独立,也不要求梯度跨轮独立,只要求已写出的条件矩。
若令 ,则 ,故 。 时最优固定步长为 ,得到更紧凑的界
它显示失败概率通过对数进入,矩越接近1,预算改善越慢。 时恢复平方根阶;本页常数保守,不主张最优。 时直接采用任意正步长的式(4),避免零步长除法。
自测与答案
- 为什么只证明式(7)不能推出式(4)?答案:镜像势还含随机平方和,必须同时控制式(6);用其期望代替会遗漏失败事件。
- 两份事件各给95%保证,合并是否仍是95%?答案:无额外信息时只能保证90%。本页各用97.5%,所以合并得到95%;这正是 的来源。
参考资料