形式陈述
DP-SGD 将差分隐私公理库差分隐私Differential privacy · DP · 差分隐私定义用相邻数据集输出分布的乘法比较与加法松弛,限制单条记录对发布结果的影响。保证加入普通梯度更新,保护每条训练记录。本页固定增删邻接、公开参数 及整数 :每轮对现有记录独立以概率 抽样且不发布抽样身份, 是裁剪阈值, 是预先固定的归一化常数, 是噪声乘子。第 轮执行
是损失的梯度公理库梯度Gradient标量函数微分在内积下对应的向量。。初值与超参数须公开固定,或来自已经核算的私有过程。最终可只发布 ,但隐私上界按完整更新记录核算后再用后处理得到。
直觉
裁剪限制“一条记录最多把更新推多远”;噪声遮掩这次可能的移动;抽样使一条记录不必每轮都参与;核算器记录它在所有轮次可能留下的总影响。四个环节各自承担不同工作,任何一个都不能由“训练过程有随机性”替代。
为什么必须逐样本裁剪
给定相同的公开历史 ,一条新增记录只多贡献一个范数不超过 的向量,故裁剪和的增删灵敏度至多 。如果改成替换邻接,两个不同贡献之差可达 ,噪声及核算口径必须相应改变。
先平均原始梯度再裁剪,只限制整个批次的长度;相邻批次可能落在球的相反两端。它不是逐样本裁剪的同一个灵敏度证明。若每条损失还读取其他私有样本,例如未单独分析的跨样本归一化,新增一条记录也可能改变其他人的梯度。
例子与边界
一轮向量更新
取 ,抽中两个梯度 与 。逐样本裁剪后为 与 ,和为 。若本轮生成噪声 、固定 ,则 。从 、步长 更新到 。这个噪声样本只是一次运行轨迹,隐私依赖整个高斯分布而非这个具体向量。
一份完整且保守的预算
取 。先把未抽样的裁剪和加噪机制校准为 -DP;按经典高斯尺度公理库Gaussian 隐私机制Gaussian mechanism for differential privacy用 L2 全局灵敏度校准球形高斯噪声,并通过一维隐私损失计算近似差分隐私参数。,取噪声乘子 ,例如 即可。
Poisson 放大公理库子抽样隐私放大Privacy amplification by subsampling在增删邻接与隐藏的 Poisson 抽样下,把参与概率转成精确的差分隐私参数放大。给每轮 、。再用高级组合公理库差分隐私的高级组合Advanced composition of differential privacy以条件隐私损失的漂移和随机波动控制自适应多轮组合,并明确新增的 delta 预算。并令额外 ,最终 ,且
这份保守计算完整列出了邻接、抽样、单轮噪声、轮数与最终参数。专门的 sampled-Gaussian RDP 核算通常更紧,但不能与另一种采样实现混配。
训练准确性与发布范围
较小 会截断更多有效梯度,较大噪声会扰动优化;隐私定理不保证训练收敛或模型有用。私有验证集上的调参、提前停止指标以及未保护的训练损失日志,也要纳入发布流程。
推论与应用
每轮维护的不变量是:在固定过去的条件下,每条记录对未加噪和的贡献范数至多 ,且核算器包含此前所有已使用轮次。若梯度维数为 、批量为 ,除模型反向传播和抽样成本外,裁剪、累加、生成高斯向量与参数更新共用 次单位成本算术或采样操作;逐条累积可避免额外保存全部 个梯度。空批次仍按相同规则生成噪声,不能私下更换发布逻辑。
参考资料