Skip to content

定理Theorem

子抽样隐私放大

Privacy amplification by subsampling

在增删邻接与隐藏的 Poisson 抽样下,把参与概率转成精确的差分隐私参数放大。

形式陈述 ​

本页固定增删一条记录的邻接。抽样器 Sq 对每条记录独立以公开概率 q∈[0,1] 保留,称为 Poisson 抽样。抽样后的机制 M 对相同的增删邻接满足 (ε,δ)-DP,只发布 M(Sq(D)),不发布所抽记录的身份。则整体机制满足

ε′=log⁡(1+q(eε−1)),δ′=qδ.

这是特定抽样方式与邻接的配套结论。固定大小不放回抽样、放回抽样、替换邻接各有自己的定理,不能只将同一个 q 代入而忽略模型。

直觉

比较 D 和 D∪{x}。可以让两边对共有记录使用完全相同的随机币;只有新增记录 x 可能造成差异。以 1−q 的概率它未被抽中,两边运行机制的输入完全一样;以 q 的概率它被抽中,才需要使用原机制的隐私保证。

观察者看不到这枚参与随机币,因而面对的是混合分布,而非先获知用户被抽中后再看输出。隐藏的混合是放大的来源。

两个方向的事件比较 ​

令 Q 为没有 x 时的输出分布,R 为对共有样本抽样后必定加入 x 的输出分布。对共有记录耦合同一组随机币,原机制的逐相邻保证在取平均后给出

R(E)≤eεQ(E)+δ,Q(E)≤eεR(E)+δ.

新增输入的输出分布是 P=(1−q)Q+qR。记 A=1−q+qeε、B=1−q+qe−ε。第一个方向立即有 P(E)≤AQ(E)+qδ。第二个方向由 R(E)≥e−ε(Q(E)−δ) 得

P(E)≥BQ(E)−qe−εδ,Q(E)≤P(E)B+qe−εδB≤AP(E)+qδ.

最后一步用了 AB≥1 和 B≥e−ε>0。于是纯 DP 与近似 DP 都由同一个双向计算得到 ε′=log⁡A、δ′=qδ,无需把 δ 解释成一枚独立的失败随机币。

例子与边界

设原机制为 (1,10−6)-DP,q=0.1,则

ε′=log⁡(1+0.1(e−1))≈0.1586,δ′=10−7.

粗略乘法 qε=0.1 比正确值小,不能当作保守保证。只有在 ε 很小时,eε−1≈ε 才得到一阶近似 ε′≈qε。

若同时公开“用户 x 被抽中了”,观察者可以对该事件作条件化,未抽中所贡献的共同分布便消失。特别是在增删邻接下,某个身份出现在名单中的事件在一侧概率为 q,另一侧为零,单这份名单就要求 δ≥q。因此抽样名单不能不加说明地列入公开日志。

q=0 时没有记录进入机制,两输入分布一致;q=1 时恢复原预算。一个用户若拥有多条记录,应先明确保护单位;独立抽记录并不等于以同一概率抽用户。

推论与应用

在私有随机梯度下降中,每轮重新独立抽样后对裁剪梯度加噪声,可以逐轮使用放大,再组合所有轮次。实现中的 shuffle 后分批不等于独立 Poisson 抽样,核算器与采样器必须匹配。

参考资料
关系图谱4 个相邻概念 · 2 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组
类型化关系