Skip to content

差分隐私

Differential privacy · DP · 差分隐私定义

用相邻数据集上的输出分布似然比,限制随机机制泄露任何单条记录影响的稳定性定义。

条目类型
定义

形式陈述

邻接与定义

设数据集 S,SZm 只在一个位置不同,称为替换邻接并记作 SS。随机机制 A:ZmO(ε,δ)-差分隐私的,若对任意相邻数据集及任意可测输出事件 EO,都有

Pr[A(S)E]eεPr[A(S)E]+δ.

由于邻接关系对称,同一不等式也适用于交换 S,S 后的方向。若 δ=0,称为纯 ε-DP;δ>0 的版本称为近似 DP。这里比较的是机制在两个固定输入上诱导的输出概率分布;随机性来自机制内部,而不是对某个训练分布取平均。DP 因而是逐相邻数据集的最坏情形保证,不是“平均用户不容易被识别”的经验指标。

删除或增加一条记录的 unbounded adjacency 是另一种常见约定,适合“某个人是否参与数据集”的叙事;替换邻接则固定样本量,比较某条记录被另一条取代。两种约定可以在参数常数代价下转换,却不是同一个关系。定理、库接口与隐私预算必须从头到尾使用声明过的版本。

隐私损失随机变量

若输出分布有密度,观察到输出 o 时的隐私损失可写成

LS,S(o)=logpA(S)(o)pA(S)(o).

纯 DP 要求所有可发生输出的似然比都被 eε 控制;近似 DP 允许总概率至多约为 δ 的坏区域越界。这个图像帮助理解定义,但正式事件不等式不要求预先选共同密度,也能覆盖离散、连续和混合输出。

灵敏度与 Laplace 机制

对数值查询 f:ZmRd,其 1 全局灵敏度为

Δ1f=supSSf(S)f(S)1.

Laplace 机制发布

A(S)=f(S)+Y,YjiidLap(Δ1f/ε).

相邻数据集让输出密度的对数比至多为

εΔ1ff(S)f(S)1ε,

因此得到纯 ε-DP。证明依赖最坏相邻差,不是数据上观测到的平均改变量。若先查看数据再未经隐私保护地选一个更小灵敏度,选择过程本身可能泄漏信息。

直觉

差分隐私要求:把任何一个人的记录换掉后,观察者看到某个输出的可能性都不会剧烈改变。于是观察者很难仅从发布结果判断这条记录究竟是哪一个值,甚至是否以相邻约定所描述的方式出现。保护对象是单条记录的边际影响,不是把数据中的所有总体规律都隐藏起来。

ε 越小,相邻输入的输出分布越接近;它不是“泄漏了 ε bit”的直接换算。δ 也不是普通算法失败概率:它允许隐私比较在一小部分概率质量上失去纯 DP 的乘法控制,因此通常必须远小于目标人群规模的倒数,并与威胁模型共同报告。

灵敏度把这个分布条件变成可操作的噪声尺度。查询在最坏相邻数据集间最多移动多少,噪声就必须有足够宽度掩盖这次移动;样本量增大后,均值的单点影响会下降,而未限制值域的查询仍可能被一个极端值任意拉远。

差分隐私的相邻输出分布
例子与边界

bit 计数与均值

例如数据是 m 个 bit,发布总和 f(S)=iSi。替换一条记录最多改变 1,因此加入尺度 1/ε 的 Laplace 噪声即可保护计数。发布均值时灵敏度为 1/m,噪声随样本量缩小;若值域不先限制在 [0,1],均值查询的全局灵敏度可能无界,公式便没有可用尺度。

信任与观察边界

中央 DP 假设可信机制接触原始数据后只发布私有输出;本地 DP 要求每位用户在发送前先随机化记录,通常为同等统计精度付出更多样本。shuffle、pan-privacy 和 continual observation 又改变观察者能看到的中间状态。只写“使用 DP”而不说明信任边界,无法判断定义覆盖了数据库、客户端还是持续日志。

DP 对任意辅助信息保持其相邻分布比较,但不会修复输入收集、访问控制、实现侧信道或输出语义本身的问题。若发布的统计量在业务上已经唯一确定某个人,机制必须靠噪声和参数承担这项风险;哈希标识符或删除姓名并不自动满足 DP。

推论与应用

后处理、组合与群体差异

A 满足 (ε,δ)-DP,任何不再访问原数据的随机后处理 g(A(S)) 保持相同参数。攻击者把输出转换、筛选、与公开信息拼接,都不能让两分布比原先更可区分;但若 g 再读取私有数据,它已不是后处理。

依次运行机制会累积隐私损失。最基本的自适应顺序组合把 (εi,δi) 相加为 (iεi,iδi);高级组合、Rényi DP 或 privacy accountant 可以在额外结构下给出更紧预算。不能把每轮单独安全理解成无限轮仍用同一预算,也不能在交互结束后只挑“最好看”的一轮而忽略此前输出。

群体差异会放大参数:若两数据集相差 k 条记录,可沿邻接链反复应用定义,纯 DP 的乘法因子增长为 ekε。DP 保护单条记录的边际影响,不承诺整个群体模式、总体均值或由许多人共同决定的事实保持秘密。

从隐私稳定性到泛化

差分隐私也不等于泛化。它最初是隐私定义;输出分布对单条样本稳定,又能作为控制自适应过拟合的充分条件。这个额外统计结论及其样本量和失败概率见差分隐私蕴含泛化,不能反向写进 DP 的定义。

参考资料
  • Cynthia Dwork, Frank McSherry, Kobbi Nissim, and Adam Smith, “Calibrating Noise to Sensitivity in Private Data Analysis,” TCC, 2006。
  • Cynthia Dwork and Aaron Roth, The Algorithmic Foundations of Differential Privacy, 2014, Chapters 2–3。
  • Cynthia Dwork et al., “Our Data, Ourselves: Privacy Via Distributed Noise Generation,” EUROCRYPT, 2006,关于分布式与本地信任边界的早期路线。
关系图谱5 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组