“差分隐私本身是相邻数据集输出分布的比较定义;本页固定其中的替换邻接,并研究它何时推出统计泛化。设数据集 $S,S'\in Z^m$ 只在一个位置不同,算法 $A$ 对任意相邻输入满足 $(\…”
邻接与定义 ​
设数据集
由于邻接关系对称,同一不等式也适用于交换
删除或增加一条记录的 unbounded adjacency 是另一种常见约定,适合“某个人是否参与数据集”的叙事;替换邻接则固定样本量,比较某条记录被另一条取代。两种约定可以在参数常数代价下转换,却不是同一个关系。定理、库接口与隐私预算必须从头到尾使用声明过的版本。
隐私损失图像 ​
若输出分布有密度,观察到输出
纯 DP 要求所有可发生输出的似然比都被
灵敏度与 Laplace 机制 ​
对数值查询
Laplace 机制发布
相邻数据集让输出密度的对数比至多为
因此得到纯
例如数据是
后处理与组合 ​
若
依次运行机制会累积隐私损失。最基本的自适应顺序组合把
群体差异会放大参数:若两数据集相差
模型边界 ​
中央 DP 假设可信机制接触原始数据后只发布私有输出;本地 DP 要求每位用户在发送前先随机化记录,通常为同等统计精度付出更多样本。shuffle、pan-privacy 和 continual observation 又改变观察者能看到的中间状态。只写“使用 DP”而不说明信任边界,无法判断定义覆盖了数据库、客户端还是持续日志。
DP 对任意辅助信息保持其相邻分布比较,但不会修复输入收集、访问控制、实现侧信道或输出语义本身的问题。若发布的统计量在业务上已经唯一确定某个人,机制必须靠噪声和参数承担这项风险;哈希标识符或删除姓名并不自动满足 DP。
差分隐私也不等于泛化。它最初是隐私定义;输出分布对单条样本稳定,又能作为控制自适应过拟合的充分条件。这个额外统计结论及其样本量和失败概率见差分隐私蕴含泛化,不能反向写进 DP 的定义。
参考资料
- Cynthia Dwork, Frank McSherry, Kobbi Nissim, and Adam Smith, “Calibrating Noise to Sensitivity in Private Data Analysis,” TCC, 2006。
- Cynthia Dwork and Aaron Roth, The Algorithmic Foundations of Differential Privacy, 2014, Chapters 2–3。
- Cynthia Dwork et al., “Our Data, Ourselves: Privacy Via Distributed Noise Generation,” EUROCRYPT, 2006,关于分布式与本地信任边界的早期路线。