“稳定性与差分隐私。 若整个交互机制对替换一个样本点不敏感,则自适应选中的查询难以记住单条记录。差分隐私蕴含泛化把这种稳定性转成期望或高概率泛化。”
定理接口与作用层次 ​
差分隐私本身是相邻数据集输出分布的比较定义;本页固定其中的替换邻接,并研究它何时推出统计泛化。设数据集
这个推论还需要 IID 样本、查询值域、样本量与参数范围,并产生独立的泛化失败概率。删除/增加邻接的 DP 机制不能未经参数转换直接代入;一个机制满足 DP 也不意味着后续任意统计陈述自动泛化。下面固定一个单查询高概率版本,把这些量词完整列出。
一个固定版本的高概率定理 ​
本页采用 Bassily 等人的单查询版本。设
令
则样本和算法内部随机性共同满足
换言之,以至少
从替换样本到高概率控制 ​
随机选一个索引
要得到上面的失败概率,还需 monitor argument。反设大偏差事件发生得过于频繁,监视器就在多份独立数据及其输出查询中挑出带符号的最大偏差。组合与后处理保证这个选择过程仍具有受控隐私;期望稳定性却禁止私有监视器持续挑出过大的偏差,从而推出
这和经典 uniform stability 相似,却不相同。uniform stability 直接限制损失值在替换样本后的变化;DP 限制整个输出分布,因此后处理仍保持隐私,并能处理算法自适应选择的更广泛查询。
多查询与自适应分析 ​
所选定理只处理机制最终输出的一条
一个发布统计量的例子 ​
数据分析者反复请求有界均值查询,并根据先前答案决定下一问。若每次答案都精确返回样本均值,足够多轮后可拼出样本的偶然细节。加入按敏感度校准的噪声,并按组合定理管理总隐私预算,可让整个交互保持 DP;泛化定理随后说明最终自适应选中的查询仍不容易在总体分布上严重偏离。
这不表示噪声越大越好。隐私噪声造成回答误差,泛化控制限制采样误差,两者要共同进入总精度。样本量必须同时支撑统计集中和隐私机制的噪声尺度。
边界 ​
DP 是充分的稳定机制,不是泛化的必要条件。固定的非私有查询照样可由 Hoeffding 不等式泛化;某些稳定算法也不满足实用的 DP 参数。反过来,差的隐私参数如
隐私随机性、样本随机性和结论的失败概率必须分别说明。
参考资料
- Cynthia Dwork et al., “Preserving Statistical Validity in Adaptive Data Analysis,” STOC, 2015.
- Raef Bassily et al., “Algorithmic Stability for Adaptive Data Analysis,” arXiv:1511.02513v1, 2015,Definition 2.3(替换一个元素的 max-KL stability,即本文 DP 约定)与 Theorem 7.2(
的统计查询给出本页 界);会议版发表于 STOC 2016。 - Cynthia Dwork and Aaron Roth, The Algorithmic Foundations of Differential Privacy, 2014.