“本地差分隐私将这类二元信道推广到任意记录空间。随机化回答是其中可直接执行的最小例子:若把按公开参数采样一次 Bernoulli 币计作单位成本,每位用户用常数时间发送一 bit;服务器用 $…”
“同一输出在任意两个输入下的最大概率比为 $p/(1 p)$,因此该信道满足纯 $\varepsilon$ 本地 DP,其中”
模型Model
Local differential privacy · LDP model
把隐私边界放在用户设备内,要求收集者看到的消息在任意两条原始记录下都难以区分。
固定
与中央DP相比,受比较的输入现在是一位用户的任意两条记录;收集者只能接收随机化消息。中央模型允许可信处理者读取原始数据库,再保护最终发布结果。本地模型连收集者也放在观察者一侧。
非交互协议让每个用户只执行预先规定的随机化器。交互协议允许服务器依据先前消息选择下一次询问;此时应对用户贡献的完整交互记录核算预算,不能只给每条消息单独贴上
本地隐私将信任需求前移:原始值尚未上传,就已经被随机化。服务器被攻破后,攻击者拿到的是受保护的消息,而非可重新读取的原始数据库。这一优势依赖客户端正确运行,也依赖实际发送的所有字段都纳入分析。
代价来自噪声的加入时机。中央机制可以先平均许多记录,再对一个平均值加噪声;本地机制必须在每个人尚未与别人平均之前掩盖其记录,因此噪声较难相互抵消到相同精度。
取整数
本地模型可用随机化回答:用户以
当
若客户端只把原始值加密发送,持有解密钥匙的服务器仍能恢复原值。传输加密保护途中窃听者,本地 DP 的比较对象则包括得到协议消息的收集者;应先说明攻击者持有什么信息,再判断保证是否成立。
同样,报告被随机化却同时发送原始用户类别、精确时间或可恢复的辅助字段时,应把这些字段加入联合输出重新核验。一个安全字段无法替其他字段承担隐私责任。
本地随机化器满足逐输入约束,因此对任何输入先验都适用;但它不保证观察者完全不知道用户记录。若先验本来极度偏向某个值,观察者在收到消息后仍可能很有把握。保证约束的是消息额外带来的似然比,而非禁止所有推断。
设计本地协议通常分三步:先固定保护单位与消息全貌,再证明随机化信道的最大似然比,最后推导反演估计的误差。若用户将一条记录拆成多个字段分别发送,应组合这些消息;若希望获得更好精度,则需改变协议、增加样本或采用不同信任模型,并清楚说明新增假设。