形式陈述
给定公开声明的相邻关系 ,取整数 ,查询 的二范数全局灵敏度是
Gaussian 机制发布 ,其中 、。这里的正态噪声公理库正态分布Normal distribution · Gaussian distribution · 高斯分布具有指数平方密度、在仿射变换与独立求和下封闭的概率分布族。各坐标独立, 是标准差而非方差。若 、、,经典的一个充分校准为
这个上界给出$(\varepsilon,\delta)$-DP公理库差分隐私Differential privacy · DP · 差分隐私定义用相邻数据集输出分布的乘法比较与加法松弛,限制单条记录对发布结果的影响。,但不声称噪声最小;尤其不要把其条件中的 擅自删掉。
从密度比算出精确条件
固定一对相邻输入,记 、。在 下写输出为 ,其相对 的隐私损失为
对 ,该有序输入对所需的最小加法松弛量是
是标准正态分布函数,以下取 。上式来自对区域 积分 ,不是只算 。记标准正态密度为 ;利用 求导,得到 。交换两个相邻输入仍得到同一个 ,故代入 给出统一保证;若 ,输出分布相同,直接有 -DP。
直觉
高维输出看似需要同时控制许多方向,实际密度比只依赖噪声在相邻差向量 上的投影。垂直于 的分量在平方距离之差中抵消,所以核算归结为一维正态尾部。
高斯尾部始终存在。只要某对相邻查询值不同, 就有无界的正尾部,任何有限 都不能对每个输出保证密度比界。因此存在非零相邻查询差的 Gaussian 机制只能给近似 DP;加大 是缩小超额概率质量,而非创造一个硬截断。
例子与边界
有界均值怎样确定噪声
取固定大小 的数据,每条 ,相邻定义为替换一条。均值 的灵敏度为 :一次替换最多把一个 换成 ,这个界确实可达到。
若取 ,上式给 ,可选 。噪声标准差是一次记录替换造成的最大均值变化()的约 倍;小 并不意味着发布值几乎精确。把结果截到 是不再读原数据的后处理,保持隐私,但会在端点附近引入偏差。
若同时发布 个坐标均值且每条记录属于 ,同一记录可使所有坐标一起变化,故 。逐坐标只看到 就仍用一维噪声尺度,会漏掉联合输出中的最坏移动。
哪些改动需要重新证明
未裁剪的实数均值可有无界灵敏度,有限高斯噪声无法直接套用上述定理。数据依赖地选择 也会泄露信息,除非选择过程本身受到保护。固定非球形协方差可按其逆矩阵诱导的距离校准,但不能只检查各坐标方差。
推论与应用
多轮发布时,逐次计算尾概率再简单累加可能较松。Gaussian 机制在Rényi DP公理库Rényi 差分隐私Renyi differential privacy · RDP以 Rényi 散度控制隐私损失的指数矩,使同一阶数的自适应组合预算可加。下有精确的阶数预算 ;它将同一条密度比计算改写为矩母函数,适合先组合再转回 。
实际校准可对精确 以 做二分搜索。保持“下端噪声不够、上端噪声足够”的区间不变量,每次取中点并计算两个正态尾部;若初始区间宽度为 ,目标宽度为 ,需要 次评估;构造初始区间与每次尾概率的数值求值成本另计。极小尾概率应使用稳定的 log-CDF 数值实现,不能将浮点下溢的零当成严格隐私证书。
参考资料