Skip to content

统计不可区分性

Statistical indistinguishability · Information-theoretic indistinguishability

两个分布族即使面对计算无界的判别器,其最优区分优势也随安全参数可忽略。

形式陈述

XλYλ 是由同一安全参数 λ 索引、取值于共同样本空间 Ωλ 的分布族。本库采用概率距离约定

Δ(Xλ,Yλ)=12ωΩλ|Pr[Xλ=ω]Pr[Yλ=ω]|.

若存在可忽略函数 μ,使充分大的 λ 都满足 Δ(Xλ,Yλ)μ(λ),则称两族统计不可区分,记作 XsY。若每个 λ 上的距离都为 0,两分布便完全相同,称为完美不可区分。这里的结论针对整个 ensemble;单个固定参数下距离很小,不足以给出渐近安全性。

总变差距离的事件刻画给出

Δ(Xλ,Yλ)=supTΩλ|Pr[XλT]Pr[YλT]|.

因此,即使允许判别器拥有无限计算能力,最佳接受概率差仍恰为 Δ。若实验均匀选择隐藏位 b,在 b=0 时给出 Xλ 样本、在 b=1 时给出 Yλ 样本,并把优势归一化为 |2Pr[b=b]1|,最优优势同样等于 Δ;若改用 |Pr[b=b]1/2|,数值则是 Δ/2。引用安全界时必须连同这项归一化一起说明。

统计不可区分允许任意事件测试,因而蕴含计算不可区分性:PPT 判别器只是所有判别器的一小类。反向一般不成立,因为计算受限的观察者可能无法识别一个数学上很显著、却难以高效描述或搜索的事件。

直觉

统计不可区分不是“若干统计量相近”,而是任何观察规则都找不到明显差异。把两个分布想成两只装有标签的袋子:判别器可以事先或根据样本挑选最有利的事件,甚至穷举整个空间;总变差距离直接给出它最多能把两个世界的接受概率拉开多少。

这一概念仍允许极罕见的差别。只要全部差异质量随 λ 可忽略,无界观察者虽然知道应检查哪个事件,也只能以可忽略优势遇到它。完美不可区分更强:不是差别难遇到,而是两个世界在每个事件上都给出完全相同的概率。

例子与边界

一次一密展示完美情形。固定任意等长消息 m,均匀密钥 K{0,1}n 产生密文 C=Km。映射 KKm 是双射,所以对任意两个固定消息 m0,m1,相应密文都在 {0,1}n 上均匀分布,距离严格为 0;这不是依赖攻击者算力的结论。

再令 Xλ 恒为 0,而 Yλ 以概率 2λ 输出 1、其余时候输出 0。事件 T={1} 是最优测试,故 Δ(Xλ,Yλ)=2λ。两族并不完全同分布,却统计不可区分;差异集中在一个已知但可忽略地发生的事件上。

伪随机生成器给出反向不成立的典型边界。若 G:{0,1}s{0,1}mm>s,则 G(Us) 的支持集至多有 2s 个点。无界判别器可以枚举该支持集,并将它与 Um 显著区分;安全 PRG 只保证高效判别器做不到。均值、方差、经验直方图乃至有限次抽样都不能证明总变差上界,因为未检查的事件仍可能承载全部差异。

若攻击者获得 q(λ) 个独立样本,联合分布的距离至多为 q(λ)Δ(Xλ,Yλ);多项式个样本仍保持可忽略差距,但指数个样本可能放大稀有事件。样本是否独立、数量是否受限,必须属于安全实验的一部分,而不能从单样本定义中默默推断。

推论与应用

统计不可区分为信息论安全提供统一语言。完美保密对应距离为零的极端情形;统计零知识、统计隐藏承诺和秘密共享则允许可忽略的分布误差。由于结论覆盖无界判别器,它不依赖某个计算困难假设,却仍依赖安全参数、泄露接口与样本数量的准确建模。

总变差还支持安全误差的组合:经过任意随机后处理,距离不会增大;按混合路径逐步替换分布时,三角不等式允许累加各步误差。这些性质解释了为什么统计模拟得到的近似视图可以安全地送入后续协议,同时也提醒人们记录累积次数,避免把许多可忽略项无条件地视为一个可忽略项。

参考资料
  • Oded Goldreich, Foundations of Cryptography, Vol. 1, Cambridge University Press, 2001,computational and statistical indistinguishability。
  • Jonathan Katz and Yehuda Lindell, Introduction to Modern Cryptography, 3rd ed., CRC Press, 2020,security definitions and statistical distance。
  • David A. Levin, Yuval Peres, and Elizabeth L. Wilmer, Markov Chains and Mixing Times, 2nd ed., AMS, 2017,§4.1, standard characterizations of total variation。