“混合 Nash 均衡通过独立抽样形成联合分布。若允许联合分布相关,并只检查事先固定的偏离,就得到粗相关均衡;若还允许根据私人建议改换动作,则得到相关均衡。对乘积分布,这两种条件都等价于本页的…”
形式陈述 ​
在有限策略式博弈公理库有限策略式博弈Strategic-form game · Normal-form game · 标准式博弈用玩家、有限策略集和收益函数描述相互影响的选择,并以固定他人策略后的单方偏离定义最佳回应。中,协调者按联合分布公理库概率分布Probability distribution · Law可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。
对建议
若对所有
若某个建议概率为零,原线性式自动为零,完全不需要定义零概率事件下的条件分布。有限条线性式因此比逐项写条件概率更适合核验和求解。
本页的
从条件偏离到遗憾 ​
从单对改换到任意动作映射 ​
一份确定的偏离规则是映射
若所有单对约束都非正,任何映射的总增益也非正。反过来,选一个只把
粗相关均衡公理库粗相关均衡Coarse correlated equilibrium · CCE对联合动作分布检验事先固定的单方偏离,并把经验分布的约束违反量精确写成平均外部遗憾。只检查不看建议的固定偏离。固定改选
内部遗憾与交换遗憾 ​
对实际历史
将出现次数合并,经验分布满足
允许对每个原动作分别选择替代动作,得到交换遗憾(swap regret):
最后一步成立,是因为映射对不同
直觉
CE 的每条条件偏离增益都非正,固定偏离增益又是这些量的和,所以 CE 必然是 CCE。反向不成立,因为固定偏离对建议求和时,允许某些建议下的获利被其他建议下的损失抵消。CCE 页的三轮循环博弈已经给出精确反例:六条固定偏离增益全为零,但
例子与边界
三轮与四轮历史的内部遗憾 ​
例如 CCE 页三轮对角历史中,两位玩家各自的内部遗憾表相同:
| 原动作 |
|||
|---|---|---|---|
每行最大值为
协调建议与边际乘积 ​
先核验所有服从约束 ​
考虑下面的非零和协调博弈。
| 行玩家/列玩家 | ||
|---|---|---|
令协调者以各
双方服从时的平均收益均为
| 玩家及改换 | 概率 × 条件收益差 | 未归一化增益 |
|---|---|---|
| 行: |
||
| 行: |
||
| 列: |
||
| 列: |
保持原动作的约束均为零,这就检查完全部八条约束。故
还能直接检查 CCE:行玩家固定选
相同边际为何失去稳定性 ​
两人的边际都是
两个失配格现在各有
| 玩家 | 第一纯动作的固定偏离增益 | 第二纯动作的固定偏离增益 |
|---|---|---|
| 行: |
||
| 列: |
所以
对于乘积分布,CE 的每条约束进一步分解为
若
推论与应用
CE 约束加上
在重复博弈中,外部无遗憾控制事先固定偏离,得到 CCE;内部或交换无遗憾控制建议相关的改换,得到 CE。上面的恒等式解释了目标为何不同,但没有给出实现交换无遗憾的算法。普通指数权重的固定动作界不能直接充当交换遗憾界。
参考资料
- Tim Roughgarden,CS364A Lecture 13: Equilibrium Concepts,§3.1–3.5,pp. 4–7,尤其 Definitions 3.3–3.4 的建议与事前偏离接口。
- Sergiu Hart and Andreu Mas-Colell,A Simple Adaptive Procedure Leading to Correlated Equilibrium,Econometrica 68(5),2000,§2,p. 1129 的未归一化 CE 与近似 CE 定义;§3,pp. 1133–1134 的遗憾与经验分布关系。