形式陈述
在有限策略式博弈 公理库 有限策略式博弈 Strategic-form game · Normal-form game · 标准式博弈 用玩家、有限策略集和收益函数描述相互影响的选择,并以固定他人策略后的单方偏离定义最佳回应。 中,玩家 i 的混合策略是其纯策略集 S i 上的一份概率分布 公理库 概率分布 Probability distribution · Law 可测空间上总质量为一的测度;随机变量的律是由样本概率推出的一类分布。 :
Δ ( S i ) = { p i = ( p i a ) a ∈ S i : p i a ≥ 0 , ∑ a ∈ S i p i a = 1 } . 其中 p i a 表示选动作 a 的概率。只对某个动作赋概率 1 、其余赋概率 0 ,便得到对应的纯策略。分布的支持集为 supp ( p i ) = { a : p i a > 0 } 。
混合策略剖面 p = ( p 1 , … , p n ) 约定各玩家分别按自己的分布独立抽样 公理库 独立性 Statistical independence 从概率表理解独立性,区分两两、相互和条件独立,并用可计算反例澄清零协方差与条件均值的限度。 。因此出现纯剖面 s 的概率是 ∏ j p j , s j ,玩家 i 的期望收益为
U i ( p ) = ∑ s ∈ S ( ∏ j = 1 n p j , s j ) u i ( s ) . 这里只是有限张收益表的加权求和。独立性是联合抽样方式的约定,不是从给定各人的边际概率就能自动推出来的性质。期望收益表示重复抽样的平均水平,并不保证每次实际收益都等于这个数。
固定对手分布 p − i ,记确定选动作 a 时的期望收益为
U i ( a , p − i ) = ∑ s − i ( ∏ j ≠ i p j , s j ) u i ( a , s − i ) . 于是 U i ( p ) = ∑ a p i a U i ( a , p − i ) 。这个等式说明收益对本人的概率向量是线性的;对每一位玩家分别固定其他人后都线性,称为多线性。它不意味着对所有玩家的概率坐标合在一起仍然线性。
支持集上的最佳回应
令 M i = max a U i ( a , p − i ) 。分布 p i 是对 p − i 的最佳回应,当且仅当
p i a > 0 ⟹ U i ( a , p − i ) = M i . 证明只需看加权平均。所有纯动作收益都不超过 M i ,所以混合收益也不超过它;仅在最高收益动作上分配概率就恰好达到 M i 。若某个严格较差的动作获得正概率,则
M i − U i ( p ) = ∑ a p i a ( M i − U i ( a , p − i ) ) > 0 , 因而这个混合不是最佳回应。这个判据也证明:检查所有纯偏离足以排除所有有利的混合偏离。
直觉
随机化并不会让一个人对固定对手分布获得超过最佳纯动作的收益。它的作用在于改变对手面对的分布,使对方无法利用某个确定动作的弱点。若自己把两个动作都保留在最佳回应的支持集里,这两个动作对当前对手分布必须同样好;否则把较差动作的概率移到较好动作上就能改进。
几何上,Δ ( S i ) 是概率单纯形,也是凸集 公理库 凸集 Convex set 任意两点间线段全部包含在集合中的向量空间子集。 。两份合法分布再按比例混合,仍然是合法分布。单纯形的顶点是纯策略,边和内部点表示使用两个或更多动作。这个连续可行域为均衡存在证明提供了几何基础。
例子与边界
重算联合概率和收益
沿用收益表
行玩家/列玩家
L
R
U
( 3 , 2 )
( 0 , 0 )
D
( 0 , 0 )
( 2 , 3 )
设 p = Pr ( U ) = 3 / 5 、q = Pr ( L ) = 2 / 5 。独立抽样给出
结果
U L
U R
D L
D R
概率
6 / 25
9 / 25
4 / 25
6 / 25
四项相加为 1 。行玩家期望收益为 3 ( 6 / 25 ) + 2 ( 6 / 25 ) = 6 / 5 ;列玩家期望收益为 2 ( 6 / 25 ) + 3 ( 6 / 25 ) = 6 / 5 。失配时的零收益也进入了概率平均,所以这个结果低于任一协调格的双方收益。
求出整个最佳回应集合
现在让 p , q 在 [ 0 , 1 ] 内变化。行玩家纯选 U , D 的收益分别为 3 q 、2 ( 1 − q ) ,二者相等当且仅当 q = 2 / 5 。用 p 表示行玩家的混合策略,其最佳回应集合为
BR 1 ( q ) = { { 0 } , q < 2 / 5 , [ 0 , 1 ] , q = 2 / 5 , { 1 } , q > 2 / 5. 列玩家纯选 L , R 的收益分别为 2 p 、3 ( 1 − p ) 。用 q 表示列玩家策略,同理
BR 2 ( p ) = { { 0 } , p < 3 / 5 , [ 0 , 1 ] , p = 3 / 5 , { 1 } , p > 3 / 5. 例如对 q = 1 / 2 ,行玩家比较 3 / 2 与 1 ,只选 U 才最优;对 q = 2 / 5 ,两纯动作都得 6 / 5 ,任意混合都最优。求均衡时使行玩家无差异的方程决定的是列玩家概率 q ,而不是行玩家自己的概率 p 。
相同边际不等于相同联合分布
若双方各以概率 1 / 2 选第一个动作,独立抽样使四格各占 1 / 4 。另一种实验是两人观察同一枚公平硬币:正面共同选 U L ,反面共同选 D R 。此时个人边际仍都是 ( 1 / 2 , 1 / 2 ) ,联合分布却只在两个协调格各放 1 / 2 。前者双方期望收益为 5 / 4 ,后者为 5 / 2 。
共同硬币引入了相关性,因此后者不能由前述独立混合剖面直接表达。稳定性还要检查偏离:在协调分布中,行玩家收到 U 时改成 D 会损失 3 ,收到 D 时改成 U 会损失 2 ;列玩家的两个改换也都吃亏。因此这个联合分布满足相关均衡 公理库 相关均衡 Correlated equilibrium · CE 允许玩家根据私人动作建议选择偏离,以有限条线性服从约束刻画联合分布的稳定性。 的服从约束,该页列出了全部约束。
相反,在四格各 1 / 4 的独立分布中,行玩家固定选 U 能得 3 / 2 ,高于服从时的 5 / 4 ,增益为 1 / 4 。它连粗相关均衡 公理库 粗相关均衡 Coarse correlated equilibrium · CCE 对联合动作分布检验事先固定的单方偏离,并把经验分布的约束违反量精确写成平均外部遗憾。 的固定偏离检验都不能通过。相同边际只保持固定动作面对对手的收益;相关性改变了原联合方案的服从收益,二者比较的结果因而可能不同。
推论与应用
Nash 均衡 公理库 Nash 均衡 Nash equilibrium · 纳什均衡 · 混合策略纳什均衡 每位玩家都无法在其他人策略固定时通过单方偏离增加期望收益;有限博弈总存在这样的混合策略剖面。 要求每人的支持集都落在面对当前对手分布的纯最佳回应集合中。该条件把一个看似需要检查无穷多种概率偏离的问题,化为有限个纯动作的收益比较;真正求解时仍需同时满足所有人的条件和概率约束。
在矩阵零和博弈 公理库 矩阵博弈极小极大定理 Matrix game minimax theorem · Von Neumann minimax theorem · 有限零和博弈极小极大定理 有限二人零和博弈允许独立混合后,行玩家的最大保证收益等于列玩家的最小收益上界,并由一对线性规划提供精确证书。 中,行列分布 x , y 的期望收益简写为 x T A y 。固定一方后,另一方的最佳收益由某个纯动作取得,这正是把最坏回应转成有限条线性约束的依据。
参考资料
Éva Tardos and Vijay V. Vazirani,Basic Solution Concepts and Computational Issues ,载 Algorithmic Game Theory ,2007,§1.3.3–1.3.4,pp. 12–13;教学全文 。
Tim Roughgarden,CS364A Lecture 20 ,2013-12-04,§1,混合均衡与纯偏离判据。