Skip to content

定义Definition

混合策略

Mixed strategy · 混合策略剖面

将有限纯策略上的概率分布作为选择,独立抽样形成联合结果,并由支持集上的最佳回应刻画最优混合。

形式陈述 ​

在有限策略式博弈中,玩家 i 的混合策略是其纯策略集 Si 上的一份概率分布:

Δ(Si)={pi=(pia)a∈Si:pia≥0, ∑a∈Sipia=1}.

其中 pia 表示选动作 a 的概率。只对某个动作赋概率 1、其余赋概率 0,便得到对应的纯策略。分布的支持集为 supp(pi)={a:pia>0}。

混合策略剖面 p=(p1,…,pn) 约定各玩家分别按自己的分布独立抽样。因此出现纯剖面 s 的概率是 ∏jpj,sj,玩家 i 的期望收益为

Ui(p)=∑s∈S(∏j=1npj,sj)ui(s).

这里只是有限张收益表的加权求和。独立性是联合抽样方式的约定,不是从给定各人的边际概率就能自动推出来的性质。期望收益表示重复抽样的平均水平,并不保证每次实际收益都等于这个数。

固定对手分布 p−i,记确定选动作 a 时的期望收益为

Ui(a,p−i)=∑s−i(∏j≠ipj,sj)ui(a,s−i).

于是 Ui(p)=∑apiaUi(a,p−i)。这个等式说明收益对本人的概率向量是线性的;对每一位玩家分别固定其他人后都线性,称为多线性。它不意味着对所有玩家的概率坐标合在一起仍然线性。

支持集上的最佳回应 ​

令 Mi=maxaUi(a,p−i)。分布 pi 是对 p−i 的最佳回应,当且仅当

pia>0⟹Ui(a,p−i)=Mi.

证明只需看加权平均。所有纯动作收益都不超过 Mi,所以混合收益也不超过它;仅在最高收益动作上分配概率就恰好达到 Mi。若某个严格较差的动作获得正概率,则

Mi−Ui(p)=∑apia(Mi−Ui(a,p−i))>0,

因而这个混合不是最佳回应。这个判据也证明:检查所有纯偏离足以排除所有有利的混合偏离。

直觉

随机化并不会让一个人对固定对手分布获得超过最佳纯动作的收益。它的作用在于改变对手面对的分布,使对方无法利用某个确定动作的弱点。若自己把两个动作都保留在最佳回应的支持集里,这两个动作对当前对手分布必须同样好;否则把较差动作的概率移到较好动作上就能改进。

几何上,Δ(Si) 是概率单纯形,也是凸集。两份合法分布再按比例混合,仍然是合法分布。单纯形的顶点是纯策略,边和内部点表示使用两个或更多动作。这个连续可行域为均衡存在证明提供了几何基础。

例子与边界

重算联合概率和收益 ​

沿用收益表

行玩家/列玩家 L R
U (3,2) (0,0)
D (0,0) (2,3)

设 p=Pr(U)=3/5、q=Pr(L)=2/5。独立抽样给出

结果 UL UR DL DR
概率 6/25 9/25 4/25 6/25

四项相加为 1。行玩家期望收益为 3(6/25)+2(6/25)=6/5;列玩家期望收益为 2(6/25)+3(6/25)=6/5。失配时的零收益也进入了概率平均,所以这个结果低于任一协调格的双方收益。

求出整个最佳回应集合 ​

现在让 p,q 在 [0,1] 内变化。行玩家纯选 U,D 的收益分别为 3q、2(1−q),二者相等当且仅当 q=2/5。用 p 表示行玩家的混合策略,其最佳回应集合为

BR1(q)={{0},q<2/5,[0,1],q=2/5,{1},q>2/5.

列玩家纯选 L,R 的收益分别为 2p、3(1−p)。用 q 表示列玩家策略,同理

BR2(p)={{0},p<3/5,[0,1],p=3/5,{1},p>3/5.

例如对 q=1/2,行玩家比较 3/2 与 1,只选 U 才最优;对 q=2/5,两纯动作都得 6/5,任意混合都最优。求均衡时使行玩家无差异的方程决定的是列玩家概率 q,而不是行玩家自己的概率 p。

相同边际不等于相同联合分布 ​

若双方各以概率 1/2 选第一个动作,独立抽样使四格各占 1/4。另一种实验是两人观察同一枚公平硬币:正面共同选 UL,反面共同选 DR。此时个人边际仍都是 (1/2,1/2),联合分布却只在两个协调格各放 1/2。前者双方期望收益为 5/4,后者为 5/2。

共同硬币引入了相关性,因此后者不能由前述独立混合剖面直接表达。稳定性还要检查偏离:在协调分布中,行玩家收到 U 时改成 D 会损失 3,收到 D 时改成 U 会损失 2;列玩家的两个改换也都吃亏。因此这个联合分布满足相关均衡的服从约束,该页列出了全部约束。

相反,在四格各 1/4 的独立分布中,行玩家固定选 U 能得 3/2,高于服从时的 5/4,增益为 1/4。它连粗相关均衡的固定偏离检验都不能通过。相同边际只保持固定动作面对对手的收益;相关性改变了原联合方案的服从收益,二者比较的结果因而可能不同。

推论与应用

Nash 均衡要求每人的支持集都落在面对当前对手分布的纯最佳回应集合中。该条件把一个看似需要检查无穷多种概率偏离的问题,化为有限个纯动作的收益比较;真正求解时仍需同时满足所有人的条件和概率约束。

在矩阵零和博弈中,行列分布 x,y 的期望收益简写为 xTAy。固定一方后,另一方的最佳收益由某个纯动作取得,这正是把最坏回应转成有限条线性约束的依据。

参考资料
  • Éva Tardos and Vijay V. Vazirani,Basic Solution Concepts and Computational Issues,载 Algorithmic Game Theory,2007,§1.3.3–1.3.4,pp. 12–13;教学全文。
  • Tim Roughgarden,CS364A Lecture 20,2013-12-04,§1,混合均衡与纯偏离判据。
关系图谱8 个相邻概念 · 1 类关系

拖动节点调整位置。

显示关系

显示:依赖

  1. 前置三跳
  2. 前置二跳
  3. 前置一跳
  4. 当前条目
  5. 后续一跳
  6. 后续二跳
  7. 后续三跳
文字版关系按与当前条目的最短距离分组