二人零和博弈是一类非常重要的博弈,具有很多良好的性质,其中关于最大最小值和最小最大值的还有纳什均衡之间的联系非常优美。

# 概述

零和博弈(zero-sum game),又称零和游戏或零和赛局,与非零和博弈相对,是博弈论的一个概念,属非合作博弈。零和博弈表示所有博弈方的利益之和为零或一个常数,即一方有收入,其他方必有所失。

  • 什么是二人零和博弈?

零和博弈是指不管双方采取什么策略,最终双方的收益之和总是为 0,即:

sS,ui(s)+uj(s)=0∀s∈S,ui(s)+uj(s)=0

当然,即使上面不是 0,而是一个其它的常数,也完全不影响它是零和博弈的本质。

比如,剪刀石头布博弈,不管双方采取什么策略,最终的收益之和都一定是 0:

# 最大最小策略和最小最大策略

最大最小值是指:

v_=maxsiSiminsiSiui(si,si)v\_=maxsi∈Simins−i∈S−iui(si,s−i)

最大最小值对应的策略  si∗  被称为参与人  i  的最大最小策略

最大最小策略指的是,对于我的每一个行动,对方都有一个针对行动。从而,我在这些最差的里面选一个最好的 —— 矮子里面拔将军

最小最大值是指:

v¯=minsiSimaxsiSiui(si,si)v¯=mins−i∈S−imaxsi∈Siui(si,s−i)

最小最大值对应的  s−i∗ ( sj∗ ) 被称为参与人  i  的最小最大策略,注意:最小最大策略是  j  采取的策略,但是被称为  i  的最小最大策略。

这里我之前总是容易弄混最大最小值和最小最大值到底如何区分!其实只需要注意:

弄清楚谁在前面谁先行动,可以画出一个博弈树,弄成动态博弈的形式,就很容易理解了!其实本质这里是有一个后发优势在里面!或者,也可理解成:max [min]

这里还有一个问题,纯策略的时候很容易寻找最大最小策略和最小最大策略,那么混合策略时候应该怎么办呢?很简单,只需要设一些参数即可。

2 采取了混合策略,以  q  的概率选择  L ,以  1−q  的概率选择  R 。1 只需要考虑自己的三种纯策略即可。即选 U,选 M,选 D 的期望收益。接着,有:

只需要在图上把 1 选 U,M,D 的三种收益都画在一个图上,然后取三条线最高的部分,就可以找出  q  的范围,也就找到了 1 的最小最大策略,即 2 针对 1 时的策略。同理也可以找到 2 的最小最大策略。

关于最大最小值和最小最大值,有以下定理成立:

sS,wehave:v¯v_∀s∈S,wehave:v¯≥v\_

证明:

siSi,sjSj,wehave:ui(si,sj)maxsiSiui(si,sj)∀si∈Si,∀sj∈Sj,wehave:ui(si,sj)≤maxsi′∈Siui(si′,sj)

因为对于任意  sjSjsj∈Sj ,上式都成立,那么有:

minsjSjui(si,sj)minsjSjmaxsiSiui(si,sj)minsj∈Sjui(si,sj)≤minsj∈Sjmaxsi′∈Siui(si′,sj)

因为对于任意  siSisi∈Si  上式都成立,那么有:

maxsiSiminsjSjui(si,sj)minsjSjmaxsiSiui(si,sj)maxsi∈Siminsj∈Sjui(si,sj)≤minsj∈Sjmaxsi′∈Siui(si′,sj)

得证,此处不用管上式不等式的右边是  sisi′ ,只是一个下标而已,为了区分,在不引起混淆的情况下,也可以写成: maxsiSiminsjSjui(si,sj)minsjSjmaxsiSiui(si,sj)maxsi∈Siminsj∈Sjui(si,sj)≤minsj∈Sjmaxsi∈Siui(si,sj)

从直觉上也可以理解,瘦死的骆驼(最小最大值)比马大(最大最小值)

在取得纳什均衡解  s∗  时  i (j)  获得的收益,有以下定理成立:

ui(s)v¯ui(s∗)≥v¯

证明:

ui(s)=maxsiSiui(si,si)minsjSjmaxsiSiui(si,sj)ui(s∗)=maxsi∈Siui(si,s−i∗)≥minsj∈Sjmaxsi∈Siui(si,sj)

(某一个一定  ≥  最小的那个)

接下来,考察一类特殊的二人零和博弈,如果一个二人零和博弈  G  满足  v=v¯=v_ , 那么称  v  为博弈  G  的值(value),称  i (j)  的最大最小策略和最小最大策略为最优策略。此时, i  的最大最小值和  j  的最小最大值互为相反数,纳什均衡由这些最优策略组成,收益向量为  (v,−v) 。

设  U (s)  为 strategy vector 为  s  时  i  的效用,因为这是零和博弈,因此此时  j  的效用为  −U (s) 。

可知:

vi=maxsiSiminsjSjui(si,sj)=maxsiSiminsjSjU(si,sj)=maxsiSi([maxsjSjui(si,sj)])=minsiSi(maxsjSjui(si,sj))=minsiSi(maxsjSjuj(si,sj))=v¯jv_i=maxsi∈Siminsj∈Sjui(si,sj)=maxsi∈Siminsj∈SjU(si,sj)=maxsi∈Si(−[maxsj∈Sj−ui(si,sj)])=−minsi∈Si(maxsj∈Sj−ui(si,sj))=−minsi∈Si(maxsj∈Sjuj(si,sj))=−v¯j

同理可得: v¯i=−v_j

接下来,定义鞍点,并且给出其在零和博弈中和纳什均衡的关系:

鞍点是在一个维度上做到了最大,而在另一个维度上做到了最小(因为自己的收益和对方收益互为相反数,因此自己的最小恰是对方的最大,因此实现了均衡)

# 释义

在零和属性(如果一方得益,另一方必然损失)下,是指结果是零和的情况下会出现帕累托最优的现象。反过来说,全体参加者可得益或受损的情况被称为非零和博弈。如果一个国家利用其过剩的香蕉与另一国家剩余的苹果进行贸易,因为两方都从交易中受惠,这是一个非零和的例子。

这个概念最早是在博弈论(game theory)上发展,因此零和情况通常被称为零和游戏(zero-sum game)。

# 原理

两人对弈,总会有一个赢,一个输,如果我们把获胜计算为得 1 分,而输棋为 - 1 分。则若 A 获胜次数为 N,B 的失败次数必然也为 N。若 A 失败的次数为 M,则 B 获胜的次数必然为 M。这样,A 的总分为(N-M),B 的总分为(M-N),显然(N-M)+(M-N)=0,这就是零和游戏的数学表达式。

# 解决方案

范例

举个经典的例子:小李与小刘各持有两张扑克牌,小李的牌是黑桃 A 和红心 10,小刘的牌是方块 A 和梅花 10,两人各出一张牌:

(1) 如果规则为:若同色则小李胜,否则小刘胜,胜者可赢对方 1 元,则她俩的收益矩阵为:

此时,只有混合策略纳什均衡,而没有纯策略纳什均衡。

(2) 如果规则为:小刘要付给小李钱,而此钱数为两人所出牌的点数总和,则她俩的收益矩阵为:

显然,小李希望她可以得到多一点的钱,因此她会出 10 点,而小刘则希望她付出的钱能够少一点,故她会出 A,从而,左下角的方格为纳什均衡点,此时,就有纯策略纳什均衡了。

(3) 如果规则为:若同色则小李胜,否则小刘胜,胜者依她自己所出的点数赢对方若干元,则她俩的收益矩阵为:

对小李来说,只有出红心 10 才有机会赢得最大值(10 元),但显然这样做对她而言是比较冒险的,因为,虽然不管小李出什么牌,她的期望值都是 0 元,但对小刘来说却不是如此,若小刘出方块 A,期望值是 - 4.5 元,出梅花 10,期望值则是 + 4.5 元,因此,小刘 “应该” 会出梅花 10,小李想到了这一点,就不会出红心 10,而会出风险相对较小的黑桃 A 与之对抗,但小刘又会想到这一点。不过,对小刘来说,若小李出黑桃 A,小刘出两张牌所赢得的小刘无论如何都会出梅花 10。小李若出红心 10,很可能会落到最坏的结果--她输了 10 元,所以,小李的最后作法是,出黑桃 A。最后,小李就赢了 1 元。在此种情况下,有纯策略纳什均衡,也有混合策略纳什均衡。

# 加权方法

一般的多目标优化数学模型为:

式中: χ\chi 为目标函数;gi(χ\chi)和 hk(χ\chi)为约束条件。

为便于求解,往往需要将多目标模型转换为单目标优化模型,因此可以将式(1)归结为各目标函数的线性组合:

式中:λ 为权重系数;i 为目标函数的个数;f(χ\chi)为目标函数;G(χ\chi)和 H(χ\chi)为约束条件。

# 物理层安全问题

构建基于安全速率的系统效用函数为:

其中  α\alpha  > 0 为一个正的常数 & 表示由于功率增大系统付出的代价,α\alpha:(psig+P1 ) 为基站保障信息的正常传输和提高系统安全速率付出的功率代价,αPrj\alpha Prj 为恶意干扰节点为降低系统安全速率付出的功率代价。

对于基站:

对于恶意干扰节点:

# 与非零和博弈

经济学

许多经济形势并不是零和博弈,由于有价值的商品和服务可以创建、销毁或分配,以上任何一种状况将创造一个净损失或得益。

心理学

最常见的例子就是社会心理学中的社会陷阱,在某些情况下,我们可以追求个人的利益,从而加强我们的集体幸福。

# 与正和博弈

和谐的职场秩序必然是职场人共同合作的结采,必然是承载职场多数成员共识的结果,"零和博弈" 显然是与此,相悖的。秉承 "正和博弈" 游戏规则,才是治理职场同质化竞争的破局之道。

一、积极构建由 "零和博弈" 向 "正和博弈" 转变的运行机制

"零和博弈" 本质上属于非合作博弈,博弈中各博弈方决策时都以自己的最大利益为目标,结果是既无法实现集体的最大利益,也无法实现个体的最大利益。

二、积极探寻由 "零和博弈" 向 "正和博卫平" 转变的竞争策略

同质化的职场中,通常有三种竞争策略:完全合作策略 (100% cooperation) 、完全竞争策略 ( 100% defect) 和针锋相对策略。实践证明,前两种策略过于绝对,第二种策略策略史具理性,是适应 "丘和博弈" 游戏规则的策略。

三、积极培育由 "零和博弈" 向 "正和博弈" 转变的主体

当今时代,人们在职场中的竞争力既包括硬实力 (学历、资格证书、专业拭能、办命食动化适用能力、外语能力等) ,又包括软实力 (态度、经段、人脉、个人形象、获取情报能力等)。

四、积极疏导由 "本和博弈 ' 向" 正和博弈 " 转变的心理压力

适度的压力能使人挑战自我、花提潜力、富有敖率、激起创造性,而不良的压力,不管其来摞是什么,对职员和组织的后果都是非常负面、非常严重的。