博弈论指南 #2:完美计划

序贯博弈统治现实,用博弈树可视化、从终点逆向归纳,才能预判他人、谋划最优路径。

INCENTIVISING(@INCENTIVISING)教程 · 已翻译 · 约 8 分钟
阅览室 · 认知与决策#博弈#逆向归纳#终点原文

大多数人仍然认为,只要看到目标的终点,就足以抵达那里。毫不意外,说这话的人,往往从未真正追逐过自己的目标。

倘若他们追逐过,就会明白一个我们其余人都早已亲历过的残酷真相:仅仅知道事情在哪里结束,根本完全无法让你抵达那里。

于是,我们至今仍在寻找那个完美的计划。

假如真有一种方法能指引我们抵达终点,让我们得以预判他人的策略、做出应对,并最终实现目标,那该多好?

好吧,这种方法显然存在。若不存在,我们也就不会写这篇文章了。它叫做博弈论。

今天,你将学到它最强大的应用之一:用它来谋划与布局。

内容包括

  1. 序贯博弈如何统治世界
  2. 博弈树,以及你为什么需要它
  3. 逆向推演(逆向归纳法)
  4. 两套公寓,一个截止日期(示例)

1. 序贯博弈如何统治世界

在第一部分中,我们将博弈定义为由四样东西构成:参与者、选择集、行动顺序和收益。随后我们讨论了该如何优化分摊餐厅账单。

那是一种行动顺序无关紧要的博弈。无论你是最后行动还是最先行动,策略都保持不变。

餐厅之外,几乎没有什么事情是按那种方式运作的。

在几乎每一种情境中,行动顺序都存在。有人行动,有人回应,接着又有人对此再作回应,如此往复,直到博弈在某个节点结束。

也许博弈甚至根本不会结束:想想政治或股市。除非发生重大灾难,否则博弈就一直进行下去,参与者也是如此。

你生活中许多最重要的博弈,都是以先后顺序展开的。像账单这样的事,你过几天就能安然忘掉,但序贯博弈往往会长久地缠着你,而且我们无法那么轻易地解开它们。

一旦游戏进入序列,严格优势策略的整套思路便土崩瓦解。你不能再问“我该怎么做?”,而是被迫深入审视,去问“这将会演变成什么?”

2. 树形图,以及为何需要它

在序贯博弈中,局势可能迅速升级。每一步,玩家都能重新评估形势并据此选择下一步行动,这使得序贯博弈极具动态性和混乱性。

没有清晰的可视化,我们无从判断哪些策略在长期可能最优。为解决这一问题,我们采用树形图。与其向你灌输理论,不如把它应用到一个场景中:

设想你薪水偏低,正考虑要求加薪。树形图大致如下:

你看到的节点就是有人做出选择的点。在这个例子中,你首先决定是要求加薪还是保持沉默。如果你选择后者,博弈立即结束,因为你最终没有开口。

相反,选择前者将启动博弈的下一轮,而既然你无法自己给自己加薪,你就得去问你的老板。本质上,现在轮到他了。

如果老板接受,你获得加薪,“赢得游戏”。如果他拒绝,又轮到你了:你要么离开,要么坚持立场继续谈判。

这就是本博弈的行动顺序:你 → 你的老板 → 又是你。当然,我们可以扩展这个博弈,加入无数额外的回合,但你已经明白要点了。

现在,我们希望你能更仔细地看看这张图。

其中隐藏着一个至关重要的洞见:保持沉默也在树形图上,并且有它的收益。这是博弈论最关键的规则:什么都不做也是一种策略,有着它自己的收益。

在博弈论中,一切皆有后果。

关于末尾的数字

你可能已经注意到树末端那两个显眼的数字,就紧挨着终端节点:

第一个数字是你的收益;第二个是你老板的。在这个例子里,我们选用了非常抽象的数字,但你也可以在这里列出实际的加薪幅度。无论哪种方式,写下老板的数字都会逼出两个问题:如果你离职,拒绝你会让他们付出什么代价?如果你留下,又能让他们得到什么?

为什么这很重要?因为这是大多数人从不问的问题。策略不是关于你想要什么。你还需要弄清楚对方想要什么。

3. 为什么你要从最远端开始

如你现在所见,从第一个节点开始根本走不通。博弈的起点是你做决定:“我到底该不该向老板要求加薪?”

结果取决于老板是否批准。他是否批准取决于如果他拒绝你会怎么做。如果他拒绝你会怎么做,取决于离职对你来说值多少。

所以,除非你审视每个决策会把你引向何处,否则你无法回答自己能从这局面中得到什么。这就是为什么树的起点没有附带终端收益:它是一个决策点,而不是一个结果。

这就是为什么我们要从后往前求解。

树上最后一个决策是你的;它发生在被拒绝之后。假设离职值 1,因为它果断地终结了局面,永久止损;而留下值 -1,因为此刻继续推进似乎毫无意义。

往回一步是老板。他知道你在被拒绝后会怎么做,因为他可以通过观察哪条后续路径给你更高的收益,来预判你在被拒绝后会怎么做。

再往回一步是起点。保持沉默得 0。开口要求可能带来批准,得 3。所以你开口要求。

这就是逆向归纳:先确定最后一步决策,往回推一步,如此反复,直到推到现在。现在我们就能看到树上的一条最优路径,它指引着我们的决策。

4. 为什么这种方法总是有效

往回推有一个显而易见的好处:树会变小。一旦你知道某人在某个节点会作何选择,其他分支就都成了多余的。你大可以直接忽略它们,就当它们从未存在过。

如果你正着往前推,每一步都会增加分支,无论这些分支出现的可能性有多低。你或许会说,那些分支你没必要一一画出来,但即便是那些有那么点可能的分支,也会让树膨胀起来,把每一步的分析变成一场彻头彻尾的噩梦。

最后行动的人也远更容易预测,因为他们身后几乎什么都不剩了。没有下一轮需要保护,也没有什么可虚张声势的。

在我们当前的这棵树里,最后行动的人就是你,所以你的最后一步正是老板在琢磨的那一步(如果他真会做策略性思考的话)。

我们后悔没有早点用上它的地方

逆向归纳听起来很学术,直到你发现有多少日常决策其实是序贯博弈。有几个地方,我们真希望自己早点用上它,并且真的先画一棵树:

搬家。你那套崭新漂亮的公寓,大概是你每天早上醒来第一眼看到的东西,所以大多数人的决定完全建立在它之上。结果他们每天要花上两个多小时通勤,而每一次普通的朋友聚会都迅速变成一场后勤工程。

选大学或找工作。你的选择让你两年后能做什么?地理位置、人脉网络、转换选项、读研路径——这个清单可以一直列下去。

买贵重物品。你听过“买资产,别买负债”,但这话说起来容易。假设你买了一辆新车。大多数人往往在“我买得起吗?”这一步就停止了思考,然后就被保养费用加上毫不留情的折旧给坑了。如果情况突然发生变化会怎样?从那里开始想。

退出某件事(这才是风险所在)。“我该不该离开?”是个好问题,但它回答不了离开之后发生的任何事。离开之后你做什么?别让这个念头打消你做决定的决心,但先把它想清楚。

进行一场艰难的对话。写下对方可能的回应,以及每一种回应之后你会怎么做。你不需要召唤内心的拿破仑,把它变成一场宏大的战略。对某些抵触做好准备,并知道如何应对。这就够了。

做一次公开宣布。它可能带来反响或意想不到的后果。如果我们告诉你这事曾经毁掉过一些人的人生,那可不是在开玩笑。

但有个限度。

国际象棋是一种序贯博弈,其结构与谈判类似。只不过它恰好也是有限的。一旦王被将倒,或者僵局冻结了棋局,它就彻底结束了。

这里也不存在隐藏信息。因为国际象棋是有限的,而且每一步都可观察,所以一个完美解必然存在于完整的博弈树中。“但你不知道对手在想什么!”没错,但我们可以计算出他们所有可能的行动。如果你是一台拥有无限内存的计算机,你就不可能感到意外。

那么,为什么我们至今没有找到一个明确的解呢?因为这棵树长得离谱。

可能的对局延续总数如此庞大,以至于超过了可观测宇宙中的原子总数。任何拥有众多选项的序贯博弈,理论上都可能陷入这种混乱。那么,博弈论是不是突然就没用了?

不。因为到了那个地步,问题已经不再是求解博弈树了。你需要彻底改变它:在对话发生之前,让离开变得更有价值,或者让留下变得更没价值。

这就是博弈论者所说的“承诺”。它可以在博弈开始之前改变博弈的形态。

总结(保存此节)

博弈不仅仅关乎你想要什么,或者你打算做什么。你的行动会改变对方接下来能做和会做的事。以自我为中心是一种必败策略。

只在可行时才使用博弈树图。花整个周末画一棵树毫无意义。

什么都不做同样会改变结果。如果“保持沉默”或“什么都不做”这样的选项存在,就把它加入树中。

从最终决策开始。从那里确定最优的后续路径,然后后退一步,重复这个过程,直到回到你当前的位置。这就是逆向归纳法。你应该使用它的原因在于,一旦你知道了后面会发生什么,最优路径就更容易被定位。

你现在已经知道如何进行逆向归纳,以及如何用它做出更好的决策。但在更复杂的场景中,当信任岌岌可危,或者真相模糊不清时,又会发生什么呢?

已读完 · 本文由熊猫易读翻译重排