博弈论指南:解读博弈
博弈论不是教你背叛,而是教你识别策略相互依赖的情境,用支付矩阵找最佳回应与均衡;若均衡不利,改变规则或不参与才是制胜策略。

“我怎样才能学会博弈论?”
这是我在Substack和X上收到的最常见私信。
通常,我会推荐这些人去读研究或书籍。但那是一笔巨大的投入,而且最好的资源往往也不是免费的。更别提要理解其中一半内容所需的严谨性了。
这工作量实在太大了。
因此,在今天的文章中,我将为你省去一半的功夫,教你博弈论的核心原则——那些你可以立即应用的原则。之后,你可以自行决定是否想深入探索,但那由你说了算。
今天,你将学到策略。我们从基础开始:什么是博弈,以及如何解读它。
内容目录:
- 博弈究竟是什么
- 策略的关键法则
- 场景:一座监狱与一张账单
- 均衡与求解博弈
- 迭代(“未来的阴影”)
- 总结(请收藏)
1. 博弈究竟是什么
这绝非比喻。当我们谈论博弈时,技术上指的是具有三个方面的情境:
- 不止一个人在做选择(n > 1,其中 n 代表参与者人数)。
- 结果取决于参与者选择的组合,所以这不仅仅关乎你。每个参与者都在塑造博弈的进程。
- 每个人都尽可能理性地行动,以最大化自己的收益。
这意味着每个人都在乎结果。我们通常不指望参与者会说“管他呢”然后走开,除非这本身具有战略价值。
在行为博弈论等背景下,我们可以审视他人超越理性激励的动机,例如情感需求和各种主观欲望,而不仅仅是资本或有形回报。
这意味着你每天身处十几种博弈之中,而你认不认识到这一点并不重要。
想过谁该先发短信吗?没错,那也是一场博弈。
这是第一项技能:认识到你自己也身处这些游戏之中。一旦你内化了这一点,它便会赋予你一种惊人的自主感。
你是一个玩家,所以不妨像个玩家一样行事。没有这种心态,你无法实践博弈论。
2. 策略的关键法则
在做普通决定时,比如设定闹钟时间,你通常会选择最佳选项:那个能让你有足够时间准备并去上班的选项。这完全是你自己的决定,没有人能真正影响它。
因此,在做决定时,总是存在一个最佳选项。
但游戏并非如此。
没有最佳选项——只有最佳回应。最佳回应完全取决于其他玩家会采取什么行动。同样,他们的最佳行动也受到你行为的影响。
这种“策略性相互依赖”是博弈论的数学支柱。你永远在对游戏做出回应。
3. 场景:一间监狱与一张账单
在我们真正分摊账单、看看日常生活中的博弈论之前,我应该简要介绍一下囚徒困境——这可能是整个博弈论中最著名的游戏。
说实话,如果你对博弈论哪怕有一点点兴趣,你肯定已经听过它无数次了。
尽管如此,我还是会简要概述这个游戏的本质,以便我们接着探讨一个更实际的场景。
囚徒困境被严重高估了。它并没有错,但已经被重复到如同墙纸一般司空见惯。知道它,如今不知怎的就被等同于“理解博弈论”。
这个游戏的设定很简单:两个共犯被捕并被分开。他们在两个不同的房间里接受审讯,因此完全无法沟通。
两个囚犯都可以在两种策略中选择:保持沉默或背叛对方。这导致了三种结果:
- 两人都保持沉默 → 每人入狱一年
- 双方互相背叛 → 各自入狱两年
- 一方背叛,另一方沉默 → 背叛者无罪释放,沉默者入狱三年
不要质疑这个游戏的逻辑。规则如此,既无法逃避,也别想“找你的律师来”。
在这种情况下,最佳应对是背叛。保持沉默风险最高。相比之下,选择背叛要么让你逍遥法外,要么只判两年。
无论哪种情况,背叛都是更优策略。
那问题出在哪儿?
首先,这让人们误以为博弈论总是关乎背叛,这完全不对。博弈论研究的是游戏的结构,而恰好这种结构相当冷酷无情。
其次,它过于抽象,不切实际。我得明确告诉你遵守游戏规则,以免你破坏它。因此,这不是一个很实用的游戏,也无法给你现实中的应用场景。
有实质内容的问题:分摊账单
现在,我们来谈谈餐馆里一个常见的恐怖场景。你和另外七个人享受美好夜晚,直到有人说出那句可能引发战争的话:
“那……我们平摊吧?”
假设大家都同意,因为这样省事。那一刻,游戏就变了:你点的菜的成本突然不再由你独自承担,而是大家共同分担。
- 现在,你点的菜仍按全价计入账单,但你只需支付其中一份。
- 因此,升级到更贵的餐点会让账单增加20美元,但你只需支付其中的2.5美元,其余由另外七人承担。这相当于8比1的补贴,而且无需任何人明确同意。
- 于是,每个人都升级。账单达到240美元;大家各自支付30美元(全价),没人得到折扣。
这真是个两难困境。
仔细想想你的处境。严格来说,从价值角度看,如果必须自己全额买单,你宁愿选便宜的。但现在价格变了。
- 如果现在其他人都点得节俭,而你点贵的,你花 2.5 美元就能享受一次巨大的特权。
- 如果其他人都点贵的,而你不点,你就是在为另外七个人的晚餐买单。
仔细看看这意味着什么。无论其他人怎么做,点贵的对你来说都严格更有利。如果你完全理性,你会点贵的,因为这是最佳应对。
在博弈论中,这被称为支配策略:一种无论发生什么情况都是你最佳应对的举动。它并非在每个场景中都存在,但一旦存在,它就是严格占优的选择。
支付矩阵:数学中唯一值得学的那部分
需要描述整个游戏及其支付真烦人。
现在——我答应过不拿数学烦你,但支付矩阵是唯一值得学的一种符号表示。
我们用它将游戏可视化;它基本上列出了在各种你和他人的选择组合下,你最终得到的结果。
让我们回到账单的例子:这次,我们假设一桌有 4 人。便宜餐 10 美元,贵餐 30 美元,前提和之前一样。
但贵餐对你来说不值 30 美元。假设你觉得 20 美元是更可接受的价格。

让我们像博弈论学者那样,一列一列地读:
- 如果所有人都点便宜的(左列):
点便宜的 → 你不赚不亏,为 0。
点贵的 → 你为 +5。贵的胜出。
- 如果所有人都点贵的(右列):
点便宜的 → 你亏 15。
点贵的 → 你亏 10。贵的再次胜出。
底行两次都胜过顶行。这是一个支配策略,所以你在这里无需预测任何东西,因为它始终是对付一切情况的最佳应对。
但当每个人都选择主导策略时会发生什么?游戏的某些东西发生了变化。一种均衡浮现了。
4. 均衡
再看一眼矩阵,把目光锁定在右下角。所有人都点贵菜被称为“纳什均衡”。在这种状态下,没有人能通过改变自己的选择来改善收益。
到了这一步,你已经无能为力了。不妨亲自试试:当其他人都在点贵餐时,你转而选择便宜的餐点。
你从-10变成了-15。太棒了。你现在是个英雄了。一个经常做出糟糕财务决策的英雄。
但这个问题能解决吗?
答案是……技术上可以,但实际上不行。
如前所述,你在游戏内部无法采取任何行动。一切需要做的都已尘埃落定,除非有人英勇牺牲自己,否则没人能改善处境——而这不太可能发生。
你只能通过改变(或避免)游戏本身来打破均衡。在这种情况下,只需一句话:“我们各自付自己点的东西吧。”
就这么简单。你否决了这场游戏,而一切都没有改变。
这是一个至关重要的教训。当某种情境导致糟糕的结果时,先审视产生这种结果的规则(比如平摊账单),再去看参与者。最后,你要么选择参与,要么选择避开。
每当参与意味着损失重大且看不到良好回报前景时,不参与便是制胜策略。
5. 迭代(“未来的阴影”)
还有一点:你参与的游戏会进行多少次?有时,游戏并非重复进行;这些被称为一次性博弈。在这种博弈中,人们往往表现不佳,因为完全没有未来再次相遇的可能,因此无人能实施报复。
与此相反的是迭代博弈。你在朋友圈中反复进行的事情就是一个例子。在这种博弈中,参与者往往表现得更好。这并非因为他们更善良,而是因为你们还会再见面;存在着一种挥之不去的未来的阴影。
因此,如果你希望某人表现良好,最好确保你们还会再见面。当然,当迭代博弈接近尾声时,务必小心谨慎。一旦有限的时间范围临近,最后一轮到来,它实际上就变成了一次性博弈。
6. 总结(请保存)
现在你已经掌握了关于博弈论的四条关键信息,它们覆盖了大部分核心内容。为了确保你能无缝运用,这里做一个总结:
- 你现在可以通过判断你的结果是否取决于他人的选择来识别博弈。如果是这样,那么你就身处博弈之中。
- 你应该始终考虑最佳应对,而不是试图做出最佳决策。
- 逐列阅读收益矩阵。找出你对每一列的最佳应对。
- 寻找均衡点。如果均衡对你不利,那么你可能需要重新考虑是否真的渴望参与这场博弈,或者干脆止损离场。
第一部分到此结束。课程完毕。