1. 一个具体问题

两个小组都可以投入时间维护共用文档。如果双方维护,大家查找信息都方便;如果只有一方维护,另一方可以享受成果却省下时间;如果都不维护,所有人都要反复询问。局部上看似合理的偷懒,可能让整体陷入较差结果。

2. 一句话解释

囚徒困境是一种博弈结构:每个人都有单方面背离合作的激励,但双方都背离时,结果比双方合作更差。

3. 出处与原意

这一模型通常追溯到 Merrill Flood 与 Melvin Dresher 在 1950 年的研究,Albert Tucker 随后用囚徒故事赋予其名称和直观表达。它的核心是收益排序,而不是故事中的犯罪情境;并非所有合作失败都符合囚徒困境。

4. 原理与机制

常用记号中,单方背离的收益 T 大于共同合作 R,R 大于共同背离 P,P 又大于单方合作 S,即 T>R>P>S。于是无论对方怎样选,自己背离都更有利;然而双方共同合作对两人都更好。这是一次博弈的结论。重复互动、可观察行为、未来价值、沟通和执行机制可能支持合作,但没有一种策略能在所有环境永远最好。若参与者偏好或制度改变了收益排序,也可能不再是同一种博弈。

重复互动中的合作依赖未来仍有价值,以及各方能够识别偏离。如果记录噪声很大,偶然失误可能被误当背叛,严厉报复又引发连锁冲突。因此机制还需要解释与纠错渠道,而不是只增加惩罚。现实协作中,明确最低贡献、让成果可见并允许补救,可能比照搬某个竞赛中的获胜策略更合适,尤其当参与者并非匿名且长期共事时。

5. 一个完整案例

假设案例:两个小组维护共享排障文档。双方维护时各得三分;一方不维护而另一方维护时,不维护者得五分、维护者得零分;双方都不维护时各得一分。对任一组,不维护在给定对方选择时都更高,但结果会落在各一分。团队改成每次故障关闭前由责任组更新对应条目,并把后续提问回流到未更新的责任组。规则改变了成本承担方式,不能再直接套原矩阵;随后需要重新观察新激励是否稳定。

6. 适用条件与反例

适合分析共享贡献和短期激励冲突。现实中公平偏好、身份与长期合作可能改变收益,不能先假定人人必然背叛。还要区别协调博弈:如果问题只是大家选不同标准,共同选一个即可,并不一定存在背离合作的占优策略。

7. 今天可以尝试的行动

遇到合作失败时,先写出四种行动组合各自的后果,检查收益排序是否真符合困境。若符合,寻找能让贡献可见、责任可追踪或未来收益更重要的机制,再评估是否引入新的负担。

8. 参考资料与关联条目

关联条目:纳什均衡;公地悲剧。