马丁·诺瓦克
主主持人编者按:2015 年,国际新制度经济学学会(ISNIE)年会邀请哈佛大学演化动力学项目主任、数学生物学家马丁·诺瓦克发表主题演讲。诺瓦克以演化博弈论研究合作的起源著称,著有《超级合作者》一书。演讲从三十亿年前的细菌讲到纽约地铁英雄,梳理了合作演化的五种机制,并以一项关于「与未来世代合作」的实验收尾,随后与在场的制度经济学家进行了问答。本文依据现场录音编译整理。
主持人: 下午好,严格说来也许该道一声晚上好了。希望各位在这届年会上过得和我一样愉快。本学会(不久之后就要更名了)有一个很好的传统:为了给制度分析引入新的视角,每年都邀请一位杰出学者来做主题演讲,这位学者的工作要能给我们的会员,以及所有研究制度的人,带来惊人、新颖而富有创造性的洞见。我接手筹办这届年会时,得到的指示之一,就是为主题演讲找一位「才华横溢、引人入胜」,而且,引用原话,「跳出框框」的人。「跳出框框」这几个字一入耳,我脑子里立刻蹦出了马丁·诺瓦克的名字。非常幸运,他答应了。下面我做一个简短的介绍,然后把时间交给他。
主持人: 马丁·诺瓦克是哈佛大学生物学与数学教授,演化动力学项目主任。此前他在普林斯顿高等研究院创建了第一个理论生物学项目。他在数学与生物学交汇处的科学成就多得数不清,我们可以用整个晚上来谈。他在演化过程的数学描述上做过开创性的工作,包括合作的演化、人类语言的演化,以及病毒感染与人类癌症的动力学。他在演化博弈论领域著述丰富,在利他行为的机制上,也就是今天的题目上,做过极富创造性的研究。他获奖无数,包括牛津大学韦尔登纪念奖、斯坦福大学戴维·斯塔尔·乔丹奖、数学生物学学会的大久保明奖。他发表了三百五十多篇论文,出版了四本书,其中一本各位可能刚读过,叫《超级合作者:利他、演化,以及我们为何需要彼此才能成功》。没读过的应该去读,不过请等演讲结束之后再读。有请马丁。
诺瓦克: 非常感谢。能来这里我深感荣幸。这份邀请实在无法拒绝,因为主办方答应替我出路费。
诺瓦克: 我是一名数学生物学家。我想先告诉各位什么叫数学生物学家。有一个牧羊人带着一群羊,一个人走过来说:「要是我能猜中你这群羊的数目,能送我一只吗?」牧羊人说:「行,你试试。」那人四下看了看,说:「一百一十二只。」牧羊人大吃一惊,数目分毫不差。那人就抱起一只羊要走。牧羊人说:「等等,要是我能猜出你的职业,能把羊还给我吗?」「请说。」「你一定是数学生物学家。」「你怎么知道?」「因为你抱走的是我的狗。」所以在我这个行当里,关键是把数字算对。希望今晚我们能把合作演化的数字算对。
诺瓦克: 合作是一种现象。第一张幻灯片上我举了三个例子。从左到右:三十亿年前,细菌就已经在合作了。它们结成丝状体,每隔一段就有一个细胞死去,用来供养其他细胞。这个细胞放弃了自己的繁殖,去帮助别的细胞繁殖。如果世界只是达尔文式的竞争和自然选择,为什么会这样?自然选择怎么可能造出一个不繁殖、反而去提高别人繁殖率的个体?幻灯片中间是社会性昆虫,蚂蚁,大约在一亿两千五百万年前出现。同样,工蚁不繁殖,却帮助蚁后繁殖。自然选择为什么要造出这样的个体?达尔文在他的书里就已经提出了这个问题。最后一个例子来自我们自己的时代,当然是演化意义上的「我们的时代」,两千年前。这是一幅好撒玛利亚人的画,其实是梵高的作品,画的是好撒玛利亚人。好撒玛利亚人在帮助别人。如果我们都处在竞争之中,像在法学院那样,为什么还要去帮任何人?
诺瓦克: 可人就是会互相帮助。再举一个例子。福岛核电站熔毁的时候,一位二十多岁的工人自愿加入了重返厂区的队伍。他知道这个选择可能让他此后无法结婚生子,因为他怕把健康后果转嫁给家人。他在采访中说:「能干这份活的只有我们这些人。我单身,年轻,觉得帮忙解决这个问题是我的责任。」还是那个问题:他为什么要这么做?
诺瓦克: 再一个例子。这位先生在纽约地铁站台上等车,带着两个女儿去上学。他看见另一个人癫痫发作,身体不受控制地抽动,然后跌下了站台,摔在轨道上。他看到了这一幕,而列车的车头灯已经出现,列车正在进站。他跳下站台想把那人拉上来,却发现来不及了,车已经太近。于是他扑在那人身上,列车从两人上方驶过,两人都毫发无伤。他叫韦斯利·奥特里,后来成了「纽约地铁英雄」,受到布隆伯格市长的表彰,大家都在赞颂他的勇敢。
诺瓦克: 我们当中很少有人能做到这一点,很少有人生来就是英雄的料。但我们所有人都会有那种感觉:天哪,太危险了,我能做点什么帮帮这个人?如果有人陷入危险、命悬一线,我们会本能地想去帮。可我们为什么会有这种本能?如果一切只是竞争,只是适者生存,演化为什么要给我们装上这样的本能?动物也有这种本能吗?有些动物有吗?所有动物都有吗?还是说,同类被吃掉了,它们根本不在乎?这就是生物学里的合作问题。
诺瓦克: 我想从最开始的开始讲起。这是我每次讲课都放的第一张幻灯片。每年秋天开课,我都告诉学生:真正重要的日期没有几个,这几个就是最重要的。你可以问,一切是什么时候开始的?去问物理学家,他们会告诉你:一百三十七亿年前。你还可以问,太阳系是什么时候形成的?物理学家又会给你一个非常精确的答案:四十六亿年前,准确说是四十五亿六千七百万年前,太阳点燃。此后很快,地球形成。地球诞生两千五百万年的时候,被一颗大约火星大小的行星撞击,由此产生了月球,也产生了板块构造。板块构造对碳循环至关重要,碳循环使生命起源成为可能。这次撞击大概也造就了地球的磁场,磁场对我们所知的这种生命同样极为重要。这颗行星上发生了一连串惊人的巧合,才有了我们所知的生命起源和演化。
诺瓦克: 不过我觉得在某种意义上,事情也可以反过来看:演化和生命对环境的适应如此彻底,不管我们身在何处,都会觉得那里正好适合我们。这些巧合全都发生了,简直是奇迹。我们在这里,是因为我们对这些条件适应得太好了。所以每当你在一片宁静祥和中仰望月亮,请记住,每次我看到月亮,想到的都是那场暴烈的起源。我们是怎么知道这些的?我们知道,是因为月球是由地球的地幔构成的。如果月球像地球一样是单独形成的,它也会有一个核。它没有地球那样的核。而且相对于地球来说,它也太大了。
诺瓦克: 接下来到生物学,日期就不像物理学那样清楚了。大多数人认为,生命起源于地球,每一位科学家都这么想。还有另一种可能:我们是被细菌孢子「授精」的。我认为这并非完全不合理,因为那些孢子可能藏在行星碎块里,而那些碎块本来就在引力坍缩形成太阳系的那个盘里。但多数人认为生命起源于地球,如果是这样,那大约是四十亿年前。我们确知的是,三十五亿年前已经有细菌生命的化学证据,这一点在那个领域是公认的。所以三十五亿年前,这颗行星肯定已经布满了细菌。有人想把时间再往前推一点,到三十八亿年,但三十五亿是确定的。三十亿年前,这是一颗只有细菌的行星。你知道吗,到今天也没变多少。惊人的是,如果你问地球上有多少个细胞,你只需要数细菌细胞就行了,估计一下就够。答案大约是十的三十次方。十的三十次方个细胞,全是细菌,其余的不过是零头。细胞总数里,细菌压倒一切。就连人体内,细菌细胞也比人的细胞多。如果把一个人身上所有的人类细胞都拿掉,那里还坐着一个「人」。
诺瓦克: 然后,过了大约十七亿年,高等细胞才出现,也就是有细胞核和细胞器的细胞。高等细胞构成了植物、动物和其他一切。从细菌的世界走到高等细胞,花了十七亿年。我们其实不知道它们是怎么立足的:在一个每个生态位都被细菌占满的世界里,它们凭什么能冒出来?它们利用了什么细菌尚未充分利用的东西?总之它们出现了。然后,大约六亿年前,出现了复杂的多细胞生物。氧气骤然增加,允许更大的生物体存在。所谓复杂多细胞,是指生物体大到有了内部和外部,你得操心怎么把氧气送到里面去。六亿年前的这些复杂生命形式,随后分化出植物、动物和真菌这几个主要的界。
诺瓦克: 我和爱德华·威尔逊共事,出于礼貌,我在这份大事年表里也加上了社会性昆虫的出现,大约一亿两千万年前,因为那是一种新的形式:社会性昆虫的超级生物(superorganism)是生物适应的一种特殊形态。
诺瓦克: 但如果你问,过去六亿年里最有意思的事情是什么?只说一件,过去六亿年里真正改变了一切、扭转全局的事情,只有一件,那就是人类语言的演化。为什么?因为突然之间,我们有了一种新的演化方式。没有人类语言,只有基因演化;有了人类语言,就有了文化演化。人类语言是文化演化的载体。信息不再只靠基因传播,还靠交流传播。一群人彼此交谈、互相学习,这就是一个演化过程,它具有的规律性,和我们用来描述基因演化过程的数学是同一种,二者非常相似。
诺瓦克: 在这幅大图景里,我觉得最迷人的一点是:合作才是演化过程真正的总建筑师。是合作把你从简单的组织形式带向更高级的形式,从单细胞到多细胞生物,从单个动物到动物社会,再到人类社会。
诺瓦克: 那么什么是演化?演化的究竟是什么?提出这个问题的是哈佛的一位教授,恩斯特·迈尔,他活了一百多岁。他写了一本很美的书,《演化是什么》,我向每一个人推荐。他在书里解释了演化是什么,还解释说,在他出现并向人们说明物种如何形成之前,没有人真正理解达尔文主义。这个看法是对的。那么演化的究竟是什么?他说,我们平常笼统地讲基因的演化、大脑的演化、神经系统的演化,但那都只是打比方。真正在演化的只有一样东西:种群,由繁殖个体组成的种群。演化过程的载体是种群,一个通过基因或者通过文化进行繁殖的种群。突变意味着出现了新的类型;选择意味着随着时间推移,类型的构成发生改变,因为有些类型比别的增长得快。这是达尔文演化的两个基本要素:突变产生变异,选择作用于变异。选择就是一种竞争,某个东西增长得比别的快,更擅长占据那个生态位。
诺瓦克: 过去十年里,我提议在这份清单上加上第三条原则:合作。合作的意思是,各个单元开始互相协作,协作得越来越紧密,直到它们变成一个新的单元。多细胞生物就是这样出现的。反过来,癌症就是人体细胞之间合作的崩溃:细胞发生突变,退回到只管复制的原始程序。
诺瓦克: 什么是合作?意思是个体互相帮助,这些个体可以是病毒、细胞、动物或人。有一个施惠者,施惠者付出代价,受惠者得到收益。这不是最完整的合作定义,但它简单直观,足够支撑今晚这场演讲。要更精确的定义,可以深入博弈论。
诺瓦克: 现在有两个个体,一个可能合作,另一个接受帮助,这就构成了一个博弈。如果双方都可以在合作与背叛之间选择,这个博弈就叫囚徒困境(Prisoner's Dilemma)。这里写的是囚徒困境的支付矩阵,用收益 B 和代价 C 两个符号表示。等一下我要请各位和我玩这个游戏,这就是你们会得到的报酬。如果你合作,我也合作,你的收益是 B 减 C:你从我的合作里得到收益 B,但要为自己的合作付出代价 C。如果你合作而我背叛,你的收益就是负 C:你只付出代价,没有收益,因为我选择了不帮你。如果我合作而你背叛,你的收益是 B,没有代价,只有收益。如果我们都背叛,没有代价,没有收益,就是零。只要收益大于代价,代价大于零,这个博弈就是囚徒困境。这就是支付矩阵。现在你们必须做出选择:合作还是背叛?想合作的请举手。想背叛的请举手。
诺瓦克: 我在北京对两千人的听众玩过这个游戏。两千个北京人里有多少背叛者?零,绝对的零。这里大致是一半对一半,很有意思。常见的情况是三分之二合作,或者三分之一合作。总之这是一个合作的群体。
诺瓦克: 按照博弈论的思路,作为经济学家(各位都是经济学家,都知道约翰·纳什),你们本可以、或者说本应该这样分析这个博弈。你不知道我会怎么做。假设我合作,你要在 B 减 C 和 B 之间选,B 比 B 减 C 好。所以如果你认为我会合作,你会选择背叛。如果我背叛,你要在负 C 和零之间选,零比负 C 好。所以如果你认为我会背叛,你也还是背叛更好。不管你假设我做什么,背叛对你都更有利。如果我用同样的方式分析,我们两人最后都背叛。这时我们都不开心,因为我们的收益是零。要是我们没有选择纳什均衡,本来可以得到大于零的 B 减 C。这就是困境所在:理性的玩家背叛,最后收益很低;两个非理性的玩家可能合作,反而收益更高。这差不多就是博弈论对理性的定义。有时我的学生听我管这叫「理性」会很不高兴,但这确实是博弈论中严格的数学定义:分析支付矩阵,然后选择纳什均衡。我们这里用的这套数学,是冯·诺伊曼和摩根斯坦战后在普林斯顿合作发明的。
诺瓦克: 刚才我用理性来分析这个博弈,但在生物学里我们不用理性。谈到细胞或者蚂蚁,我们不会设想它们坐在支付矩阵前面,问自己纳什均衡在哪里。有意思的是,自然选择替它们做了这件事。如果有一群合作者和背叛者随机相遇,背叛者的平均收益总是高于合作者的平均收益,因此背叛者繁殖得更好。这就是演化博弈论的思想:收益意味着繁殖成功。过一段时间,自然选择偏袒背叛者,直到合作者被消灭殆尽。所以自然选择是反对合作的。这正是我们的直觉:如果一切都是竞争,我们为什么要帮别人?
诺瓦克: 因此自然选择需要帮助,才能让合作者压过背叛者。因为合作就在那里,大量存在,非常重要。我们怎样才能让自然选择「明白」合作的好处?关于这个问题,大概已经写了三千篇论文。在我看来,这些论文全部可以归纳为五大类,五种机制。这就是我今晚要讨论的合作演化的机制:直接互惠、间接互惠、空间选择、群体选择、亲缘选择。它们可以看作五种互动结构,在这些结构之下,自然选择能够看见合作的好处。
诺瓦克: 直接互惠(direct reciprocity)的思想是:我帮你,你帮我。博弈现在是重复进行的,我们玩的是重复囚徒困境。人们不是只玩一次,而是玩很多次。刚才和我合作的那些人,按我们的分析,他们的直觉大概是:我们大多数重要的互动都是重复的,而在重复互动中,合作确实是有道理的。还有另一种直觉,我们讲到第二个机制时再说。总之,一旦博弈重复进行,背叛就不再是唯一的最优选择。经济学家非常清楚,有一个民间定理(folk theorem):在重复博弈中,只要重复得足够久,就可以得到其他均衡。
诺瓦克: 但密歇根大学安娜堡分校的政治学家罗伯特·阿克塞尔罗德在七十年代末提出了另一个问题:玩这个博弈,什么才是好策略?他说,把你们的计算机程序寄给我,我让这些程序互相对战,看谁赢。出人意料的是,提交上来的最简单的程序赢了。它是加拿大籍的俄裔博弈论学者阿纳托尔·拉波波特提交的,只有三行:我先合作;如果你合作,我下一轮合作;如果你背叛,我下一轮背叛。我先合作,然后你上一轮做什么,我就做什么。想想这个策略,你实际上是在和错后一步的自己对战。就好像我举起一面镜子,你在和自己下棋:你现在怎么做,我下一轮就怎么做。阿克塞尔罗德办了两届锦标赛,以牙还牙(Tit-for-Tat)两届都赢了。第一届它赢就已经出人意料,第二届人们专门设计了要胜过以牙还牙的策略,它还是赢了。那时候,以牙还牙成了这个博弈的世界冠军。人们写了很多论文和书来解释这种以牙还牙式的行为,在动物身上、在学生身上,到处都能找到它。它的道理就是:以眼还眼,以牙还牙。
诺瓦克: 这位世界冠军有一个阿喀琉斯之踵:它太不宽容了。两个以牙还牙的玩家对局,只要一方开始背叛,另一方就会报复,然后双方就再也走不出这种互相报复。我在维也纳跟随卡尔·西格蒙德开始做博士论文的时候,领域的状况就是这样,我们想往前再走一步。和阿克塞尔罗德不同,我们不想让人来提交任意的策略,而是让自然选择来设计策略:由突变和选择来设计,由选择在策略之间做取舍。于是我们做了一场计算机锦标赛,策略是随机生成的,同时配合对这些互动的数学分析。
诺瓦克: 让自然选择来设计策略,起点是一个随机的策略集合。如果大家随机地玩这个博弈,第一个赢家总是「永远背叛」。如果人们玩的策略毫无章法,我一直背叛就能赢。妙就妙在,事情没有到此为止,这对我的博士论文来说是好事。接下来发生的是,突然冒出了一小群以牙还牙的玩家。如果这里所有人都永远背叛,而少数几个人开始玩以牙还牙,他们彼此之间就能得到不错的收益,自然选择就可以开始偏袒他们。而且他们不太会被永远背叛者剥削,因为一遇到永远背叛者,他们立刻转为报复。
诺瓦克: 但事情还没完。以牙还牙没能持久,在这个环境里它立刻被另一个策略取代了,那就是宽容的以牙还牙(Generous Tit-for-Tat)。什么是宽容的以牙还牙?我先合作;如果你合作,我合作;如果你背叛,我以某个概率仍然合作。这是一个关于宽恕的概率配方:只要你合作,我就合作;但如果你背叛,我仍有一定概率继续合作,试图重建这段关系。关键在于,这是一个随机决定,你无法预测我会不会这么做、什么时候这么做。但它能通过宽恕挽救这段关系。这个策略在我们的分析中表现好得多,原因是我们的分析里天然允许出错。策略不是确定无疑地严格照章执行,而是像在自然环境里那样会犯错,而这些错误必须靠宽恕来弥补。所以,在一个可能出错的世界里,自然选择发明了宽恕。
诺瓦克: 现在假如每个人都玩宽容的以牙还牙,接下来的意外是:我们突然滑向了「永远合作」。如果这里所有人都是宽容的以牙还牙,我玩无条件合作,我没有任何劣势,我是一个中性突变体。这是中性演化,就像鸟类到了一个没有捕食者的岛上,就失去了飞翔的能力。我们从宽容的以牙还牙走向无条件合作。到了这一步,你能预见接下来会发生什么:我们招来了永远背叛者的入侵。于是我们得到了一个关于战争与和平交替的数学模型,关于人类历史,关于经济周期的繁荣与崩溃。我在这个领域的全部工作,讲的始终是循环。经济学家热爱均衡,他们喜欢问:均衡在哪里?可在大多数演化分析中,我们看到的从来不是均衡,而永远是一种动态局面:合作建立起来,被摧毁,又必须重建。这是第一个机制。
诺瓦克: 第二个机制是间接互惠(indirect reciprocity)。间接互惠的思想是:我帮你,别人帮我。不管纽约地铁英雄的动机是什么,他想的肯定不是「这是重复囚徒困境的第一轮,我先合作」。这里的思路是,你和别人互动,而互动被旁人观察到。你和某人合作,你的声誉就提升;你背叛某人,你的声誉就受损。这是一个完全直观的想法。我敢说,我们和他人的所有重要互动,要么是重复的,要么发生在一个声誉有分量的场合里。实验上的证实是:人们会帮助那些帮助过别人的人,乐于助人的人最终收益更高。这些实验可以让学生坐在电脑屏幕前完成,现在我们也在亚马逊的众包平台 Mechanical Turk 上做。
诺瓦克: 这里的想法是,八卦传播声誉。我们互相谈论别人。eBay 和亚马逊上的评价,根本的思路也是这个:如果卖家声誉好,我们愿意付更高的价钱。我们对八卦着迷,茶歇时的闲聊,我们通常就是在互相谈论别人,打听别人的事。英国做过一项定量研究,研究者在往返的火车上听乘客的谈话,其中六成被归为八卦,也就是和间接互惠相关的内容。
诺瓦克: 这些间接互惠的博弈推动了社会智能和人类语言的演化,因为它们在认知上要求很高。你必须分析周围的局面,问自己:谁对谁做了什么?你还必须能够和别人谈论第三者,叫得出名字。在人类语言之外,我们不知道任何这样的例子,但事实就是如此。我在哈佛的朋友戴维·黑格说过:直接互惠需要一张脸,间接互惠需要一个名字。要同时和各种各样的人玩重复博弈,我必须认得出他们,面孔识别是生物体非常重要的一种能力。而间接互惠要求我们能够互相谈论别人,这正是催生人类语言的那股推力。
诺瓦克: 第三个机制是空间选择(spatial selection)。空间选择的思想是:邻居互相帮助。合作的社区吸引新来者,合作者在稳定的环境中结成集群,而这些集群能够存活下来。周围可能是一片背叛者的海洋,但合作者主要和彼此互动,这样自然选择就能在这些空间结构中看见合作的好处。这是在空间博弈或者社交网络的框架下分析的。同样的思路适用于社交网络:你主要和朋友互动,你和朋友们合作,就算周围有背叛者,你也在某种程度上保护了自己,因为你的互动大多发生在朋友之间。还有一种我们称为演化集合论(evolutionary set theory)的东西:人们归属于不同的集合,比如某个系、某个街区、某个网球俱乐部。人们和同一集合里的人互动,并且模仿成功者的策略和集合归属。如果他们发现某个群体里合作运转得很好,可能就会想加入进去。
诺瓦克: 第四个机制是群体选择(group selection)。群体选择可以追溯到达尔文,他在 1871 年的《人类的由来》里写道:「毫无疑问,一个部落如果有许多成员随时准备互相援助,并为共同的利益牺牲自己,它就会战胜其他部落,而这就是自然选择。」他毫不犹豫地把自然选择的思想从个体扩展出去,去思考群体之间的竞争:一个群体里的人互相帮助,另一个群体里的人不帮,乐于助人的群体战胜不乐于助人的群体。
诺瓦克: 第五个机制是亲缘选择(kin selection)。霍尔丹有一句妙语:「我愿意跳进河里,去救两个兄弟或者八个堂表兄弟。」意思是,如果我有一个基因让我这么做,这个基因也在我兄弟身上的概率是二分之一。那么,要让自然选择偏袒这个基因,我这样做的死亡风险必须小于二分之一,或者我必须救上两个兄弟。这在某种意义上就是裙带关系的逻辑:我们帮助近亲。与这个现象相伴的还有一套数学分析,叫广义适合度理论(inclusive fitness theory),我对它批评得很厉害。这是一种不严格的处理演化数学的方式,流行了很长时间,也有相当数量的追随者,但在演化的数学分析中它说不通。这场争论仍在进行,争的主要不是现象本身,而是究竟该怎么分析它,是否应该信任演化过程的数学语言。我非常信任,而喜欢广义适合度那套数学的人信任得少一些。
诺瓦克: 我讲的合作演化的五种机制是:直接互惠,我帮你,你帮我;间接互惠,我帮你,别人帮我;空间选择,邻居互相帮助;群体选择,合作者群体在竞争中胜过其他群体;亲缘选择,与基因上的亲属合作。结论是:演化不只是竞争,也是合作。哲学家有时也喜欢这个结论,我们甚至因此和哈佛神学院合办过一个项目。如果基本原则里也有合作,那这个世界毕竟没那么糟。合作是演化的第三支柱,是生物复杂性的建筑师。
诺瓦克: 现在有一个非常大的问题。我们已经差不多征服了整个星球,主宰了几乎每一个生态系统。这很危险,因为我们在榨取它。为了可持续,我们必须学会全球合作。过去我们只需要在本地学会合作:和朋友、和家人、和村子里的人。可突然之间,这些互动变成了全球性的,我们必须和别的国家合作,尽管它们的处境可能和我们截然不同。这要怎么做?如果你认真想想怎样让气候可持续,问题还要复杂得多,因为现在实际上要求你付出代价,让未来世代得到收益。我们怎样才能找到机制,让人们学会与未来合作?我认为这就是制度发挥作用的地方,也是这个会议也许能帮上忙的地方。
诺瓦克: 我在剑桥参加过一个会议,英国科学大臣戴维·威利茨也在。他在演讲里提到一个简单的例子,启发我做了接下来要展示的实验。他说的是:英格兰有一片森林,有人想把它砍掉,也有人想保住它。保护的一方先说:现在别砍,木材价格在涨,现在砍从财务上说是个坏决定。对方听了,但没有被说服,这个理由不够有力。第二次尝试是:请别砍,本地人拿它当休闲场所。对方还是没有被说服。最后他们说:你们没有权利砍掉这片森林,因为它是前人留给你们的,现在你们有义务把它留给后人。出人意料,这个理由赢了。
诺瓦克: 从那个会议回来,在机场我就开始想,怎么把这件事做成实验。我们花了些时间才设计出来。接下来给各位看的视频是《自然》杂志做的。我们的实验发表在《自然》上,他们做了一段视频来解释它。这个实验并没有真正解决威利茨描述的那个现象,但它引出了一个问题:与未来合作究竟是什么,我们怎样才能做到?令人惊喜的是,他们做的视频非常直观,看起来很有意思。
视频旁白: 我们该给未来世代留下什么?多数人都同意,我们应该为未来保存环境这样的资源,可我们并不擅长这么做。为什么?我们怎样才能更好地与后来的世代合作?传统上,经济学家在模型里假设人大体上既理性又自私。多数公共政策都是想让自私的人做出有利于整体的行为,比如重复使用塑料袋有奖励,想要新袋子就得付钱。但有证据表明,只要别人也合作,我们愿意为更大的利益而合作。哈佛的一个团队对此做了检验。他们为一个在线游戏招募了好几「代」玩家。每一代有五名成员,共享一百个单位的资源。如果剩下的超过一半,资源就能传到下一代,并重新补足到一百。团队试了几种做法。如果让人们自己决定从资源池里拿多少,资源撑不到下一代,通常只是一两个大拿者造成的。研究者随后换了一个版本:五名成员投票决定拿多少,每人拿走的是投票的平均数。这样投票不符合自私的利益,却有利于投票者永远不会遇到的未来世代。顺便说一句,玩家之间互不相识。这样一来资源就可持续了,在有些局里资源延续了十四代。但它只有在人人都投票时才奏效。在另一个变体里,只有少数人投票,其余人自由选择,资源池就被掏空了。作者说,投票之所以有效,一是因为占多数的合作型玩家可以约束抢夺者,二是因为合作者可以放心,自己的努力不会白费。没有人想当冤大头。那么政府怎样利用我们对未来世代的温情与合作意愿?只有在投票具有约束力时,我们的合作天性才能被利用起来。这就是为什么《京都议定书》这类关于碳排放的非约束性协议没什么力量。国际政治永远不会容易。团队接下来打算研究不同国家的居民怎样玩这个游戏,看看文化是否影响合作。在此期间,这个思路也许在更本地的层面最管用。比如,如果某个海域的每一位渔民都对每日最大捕捞量投票,而且人人都要负责,这个社区就更有希望为未来保住鱼群。这项研究表明,人类确实具备许多人期盼已久的一种能力。爱因斯坦说过:一切真正有价值的东西,都只能通过许多人无私的合作来实现。
诺瓦克: 实验是这样的:五个人一组,可以从一个资源池里收割。我们告诉他们,只要池子里留下五十个单位,我们就会为后面的人把它补满。我们说,你们是第一组五个人,你们之后还有十组、每组五人在等着。最初的版本不在网上做,被试比如是哈佛学生。结果第一轮就有九成的资源池被毁掉了。他们基本上什么也没给后面的人留下,让后来者无法获得收入。在线实验也证实了这一点。
诺瓦克: 后来奏效的办法是投票,而不是让每个人拿走自己觉得合适的数量。投票的规则是,中位数分给每一个人。它奏效,是因为大多数人投出了利他的票。这正是令人惊讶的地方。他们投利他的票没有任何理性上的理由,但他们就是这么投了。只要能向他们保证每个人拿到的都是中位数,也就是说,我采取利他行动,不会因为别人拿得更多而被剥削,那么绝大多数人就会投利他的票。所以,只要有一个制度能实施有约束力的投票,这套系统就能运转。而令人惊讶的观察结果是,一个庞大的利他多数投票反对了自身利益。通常人们对制度设计的想法是,要设计得让人们自私地投票也能得到好结果,但在这里,人们是无私地投票得到了好结果。在全球尺度上,在真正要紧的地方,怎么做到这一点,我很难想象。但我认为,方向就在这里。非常感谢。
提问者: 我有两个问题。第一个,对经济学家来说,末期问题非常重要。在重复博弈中谈合作,我们知道,如果博弈无限进行,合作可以维持;但如果有最后一期,一切就会瓦解。我想请你就此谈谈。你描述的那些情形,听起来像是无限期的。谈基因的时候,这也许是对的假设,因为基因产生基因,一代代下去。但我不太清楚。第二个问题,这个会议上的人非常关心合约和组织之类的东西。你最后那个例子有点触及这一点,虽然它更复杂,是关于未来世代的。但我们感兴趣的基本上是那些没法指望合作的情形,合作是有限度的。你的囚徒困境例子有 B 和 C,我想这里多数人会说,如果背叛的收益足够大,那套机制就不能指望了,你需要某种由法院执行的有约束力的合约。在我看来,你的故事漏掉了这一块:人们彼此友善能带来的好处是有上限的,它固然重要,但有它的限度。
诺瓦克: 很好,两点意见都非常重要。第一点,如果重复博弈有一个最后一期,比如我告诉大家玩五次,我在课上就和学生这么玩。你们玩五轮,到了最后一轮,之后没有未来了,所以最后一轮应该背叛。但如果我们都知道第五轮会背叛,那么第四轮也显然应该背叛。如果我们知道第四轮和第五轮都会背叛,第三轮就该背叛,以此类推。这叫倒推法(backward induction)。按照倒推法,如果我告诉你博弈恰好五轮,理性的做法就是一路背叛。对此我有两点回应。
诺瓦克: 一是我们在分析中通常怎么绕开它:我们用开放式的博弈,也就是每一轮之后都有一定概率再来一轮。我们不告诉你恰好玩五次,而是说,每一轮都有百分之九十的可能还有下一轮。这样你就不知道终点在哪里。这个「再来一轮的概率」也可以解释成对未来的贴现:现在到手的收益,比未来的承诺更值钱。我们经常把它归入这一个参数:再来一轮的概率,或者对未来的贴现。所以博弈不一定是无限重复的,但也不具备「恰好有最后一轮」这个特征。
诺瓦克: 不过,即便博弈确有最后一轮,也会发生一件很有意思的事:如果我告诉学生你们玩五次,他们照样合作。第一轮合作,第二轮合作,一直到他们开始担心为止。人们其实不太做倒推。理性的博弈论分析,也就是只玩纳什均衡,在这种情况下就是背叛。但我们的演化分析给出的结果,和人们的实际行为要接近得多,也就是他们会试着合作。因为在我们的演化分析里有一个量,叫选择强度(intensity of selection)。选择强度弱,意味着人们的困惑程度高,这时你恰恰可以演化出这样一种行为:即使有末期效应,他们仍然合作。而且我们用来分析这种局面的博弈,比重复囚徒困境还要强,因为它带有收益递增的乘数效应。所以末期效应非常重要。
诺瓦克: 第二点,如果代价与收益之比变得不利,这些机制中的许多都会失灵。所有这些理论都伴随着精确的数学计算,我总是想搞清楚的正是:在什么样的代价收益比之下它仍然有效。我们给出的是精确的条件:背叛的诱惑可以大到什么程度,机制仍然成功。以重复囚徒困境为例,最关键的条件是,再来一轮的概率必须大于代价收益比。满足这个条件,自然选择就有机会偏袒合作;不满足,就没有任何机会。所以,如果你说现实世界中可能存在这样的情形:背叛的诱惑太大,在给定的延续概率下,这个机制根本不运转,那这和我们的分析是一致的。你需要别的东西,可以说你需要的就是制度。
诺瓦克: 在我们这个领域,我们也开始分析制度的效果,这非常迷人。我们是分两步走进这个问题的。第一步是一个提议:可以用惩罚来稳定合作。引入的是同伴惩罚(peer punishment):人们在公共品博弈中可以选择合作或不合作,公共品博弈就是多于两人的囚徒困境。之后他们可以付出一点代价,去扣掉别人的收益,我们称之为同伴惩罚。同伴惩罚可以让人们在公共品博弈中合作,但它有个问题:它会引发报复。如果我被惩罚了,我可能去报复惩罚我的人,而不是提高自己的合作水平。所以同伴惩罚在某些情况下有效,但我发现,只要这种互动方式可行,它更可能被用来做坏事,而不是用来维护公共合作,因为它被用来强化某些人对另一些人的支配。大多数制度实际上都想确保同伴惩罚不会发生,因为那会毁掉群体的生产力。
诺瓦克: 所以,与其让个人在这些情形下惩罚,下一步是说:让我们建立一个制度,由制度来惩罚公共品博弈中的背叛者。在我们的分析中,通常是这样做的:先问人们,你们愿不愿意出钱建立这样一个制度?如果出钱的人足够多,制度就生效,此后凡是在公共品博弈中背叛的人,都会自动受到这个制度的惩罚。这似乎比同伴惩罚有效得多。这就是支持制度的论证。
提问者: 我的问题和上一个密切相关。在估计合作的收益或者不合作的代价时存在不确定性,这种不确定性怎样影响合作的动机,以及同意建立一个惩罚不合作的制度的动机?在我看来,建立制度这件事本身,会遇到和当初达成合作时一样的囚徒困境,因为制度本身就可以强制合作。
诺瓦克: 各位是制度方面的专家,我是来向各位学习的。但我的直觉是,许多制度并不是由一群用心良苦的人建立的,那些人想把事情做对,想让所有人受益。那是建立一个伟大的理想主义制度的方式。但还有另一种建立制度的方式:我现在拥有的比别人多得多,我得确保有一支警察力量来保卫我已有的东西。这样的制度,是由那些需要保护现状的人建立的。
诺瓦克: 你问题的另一部分是关于不确定性。不确定性以两种方式进入我们的分析,我们觉得这非常有意思。设想一个社会情境,策略是通过人们互相学习来「繁殖」的。我们通常这样描述:人们观察彼此的收入、彼此的收益,然后试图采纳某个在博弈中表现好的人的策略。这里有两个层次的困惑。一是关于策略的困惑:我看出你干得很好,但我没有完全弄懂你的策略,我向你学,却学错了。这就是我们所说的突变,突变是关于策略的困惑。另一个层次的不确定性是:我看着周围的人,想模仿收益最高的那一位,但我对收益的评估是模糊的,这是关于收益的不确定性。有趣的是,在我们的语言里,这就是选择强度。人们并不真正理解不同策略之间的差别,他们近乎随机地行动,只是略微偏向好的策略。正是这种选择强度上的不确定性,使得我们关于人类行为的生物学模型和实验室里实际观察到的非常接近,而完全理性的、只玩纳什均衡的分析,往往和实验室里观察到的不符。如果演化过程中对收益没有任何不确定性,也就是选择强度无穷大,我们就回到了纳什均衡的理性分析那个世界,二者完全一样。
提问者: 演化博弈论试图预测制度的演化。那么这套分析工具能否刻画一个有智慧的规划者,一个通过某种零敲碎打的社会工程来有意创建制度的人?这套分析装置能捕捉到这一点吗?这会加速演化吗?也就是说,能否设想用这套装置建立一个演化过程的模型,让某条特定的法律规则作为这个演化过程的均衡结果出现?
诺瓦克: 我认为这会给我们这个领域带来一个迷人的新方向,而它目前要么根本不存在,要么至少不是主流。这正是我们此刻所缺少的。演化过程几乎是盲目的,没有一位工程师坐在上面设计它,只有一些对全局所知甚少的个体,因为做了某件事而被选择,最后产生了有益的结果。所以我认为,我们缺的正是你描述的东西,而追问它如何纳入演化的框架,会极其有趣。哈佛的生物学教授安德鲁·默里举过一个很有意思的例子:演化会怎样修一条从纽约到波士顿的铁路?它会从纽约朝各个方向铺铁轨,然后留下那条恰好通到波士顿的。它也能修出一条纽约到波士顿的铁路,但用的是这种办法。这就是生物学做事的典型方式。
提问者: 我想问方法论的问题。你的演讲从自然演化讲起,最后落到社会演化,并且强调有约束力的制度的作用。作为一个外行,我想知道这两者是怎么联系起来的。比如,在社会性动物的社会里,比如蚂蚁,有惩罚吗?
诺瓦克: 基因演化和文化演化是相关的现象,但我要说,它们不一定是同一个现象。有人为文化演化建立了精确的数学模型,通常就是直接拿基因演化的模型来用,说它们是一回事。但可能存在关键的差别,还没有人研究过。其中一个就是:突变的本质究竟是什么?在基因世界里,突变是 DNA 碱基结构的改变,非常接近一个随机过程。但在文化情境里,突变是一个新想法,而这个想法未必是完全随机产生的:可能有一个大脑在思考当前的局面,然后提出了一个新的见解。那么文化情境中的突变真的是随机的吗?还是背后另有东西?这是一个很深的问题,我不知道怎么回答。你可以说,好吧,这个人确实分析了周围的局面,但那一下突然引出见解的火花,仍然是大脑里的一个随机过程。不过我认为,突变的本质在文化情境和基因情境中可能有实质的不同。
提问者: 据我理解,你的合作模型,或者说合作的基础案例,是囚徒困境。你认为这个框架能否表示另一种基础博弈?比如协调博弈:对角线上的结果虽然对称,却只有一个真正好,双方要做的是避开对角线之外的结果。这种合作能在你的框架里表示吗?
诺瓦克: 为了这场演讲的简洁和直接,我只给了收益和代价两个参数,它们实际上只是一个参数,收益代价比。我想把事情尽量简化。但我们实际的数学分析,从来都是对任意博弈进行的:对任意支付矩阵,囚徒困境也好,协调博弈也好。更一般地,我们会问:在所有博弈构成的世界里,什么才算合作困境?有些协调博弈我会算作合作困境,另一些则不算。这个数学框架是非常一般的。
主持人: 非常感谢。
哈佛数学生物学家马丁·诺瓦克论证:自然选择本身反对合作,但五种机制(直接互惠、间接互惠、空间选择、群体选择、亲缘选择)能让合作演化出来,合作因此是继突变与选择之后的"演化第三支柱";而在跨代、全球尺度的合作难题上,实验显示具有约束力的投票制度能让多数人自愿放弃私利。

微信公众号