朱迪亚·珀尔
主主持人编者按:2012年,朱迪亚·珀尔(Judea Pearl)因创立概率推理与因果推理的演算体系而获得ACM图灵奖。他主动要求把这场图灵奖讲座放在AAAI人工智能大会上进行,面向的是与他一同从贝叶斯网络时代走过来的同行。讲座题为《因果推断的机械化:一个小型图灵测试及其他》,从图灵1950年的论文谈起,经由《圣经》、胡克定律和哲学史,一路讲到do演算、反事实的算法化与可迁移性。本文依据现场录音编译整理。
主持人: 很高兴欢迎各位来听ACM图灵奖讲座。这个年度讲座由ACM图灵奖得主主讲。这个奖以伟大的英国数学家、计算机科学家艾伦·图灵命名,他是图灵测试的提出者。今年是他诞辰一百周年,我们一直在纪念他,两周前ACM在旧金山刚举办了一场规模很大的庆典。图灵奖常被称作计算机界的诺贝尔奖,是一位计算机科学家能获得的最高荣誉,奖金二十五万美元,由英特尔和谷歌慷慨提供。
今年的图灵奖得主,也就是今天上午的主讲人,是加州大学洛杉矶分校的计算机科学与统计学教授朱迪亚·珀尔。他获此殊荣,是因为他发展出了一套概率推理与因果推理的演算体系,从而对人工智能作出了奠基性的贡献。所以由他在这个会议上向这群听众演讲,再合适不过了。他是真正的先驱,同时推进了人工智能的科学和艺术。我用「艺术」这个词并不随意,读过珀尔教授著作的人都知道,他既是科学家,也同样是哲学家。今天讲座的题目是《因果推断的机械化:一个小型图灵测试及其他》。请允许我隆重介绍,朱迪亚·珀尔。
珀尔: 谢谢凯利,谢谢你这番美好的介绍。很高兴来到这里。我特意要求把这场图灵奖讲座放在这个会议上,因为我觉得有件事很重要:我不只是要和你们分享这个奖的荣耀,这份荣耀你们当然有份,早年这个游戏刚开始时你们就在我身边;我还想向你们汇报进展,讲讲自从我们上一次一起在沙坑里玩耍、一起搭那些城堡以来,这场冒险里发生了什么。
我也要向这个组织致敬。在我的工作还远谈不上时髦的年代,有人说它有争议,有人干脆说它是捣乱,是这个组织养育了它。我还要感谢你们所有人,感谢你们参与了我将要谈的这些东西的发展:同事、合著者、共同负责人、学生,还有审稿人。我不知道该不该感谢审稿人,不过现在是该感谢的时候了。我注意到,我最重要的三项工作都发表在AAAI的会议论文集里,所以我想从这里开始。我的第一张幻灯片说的就是,AAAI是我刚才提到的那些「捣乱」想法的温床。
第一件事发生在1982年。我相信你们大多数人都不记得匹兹堡那次船上的会议了,我关于树上信念传播(belief propagation)的第一篇论文就是在那里发表的。第二件,我注意到最早带有do演算(do-calculus)的论文之一,发表在1994年西雅图的AAAI会议上。那是我和阿德南·达尔维什(Adnan Darwiche)合写的论文,你们看,标题里就出现了do这个符号,而它没有被拒稿。我确信换了任何别的会议论文集,不管是统计学还是其他领域,它都不可能发表。第三件我想提的,是同一个会议,1994年的西雅图,我和巴尔克(Balke)合写的论文,题目是《反事实查询的概率评估》。
我选这三篇论文,是因为它们恰好对应着我们今天所说的因果推理三层阶梯的三个层级。这个阶梯已经非常牢固,三层几乎从不混淆,你光从句法上就能判断一句话属于哪一层:它是概率的,是因果的,还是反事实的。
珀尔: 不过这不是一场关于我个人工作的讲座,这是一场关于图灵的讲座。所以让我从图灵和他的图灵测试讲起。我们都读过他1950年发表在《心灵》杂志上的那篇论文,那个测试,我认为是人工智能领域许多工作的发动机。
对于「计算机能思考吗」这个问题,图灵的回答非常简单:能,只要它的行为像是在思考。所谓「行为」,是指它能回答关于某个故事、某个话题或某种情境的非平凡问题。我关心的是「非平凡」是什么意思。我没有选一个特定话题的故事,而是选了一种推理模态。今天在场的许多人都在各自领域做着某种小型图灵测试,而我认为因果推理这项工作的独特之处在于,它是按推理模态而不是按领域来划分任务的。
来看看图灵是怎样描述人和机器之间一段假想对话的。第一个问题是关于十四行诗,关于诗歌的。回答当然是回避的,但仍然带着人味:「这事别指望我,我从来不会写诗。」第二个问题是算术,问某个数加某个数等于多少。回答也很像人:停顿三十秒,然后给出答案。这也是个很简单的领域。然后图灵转向棋局:你会下棋吗?会。我的王在K1,没有别的棋子;你只有一个王在K6,一个车在R1。轮到你走,你走什么?机器当然回答了,停顿一下之后说:「将死。」
这就是图灵第一篇论文里举的三个问题:诗歌、算术和象棋,都是狭窄的领域,答案也都合理。但在那篇文章的第七节,图灵走得更远,他谈到了「儿童机器」,实际上就是在谈机器学习。他说,为什么要考虑成人的大脑?为什么不从儿童机器开始?那应该更容易,因为儿童不需要我们期望成人具备的那么多背景知识。他写道:「我们的希望在于,儿童大脑里的机制少到某种类似的东西可以很容易地被编程出来。」我认为图灵低估了视觉和运动行为在我们高级智能中扮演的角色。来自儿童世界的种种隐喻,在孩子处理数学的能力中起着巨大作用。所以我认为图灵低估了从儿童大脑起步的难度。
但接着他谈到机器学习,并且就机器学习与进化之间的关系提出了一个革命性的论断。他说,适者生存是一种衡量优势的缓慢方法。实验者,也就是程序员,运用智能,应该能够加快这个过程。怎么加快?在需要的地方制造人工突变。「如果他能追溯到某个弱点的原因,他大概就能想出一种能改善这个弱点的突变。」我认为这是一个伟大的远见。他的想法是,程序员能够把程序的弱点追溯到要害之处,然后制造突变。但这就引出一个问题:为什么机器不能拥有一份关于自身的蓝图,自己找出弱点的根源,然后在相互竞争的计算资源之间重新分配优先级呢?
珀尔: 现在我来解释,为什么我选择因果推理作为一个配得上「小型图灵测试」之名的领域。想象一间实验室,中间有一道隔板,就是那道著名的隔断,把提问者和机器分开。输入是一个关于某个熟悉领域的故事。问题只限于三类:是什么(what is)、假如怎样(what if)、为什么(why)。期望的回答形式是:「我相信结果会是如此这般。」
我用的故事在我1988年的书里用过很多次,后来在《因果论》(Causality)里也用过。故事是这样的:你走出家门,看见人行道也许是湿的也许是干的,也许滑也许不滑;你身处旱季或雨季;你猜想人行道如果湿了,要么是下过雨,要么是洒水器开过。一个非常简单的故事,五个二元变量,和你的日常经验紧密相连。任务是把这个故事讲给机器听,给机器编程,让它回答涉及三种模态的简单问题。
问题来了。第一问:如果现在是旱季,而人行道很滑,那么下过雨吗?你期望的回答是:不太可能,更可能是洒水器开过,还有很小的可能是人行道根本没湿,滑另有原因。这类回答的依据,是你把故事编进机器的方式,以及你把各种事件之间的相对可能性编进去的方式。这是一个关于预期、证据、观察以及由此推出什么最可能的例子。
第二问:可是假如我们看到洒水器是关的呢?你期望的回答是:那么更可能是下过雨。很合理,这就是「解释消除」(explaining away)。
接下来是关于行动的问题:你的意思是,如果我们真的把洒水器打开,下雨的可能性就会变小吗?你希望机器说:不,「看到」和「做」是有区别的。下雨的可能性保持不变,但人行道肯定会湿。
然后是反事实性质的问题:假设我们看到洒水器开着,人行道是湿的,那么如果洒水器当时是关的呢?我稍后会为自己对反事实的执念道歉。但先请你们替机器回答一下。我期望机器说的是:人行道会是干的,因为现在很可能是旱季。也就是说,你根据洒水器开着这个观察,推断出这多半是旱季;然后假设洒水器是关的,过去保持不变,改变的是未来。所以答案应该是:人行道是干的,因为季节很可能是旱季。
这就是我们在这个图灵式问题上期望的问答。
珀尔: 我们都记得塞尔(Searle)的「中文屋」论证。他说:不,光是回答这些问题,不等于机器在思考。想象一台机器靠一本规则手册回答中文问题,每一句英文或中文的句子,手册里都印好了中文或英文的答案。机器只是在书里查答案,这不能说明它理解中文。
塞尔忽略了一个事实:宇宙里的分子不够多,造不出这本书。你只要数一数可能的句子组合有多少,有人算过,宇宙里的分子都不够用。你可能会说,那又怎样?难道就因为存在组合上的困难,机器就在思考了?答案是:是的。因为当你面对这样一个难题时,克服它的唯一办法是利用约束,而理解约束正是我们所说的「理解」的含义。它是理解的必要成分。
就拿洒水器的例子来说。为了便于论证,假设有十个二元变量,你数一数,如果用塞尔的中文手册方法,需要多少表项。很快你就会得到一千个条目,这只是概率部分;乘上另一个一千,是每一种行动;再到反事实,又是一千。光是这个人行道的小故事,你就已经有了一张十亿行的表。正因为这些模态之间存在着大量约束,什么发生了、如果我做什么会怎样、如果我没做某件事或某个事件发生了会怎样,连孩子都能相当清楚地回答这些问题。问题是,他们是怎么做到的?
珀尔: 接下来我要解释,为什么我认为因果对话如此重要,为什么应该先在它上面做图灵测试。图灵测试可以有很多种。图灵从诗歌、算术和象棋开始。你可以想象有人为股票市场造一个图灵测试。我觉得这是最容易的一个,因为那里没有任何约束,也没有任何专门知识,跟诗歌很像。
我为什么要走向因果推理?第一,因为它在人类认知和人类伦理中无处不在,我有几张幻灯片专门讲这个,而且它深深扎根于儿童的发展。第二,我认为它是科学思维的基本构件。第三,它对机器人学很重要。还有第四条,这一条大概占去了我五年到十年的生命:周围有太多数据密集型的科学应用,能从任何关于因果推理的洞见中获益。我说过,有成千上万饥饿而茫然的顾客。他们的饥饿不是因为穷,他们资金充裕,所有制药公司都属于这个顾客群。他们饥饿是因为缺少思想,他们茫然是因为因果推理从未被形式化。我们在让机器人理解因果关系的过程中得到的任何一点优势、任何一点洞见,都能立刻转化为那些领域里节省数百万美元的方法。
珀尔: 让我从人类认知和伦理讲起。我喜欢从亚当和夏娃说起,不然还能从哪儿说起?你马上就能看到,当上帝问亚当「你吃了那棵树上的果子吗」,亚当不回答是或不是。事实是留给神的,借口是留给人的。他说:「是她把果子递给我,我就吃了。」夏娃在因果解释上当然也不逊色,她说:「别怪我,是蛇引诱了我,我就吃了。」把责任推给别人的需要,就这样深深扎根在人类认知里。
它也是我们正义感的基础。你们都记得,上帝告诉亚伯拉罕他要毁灭所多玛和蛾摩拉,亚伯拉罕说:「你要把义人和恶人一同剿灭吗?你不能这样做。」请原谅我的希伯来语,但三千年前那里说的就是这个意思。「假如城里有五十个义人呢?」这是《圣经》里的第一个反事实:假如有五十个义人。看上帝怎么说:「我若在所多玛城里见有五十个义人,我就为他们的缘故饶恕那全城。」你以为亚伯拉罕到此为止了吗?没有。他继续往下压:「那四十五个呢?你会为了五个人的差额大动干戈吗?」上帝说:「不,我不毁灭。」然后降到四十、三十、二十、十。接下来发生了什么,大家都知道。
问题是,亚伯拉罕在玩什么游戏?他怀疑上帝不会数数,或者分不清义人和恶人吗?不是。亚伯拉罕是第一位科学家。他想找出一般规则:集体惩罚的门槛在哪里。从这个意义上说,他是第一位科学家,因为科学是什么?科学就是寻找一般规则,而不是关心某一个具体事件。
珀尔: 现在我转向科学,向你们证明反事实确实是科学的基础。我们都做过这样的物理题:胡克定律告诉你,弹簧的长度y等于一个常数乘以重量,取常数为二,所以y等于2x;x等于一公斤,求弹簧的长度。你觉得这全是算术,对吧?解法就是解两个方程两个未知数。
问题来了:左边这个方程组和右边这个方程组等价吗?按照我的代数课本,两个方程组如果保持相同的解,就是等价的。这两个方程组解相同,可它们等价吗?你会说,当然不等价,因为左边的方程组能回答右边回答不了的问题。我再放一个第三种写法,稍后告诉你们为什么。左边的方程组能回答一个反事实问题:「假如x是三,y会是六。」翻译过来就是:如果我们把重量加到三公斤,弹簧长度会是多少?会是六。我们是怎么做的?把x等于一这个方程抹掉,换成x等于三,然后解这个被新信息修改过的新方程组,得到y等于六。
那为什么右边不能这样做?它们不是等价的吗?我抹掉x等于二分之一y,换成x等于三,得到y等于四。这是错的,对吧?所以每一个中学生在解物理题的时候,都在进行反事实推理。他们知道该抹掉哪个方程,保留哪个方程。他们保留的是表达一般规律的那个,抹掉的是边界条件,或者受反事实前件支配的那些。
如果是这样,那么我们之前看到的等号就不是真正的数学等号,它实际上是编程语言里赋值符号的一个方便替代品。想象一下,自然在决定弹簧长度之前,环顾四周,找所有可能影响长度的变量,看到重量,说:「啊,就是它。」然后查一查弹簧上的重量,据此决定长度的值。这就是物理学的图景:自然查看一些变量,经过某个过程,然后给另一些变量赋值。如果是这样,就需要一种不同的代数,因为它涉及抹掉方程。我们在图里用箭头而不是赋值符号来表示这一点。这就是结构图、因果图里箭头的含义:它描述的是自然的配方,自然的策略。
我现在说服你们了吧,物理学讲的全是反事实。我记得有人对我说:「你在开玩笑吧?不可能。」不管怎样,这就是我的经历。
珀尔: 反事实和因果在人类推理中的作用,很多哲学家早就注意到了,早到古希腊。公元前430年,德谟克利特说:「我宁愿发现一条因果关系,也不愿做波斯的国王。」那个年代,波斯国王可不像今天这样是个危险的职业。休谟当然带着困惑看待这件事,他说:因果这个概念到底是什么?我得把它解决掉。他得出的看法是,因果不是神的馈赠,而是我们从经验中学来的东西。这是那段著名的话:「我们记得曾看见过那种叫作火焰的对象,也记得曾感受过那种叫作热的感觉,不需要更多的仪式,我们就把前者叫作原因,把后者叫作结果。」所以是在自然中确定规律性这件事,让我们贴上了「原因」这个标签。这当然有困难。所有哲学家都在解释什么是原因这个问题上栽过跟头,这就让我们不得不问:我们人工智能领域的人凭什么胆量,觉得自己能在这场漫长的争论里再添上一分?
答案很简单:我们没有从容哲思的余裕。我们需要造出能理解实验室里或者厨房里出了什么问题的机器人。如果它们不能完全靠自己学会,我们至少需要有教它们的选项:通过指导,或者,如果我们理解环境里发生了什么,就坐下来花时间把我们知道的教给它们,让它们能恰当地行动,回答关于因果关系的查询。
这不是件小事。哲学家面对的谜题,现在翻译成了工程问题。「我们如何从环境中获取因果信息」这个问题,翻译成「机器人如何从环境中获取因果信息」。「人如何得出因果标签」这个问题,翻译成「机器人应当如何使用从它的创造者、它的程序员那里得到的因果信息,来理解并正确回答查询」。第二个问题看起来平凡,其实一点也不平凡,因为如果你只是照规则走,会得到意外的结果。假如输入是:「如果草地湿了,那么下过雨」,还有「如果你打碎这个瓶子,草地会湿」。你可不希望输出「如果你打碎瓶子,那么下过雨」。所以光靠规则链接是不行的,你需要更多的东西。那更多的东西是什么?
珀尔: 在讲那个之前,让我列一下今天要讲的内容。我要讲三层阶梯。问题分三层:「如果我看到什么」,这是概率和信念;「如果我做什么」;「如果我当初做得不一样」,这是反事实。你如果想给它们加上概率来修饰,说答案有多大可能成立,也可以,但那不是本质。本质就是:是什么,假如怎样,为什么。
然后我给你们一份实地报告,讲我们从贝叶斯网络的旧时代走到因果和反事实的这趟旅程。我们得理解这中间的区别,以及挡在我们路上的思维障碍。我们要讲什么使一个因果模型成其为因果模型,而不是别的东西;它是如何被检验的。这两者是相连的:如果一个模型有可检验的推论,你才有希望从数据中发现它;一个没有任何可检验推论的模型,是不可能从数据中学到的。然后我讲三个应用:干预的效应,do演算的演化,以及反事实的算法化。这三个任务在理论上都已相对彻底地解决。应用包括计划与政策的评估,中介分析,也就是区分直接原因与间接原因,还有泛化,就是可迁移性,埃利亚斯(Elias)今天下午会给你们讲。
珀尔: 这是正统统计学的范式,也是主导统计思维和机器学习的范式。它的想法是,幕后某处有一位圣诞老人,叫作联合概率分布。偶尔他或她开恩,吐出一些数据,我们的工作就是从数据中推断这位圣诞老人的性质,也就是Q(P),联合分布函数的某个方面:估计均值,或者造一个分类器,或者判断买了产品A的顾客是否也会买产品B。你可以说这类问题干净利落、形式化得很好,因为它能被整齐地封装在概率论的语言里。你甚至有一句简短的话:求给定A时B的概率,条件概率,两百五十年前贝叶斯牧师就有了。没有别的了,除了问题的复杂性。Q可以非常复杂,联合分布可以定义在非常多的变量上,连续的、二元的等等。所以不容易,但范式是一样的。
因果推理处理的是另一种范式。比如你问:买了A的顾客,如果我们把价格翻倍,还会买B吗?我们早上醒来,忽然心血来潮变得贪婪,想知道如果涨价会发生什么。我们问的是:给定A,并且给定我们做了某件事,也许是以前从没做过的事,把价格翻倍,B的概率是多少。这甚至不是P的一个方面,因为它不同于以价格翻倍为条件的条件概率。这就是「看到价格翻倍」和「让价格翻倍」的区别。再看反事实问题:「假如我们当初把价格翻倍呢?」这也不是圣诞老人P先生的方面或性质。
那它是什么?它是联合概率背后那个数据生成模型的性质。是的,联合概率吐出数据,我们拿到这些样本,需要推断某种性质,但不是P的性质,而是数据生成模型的性质。这就是我之前跟你们说的自然的不变策略,有时也叫机制、配方、法则、协议,或者反事实,自然通过它给分析中的变量赋值。对我们来说,这只是一个小技巧,需要一点想象力的跳跃,去想象自然,而不是实验或测量。但对统计学家来说,这是酷刑。对人工智能之外的人来说,这是一次创伤性的经历。所以如果你们以后跟外面的人谈这个,请记住这一点。
珀尔: 我们把它推广一下。想象整个世界就是一堆弹簧,由一堆函数驱动,这些函数给变量赋值。在这一万亿零一个变量里,每一个变量的值都是系统里其他变量的函数。有些变量是外生的,你不关心它们的解释,只关心它们的影响;有些是内生的。我们的工作是把这个编码进机器,让机器对我们的问题给出合理、可信的回答,比如「如果你看到洒水器开着会怎样」这类非常合理的问题。
这是那些领域里典型的方程,线性情形。为什么Y得到某个值?因为自然花了点时间,也许是一眨眼的工夫,看了看X,乘上一个常数,加上一点噪声,然后决定Y应该取小y这个值。干得好,自然女士。我们的工作是破译自然的这个映射。这很有野心,但至少如果我们有来自自然的数据,应该能回答反事实查询。
我们都熟悉电路图。它就是一个反事实的神谕,因为看着电路图,你能回答反事实问题:如果我把这个或门换成与门会怎样?如果我把这个Y接到三点五伏的电源上会怎样?尽管电路的设计者从未预料到这么疯狂的问题,从未预料到接到电源上这种疯狂的事件,但工程师瞄一眼电路,就有能力思考这个答案,而且答得对。
这一切从哪里来?来自这一堆函数的一些基本性质。最根本的那条,其他一切最终都由它导出:如果你运气好,你的方程是递归的,没有环,而且扰动项彼此独立,那么不管那里的函数是什么,不管扰动项的分布是什么,你都能对你观察到的东西的概率分布说出一些东西。这一堆弹簧的结构决定了你的分布函数里某种很基本的东西,那就是乘积形式,也就是条件独立性。
从这里引出下一个推论:你回答干预问题的能力。一旦有了这个乘积,如果有人问你「如果我采取某个行动会怎样」,你只需要取一个截断的乘积。这叫操纵定理(manipulation theorem)或者截断分解(truncated factorization)。它是同一个乘积形式,只不过从乘积中删掉那些被强制为常数的变量,因为它们不再听从它们的父节点了。
再看洒水器的例子。在你行动之前,你有按照这个菱形结构的分解,写下来就是那个乘积:每个变量以其父节点为条件的乘积,没什么特别的。但如果你采取行动,比如打开洒水器,你就把那个过程从讨论中删掉,因为洒水器先生不再听季节的话了。你一打开它,洒水器先生就沦为你肌肉的奴隶,所以它被替换成一个常数。
我看一下时间,还剩十二分钟。我要比预想的讲快一点。但你们听得这么专注,我实在不忍心让你们失望,我有那么多好故事想讲给你们听。这是一段美好的旅程,我得告诉你们。
珀尔: 好,我们现在有了一套关于行动的形式体系。它不是在人工智能领域萌芽的,它源自经济学家哈维尔莫(Haavelmo)1943年的工作。他的想法是,如何建模政府对经济的干预,比如固定价格或者征税。他有一个方程,政府做了某件事来保持价格恒定,于是在方程里加上另一股力量,去平衡其他力量,让价格保持不变。后来斯特罗茨(Strotz)和沃尔德(Wold)把它换成了「抹掉一个方程,换成一个常数」。再后来斯珀茨(Spirtes)和格利穆尔(Glymour)把它翻译成一个图上的手术过程:抹掉指向被操纵变量的所有箭头。这导向了截断分解。我很认真地对待这件事,说:不,我们这里有一种新的演算,它应该有代数上的支持。于是把它翻译成do演算,然后把它应用到反事实上。这就是这些思想的演化过程。现在我们还实现了与统计学里内曼(Neyman)和鲁宾(Rubin)阵营的统一,他们也是用反事实来处理因果。
珀尔: 反事实是怎么处理的?反事实的模型是什么?非常简单:你切割你的模型,以照顾反事实的前件,然后在被切割过的模型里解方程。没有别的了,简单得让人不好意思。我在这里只是把我刚才用英语说的那句话用符号表达出来。于是你就拥有了一套演算,因为你有了任意变量集合上联合反事实的语义。你能求出「假如X取小x则Y取小y,并且同时假如W取某值则Z取小z」的联合概率。你有了为任何这类句子求概率的语义,哪怕它多么曲折。这种句子很少出现在我们必须处理的句子里,具体来说,我们处理的是带do的、涉及行动的句子,以及涉及归因的句子:一个病人今天已经死了,而且他确实服了药,那么假如他当初没有服药,他今天还活着的可能性有多大?这是这门语言里的一个句子。语义就在那里,只要有模型就能计算。人人都会解方程,对吧?数学极其简单。
我的学生盖尔斯(Galles)给出了它的完整公理化。为什么需要公理化?为了当有人说他能用另一种方式做反事实的时候,我们能比较两套公理,然后说:不,它们在逻辑上等价。其中当作主力使用的是「复合公理」(composition),它说的是:如果你做了一件本来就会发生的事,那你什么也没做。这本质上是在说,我们的世界比任何其他可能世界都更接近我们自己的世界,如果你用可能世界的解释来看的话。
珀尔: 我举个例子说明你能用它做什么。你有一堆方程,你认为自然就是这样运作的。你首先要问自己的问题是:它可检验吗?它有没有任何可检验的推论?我之前说过,如果没有可检验的推论,你就无法学到它。这里的答案非常简单:我们在贝叶斯网络上做的一切,现在都翻译成因果贝叶斯网络。这种运算给你一个有限的可检验推论集合:只要看那些缺失的箭头,每一条都承诺了一个检验,如果检验不通过,模型就是错的。
它还能为你做什么?它能回答干预问题,它是干预的神谕。如果你有这样一个问题:求X对Y的平均因果效应,已知你能测量变量W1、Z1等等,能不能不做操纵、仅凭观察就求出来?答案是:能,只要你对年龄、族裔和另外几个变量做调整,那么你就一定能通过简单的调整、通过回归,无偏地回答这个查询。当然,这建立在图中编码的假设之上。图里每一条缺失的连线都是一个因果性质的假设,而不是统计性质的假设。
再举一个例子,这个难一些。假设我们希望估计平均因果效应,而我们只被允许做一次测量,应该测哪个变量?结果是,这一个就能替你做成这件事。懂前门准则(front-door criterion)的人知道,这就是前门准则。
再举一个应用性很强的例子。你在运动医学这一行,想知道热身是导致受伤还是预防受伤。这对我们的社会、我们的文化是个极其重要的问题,对吧?你可以测量的东西有:先前的伤病、球队的攻击性等等。测哪一个?每一个都要花很多钱去测。答案是自动给出的:你应当测这个,就没问题;你可以测这个;你不应当测那个,因为会有偏差;你应当测那个,没问题;这是另一种备选方案,等等。所以你可以按照成本和可靠性来挑选测量。
驱动这套回答机制的引擎是什么?还剩四分钟。四分钟能干什么,你们等着看。这个引擎就是三条规则。它接收一个图,反复应用这三条规则,然后给出答案。这是一个例子:吸烟导致癌症。问题带着一个因果符号交给你,红色的符号就是「如果我做」。我们做不了「做」,我们不能在吸烟者身上做随机实验,所以必须用分析的方法。我们把规则一条接一条地应用上去,把所有紫色符号去掉。如果我们把红色符号去掉了,就说明这个问题可以靠不动手的被动观察来回答。你能回答是或否,能回答吸烟在多大程度上导致癌症。
它还能做什么?我跳过这些:找出等价模型,识别反事实查询,中介分析,我肯定没时间讲了,找出效应的原因,解释,还有可迁移性,埃利亚斯今天下午四点会在海报前给你们讲。可迁移性就是把你从一个领域学到的东西,推广到另一个你无法做任何实验的领域。
珀尔: 反事实很有意思,因为哲学家们费尽心力想弄明白,我们为什么能对反事实形成共识。这是一个典型的例子:我给你这几句话,你会对第一句说「对对对」,对另一句说「不不不」。在我们的文化里,人们通常会形成共识。我们是怎么做到的?这对许多哲学家来说是个谜。休谟试图用反事实来解释原因,戴维·刘易斯(David Lewis)也试图这么做。我面对的困惑不一样:为什么他们不试着用原因来定义反事实,而是反过来?反事实显然问题更少,因为我们确实能在反事实上形成共识。既然连这两位哲学支柱都试图用反事实来定义原因,这就意味着我们脑子里有一台反事实引擎,迅速而可靠;我们能形成共识,是因为我们共享这台引擎的架构。所以这是一个人工智能问题,不是哲学问题。
刘易斯提出的是反事实的可能世界语义,它依赖于评估世界之间的相似程度:尼克松按下按钮之后的世界,与我们还活着的世界有多接近,相比之下,尼克松按下了按钮而有人把电线拔了的世界又有多接近。这是哲学里的典型问题,评估世界之间有多相似。而在我们这个结构里,你不依赖世界之间的相似性,你依赖方程,物理学里常见的那种方程,以及对这些方程的切割。
珀尔: 我没时间讲反事实的一大胜利了,那就是区分直接效应和间接效应的能力。这很重要,因为我们就是这样说话的:我们把人送进监狱,因为他对谋杀负有直接责任,或者只是间接责任。这在我们的社会里非常要紧。它还让我们能回答另一类干预的问题:这类干预是启用或禁用某些机制,而不是像我之前讲的那样固定变量。我跳过这部分。这在统计学和其他领域现在是个蓬勃发展的领域,叫作中介分析(mediation analysis),它的推动力就是反事实。我们能用反事实把间接效应的思想表达出来,就像你们在这里看到的。间接效应的定义是:保持输入不变,但把中介变量改变一个量,改变多少呢?改变到假如输入变了它本会取的值,此时输出的期望变化。这是一个嵌套的反事实,现在已经是间接效应公认的定义了。它不涉及固定变量。所以我把它算作一次胜利。
但我要转到下一个胜利,就在这里:可迁移性(transportability)。我说它是胜利,因为在这里do演算像从灰烬中重生一样出现了。我们没料到它会在这样一个与干预几乎无关的领域显示出威力。想象你想把从实验中学到的关系,迁移到另一个不做实验的环境里。可以想成在驾驶舱里训练一个机器人,然后把他或她搬到另一个只允许观察、不允许实验的环境。机器人在驾驶舱里获得的因果知识,有多少是可以迁移的?我们要的是一个逻辑上的回答,是或否:给定我们对两个环境的了解,某一条关系可以或者不可以迁移。令人惊讶的是,这个问题得到了完整的回答。埃利亚斯会讲完备性。完整的回答意味着你不可能做得更好,意味着所有做机器迁移的人,他们叫领域迁移,在我们的答案说「做不到」的那些情形里都会碰壁。他们可能不知道为什么,可能会惊讶于它不起作用。所以我们努力的方向是,在对两个环境的差异和共性作出某些假设的前提下,给出是或否的回答。
我想我快到结尾了,还剩五秒钟。这里是所有漂亮的例子,你们要错过了。最重要的是这一个:你给我一个图,在图上标出两个领域在哪里不同,或者怀疑在哪里不同,我告诉你某条关系可以还是不可以迁移。如果可以,绿色的部分告诉你在实验领域应当做的测量,蓝色的,或者说紫色的,告诉你在目标总体里应当做的测量,那里是不允许做实验的。然后这就是把它们组合起来、得到正确无偏结果的方式。完备性的讲解在四点钟。
时间到了。我还没讲我的新东西,元分析(meta-analysis),大数据在这里派上用场。想象你有来自美国或者全世界一千家医院的数据,每一家都在不同的条件下、不同的总体上采集,你需要把它们全部合起来,去回答另一个环境里的一个查询,那个环境不允许做任何测量,你只知道它的结构。能做到还是不能做到?是或否。如果能,怎么做?我在很多张幻灯片里讲了怎么做,现在只能跳过。请相信我,这里是有方法的。这里也还有大量工作要做:把关系分解成因果关系,从每一项研究中提取精华,提取共性,把它们合在一起,得出无偏估计。
珀尔: 结论是显而易见的。反事实是科学思想、自由意志和道德行为的基本构件。反事实的算法化已经让经验科学中的若干问题受益。第三条是,这让我们朝着实现机器人与人类之间的协作行为又近了一步。
从历史的角度,我在这里得扮一回智者。你们知道,人们公认西方科学有两大进步:一是希腊人发展出逻辑,二是伽利略认识到可以通过实验找出因果关系。我要给你们提供第三个。不,我不是提供第三个,我是顺着这两步走,试着把两者结合起来:希腊人的逻辑加上伽利略的实验,得出逻辑上严密的因果理论。最后一张幻灯片说的是:我告诉过你们这很简单。我们的使命大体已经完成,但还有更多要做。谢谢大家。
主持人: 谢谢您,珀尔教授。感谢您提醒我们,科学不仅是从哲学中诞生的,而且哲学与科学至今仍然彼此高度相关。作为一个小小的、但与您的讲座颇为相称的纪念,大会想把这件礼物赠送给您。再次感谢。
Judea Pearl 在 2012 年图灵奖演讲中提出"迷你图灵测试":让机器就一个小故事回答"看到什么、做了什么、假如当初不同会怎样"三层问题,并用结构因果模型、do 演算和反事实的形式化,证明因果推理已从哲学难题变成可算法化的工程问题。

微信公众号