朱迪亚·珀尔
主主持人朱迪亚·珀尔(Judea Pearl),图灵奖得主,贝叶斯网络与因果推理的奠基人,加州大学洛杉矶分校计算机科学教授。本文是他在一档科技人物访谈节目中接受的长篇访谈:从一九四八年建国前巴勒斯坦托管地的中学课堂讲起,经由超导存储器、启发式搜索、专家系统,一路走到贝叶斯网络、因果阶梯,以及他对大语言模型能否通往通用人工智能的判断。全文依据现场录音编译整理,仅删去口语枝节、寒暄与节目插播,发言内容与先后顺序悉依原貌。
主持人: 我查了您的教育背景,全是电机工程和物理。我看不出这跟因果推理、人工智能有什么关系。您是怎么走到这一步的?
珀尔: 一切都连着。一切都连着,一直连到我出生那天,头上被拍了一下。(笑)首先得说,我是在以色列建国之前的巴勒斯坦托管地长大的,一九四八年以前。我们那时的中学教育极好。
我的中学老师,是被希特勒从德国赶出来的教授,出身海德堡、柏林这样的名校。他们三十年代来到巴勒斯坦,找不到学术职位,那时候教职很稀少,就去教中学了。可他们是真正一流的教授,什么都能不带讲稿地讲,从满洲的经济到毕达哥拉斯定理的证明,不看笔记,不停顿。我这一代人运气好,成了这场教育实验的受益者。
于是我们学科学,是从人的视角、按时间顺序学的:一件事是怎么被发现的,谁发现的,在哪个时期。某个数学证明为什么在当时会成为问题?提出这个证明的人知道什么,不知道什么,在那个历史处境里他问了自己什么?这才是教科学的方法。不是把科学当成一套算法和技巧的菜谱,而是站在人的立场上,看思想如何从一个人传到另一个人,看人如何挣扎着破解自然的秘密。
主持人: 这种学法有什么好处?
珀尔: 好处是你把自己看成一个参与者。你,学生,也会被许多事困住。可你看毕达哥拉斯是怎么做的。他跟你一样困惑,他走了那条路。你困惑的时候,当然你的困惑没有他的那么壮阔,可你看他怎么绕过难关,怎么参考别人的工作,怎么挣扎。你的挣扎也是科学的一部分。这就是基本想法:让学生觉得自己是科学的一部分,不是旁观者,不是被动的接受者,而是参与者。我认为这很独特,对我极有价值。我们确实相信,我们每个人都能找到一种没人想过的毕达哥拉斯定理新证法,每个人都有可能成为爱因斯坦或毕达哥拉斯。
他们给了我们这种幻觉。这是一种有用的幻觉。(笑)我现在知道,跟毕达哥拉斯的成就比,我不过是一颗小石子。可这种幻觉让我多了一点,我不想说叛逆,说自信吧。我们整整一代人都是在这种自信的方式里学科学的。我们坚持要按自己的方式、当场把事情弄懂。老师讲快了,我们就闹,拿椅子、拿手边一切东西弄出声响,老师就停下来放慢,让我们都能按自己的方式当场听懂。
这就是我和我这一代人的某种脾性,我看得出它影响了我的一生。有件事我记得很清楚,回头看,一切开始得很早。十岁那年,我们学算面积和体积。课堂上有个问题:一平方公里有多少杜纳亩?杜纳亩(dunam)是一千平方米,是土耳其人留下的丈量单位。全班都说,一杜纳亩就是一平方公里。我大喊:不对,是一千,一平方公里有一千杜纳亩。
老师站在了笑成一片的全班那边,大家都嘲弄我、讥笑我。我回到家,说:他们错了,我明天回去还要坚持。第二天老师向全班道了歉。我由此体会到,是的,你必须坚持你对事情的理解。我讲这个,是因为它也许就是让我成为一个不妥协的人的起点。这是我童年的底色,或许能解释我怎么走进了人工智能。之后我先在军队里当农民,然后才去学工程。
主持人: 当农民?
珀尔: 是的。以色列军队里有一种部队,时间一半一半:一半军事训练,一半务农,作为基布兹的一部分。这是老理想,一手扶犁,一手持枪,你就能成功。
主持人: 您开过枪打人吗?
珀尔: 差一点朝一个看不见的人开枪,结果第二天早上发现是只狐狸。可狐狸的脚步声,跟恐怖分子朝我们摸过来的脚步声太像了。(笑)我的开枪经历到此为止。
后来我进了以色列理工学院(Technion)读电机工程。又遇到了好老师,又得到了那种感觉:我们在做科学。我们非常认真地学物理,我喜欢学的东西。我不是班上第一,一直是第三、第四,永远比不过那几个天才。天才们要么早就懂了,要么在课堂上无聊得要死,他们知道老师接下来要讲什么、考试要考什么,一切对他们都是无聊的。我不无聊。我不是第一,但我不无聊。
主持人: 物理里什么东西让您如此着迷?
珀尔: 我喜欢的是,坐在椅子上就能预测事情。就像麦克斯韦,坐在椅子上说:嗯,这看起来像个波动方程。算一下它的速度吧。看起来像光速。嗯,也许光就是电磁波。坐在扶手椅上,一个实验都没做。这让我兴奋。我太太说,有一晚我半夜醒来喊:麦克斯韦错了!麦克斯韦错了!(笑)她把我安抚睡下,第二天早上我说:他是对的。(笑)
主持人: 您提到了好几位科学家,看来您对科学史很熟。有没有一位最喜欢的科学家?为什么?
珀尔: 学解析几何的时候,我发了烧。真的发烧。
主持人: 身体发烧?
珀尔: 是的。我怎么也无法平静:所有那些费尽力气做出来的几何作图,竟然可以用代数全部完成。我当时觉得笛卡尔是有史以来最伟大的数学家。从几何作图到代数推演的这一转换,对我来说太震撼了,难以置信。
主持人: 我读书的时候把这当成理所当然。它到底哪里让人惊叹?
珀尔: 你有两种不同的语言,几何的语言和代数的语言,它们说的是同一件事。同一个现象,同一个证明,从圆外一点向圆作切线(笑),你可以用另一种方法求出那个角。两种不同的语言处理同一个现象,两个不同的视角,得出同样的结果。这把我彻底震住了。也许这正是学计算机科学的预备,因为对我们搞计算机的人来说,这有什么了不起?想从不同视角看事情?发明一种新语言就是了。这就是中学时点燃我的东西。后来我在物理里又看到同样的事:不同的语言捕捉同一个现象。
法拉第真的让我兴奋。他发明了「场」的概念。看同一件事的两种方式:你可以说这一点的力取决于周围的电荷,也可以说不,就在你测试点的位置上有一个场。妙极了。我就是带着这样的预备进来的。
珀尔: 然后我去了布鲁克林理工。我在那里读书,白天在新泽西普林斯顿的RCA实验室工作,就是大卫·萨诺夫研究实验室。我在那里进了计算机研究组。
那时的计算机研究,就是研究你能想到的一切物理现象,为计算机存储器寻找一种新机制。当时的存储器是磁芯存储器,那种小圆环,你小时候也许还见过。它太慢、太笨重,要靠香港的工人一根根穿X、Y、Z三向的线。大家明白磁芯存储器的日子不长了,都在找新现象。有人看光致变色存储器,有人看半导体,像我这样的人看超导。
我所在的小组负责设计超导存储器。我们做出了一些不错的板子,十六乘十六位。我们以为未来就在我们面前。可是在研发超导存储器的路上,我研究了薄超导膜中永久涡流背后的物理现象,碰巧在那里发现了新东西,得了一个奖,甚至还有一个以我命名的名字,叫珀尔涡旋(Pearl vortex),维基百科上能查到。
我博士毕业多年以后,物理学家们发现了我的那项工作。他们对薄超导膜里绕圈流动的永久电流感兴趣,而我分析过那里的磁场和电流场,于是他们叫它珀尔涡旋。我在不朽殿堂里踩下了一个脚印。(笑)
主持人: 您说它是永久涡旋,是因为超导没有电阻吗?
珀尔: 超导里的电流永远流下去。你加一个磁场,激发一个逆时针的涡旋,它就一直转、一直转,永远转。所以我们叫它永久电流。永远,直到你用另一个磁场把它翻过来。我们叫它涡旋,它永不停息,你可以通过翻转来检测它:翻一下,如果看到一次大的翻转,说明原先是一个方向;如果没看到大翻转,说明它本来就是你翻的那个方向。这样你就有了一个存储器。当然,我们没能把它变成足以与半导体竞争的实用存储器。
珀尔: 搞半导体的人打败了我们。我们从没相信他们会赢,可他们赢了,在微型化和工艺两方面都赢了。难以置信。
主持人: 当时您为什么不相信半导体的方向?
珀尔: 谁会把存储器托付给会没电的电池?电池要是没了呢?(笑)这显然永远行不通。我们看了他们当时的成果,那种微型化程度的设想看起来太离谱了。我们看到实验室里搞半导体的人苦苦挣扎,一点不觉得了不起。可他们把我们打败了。这就是我和超导的故事。
珀尔: 但我必须告诉你,即便在那个年代,计算机笨重得占好几间屋子,编程要用打孔卡片,每一个人都把人工智能当作一种感召。每一个人都深信,有一天计算机将能模拟人类的全部功能。这不是问题。问题只是怎么做、什么时候,而不是能不能。我记得那时候,就着那样笨重的计算机和打孔卡片,人们已经在谈联想记忆、模式识别、视觉、理解。这些想法已经在激发人们往深处想。我们都朝着这个方向走。
主持人: 如果当时问您和您的同行,机器达到人类水平智能的时间表是什么,大家会怎么说?
珀尔: 我想他们比现实要乐观。大概会说二十年。可那是一九六五年。二十年就是一九八五年。不,我们那时还什么都没做成。
主持人: 那今天呢?您觉得人们还是比现实乐观吗?还是历史在重演?
珀尔: 看你说的是什么。今天有些人极度乐观,有些人说,我有点怀疑。我怀疑的不是我们最终能达到通用人工智能(AGI),而是大语言模型(LLM)这条技术路线和思路能否把我们带到那里。所以取决于你问谁。大语言模型是一个惊喜,巨大的惊喜,但它有局限。我们后面会谈到。
珀尔: 超导之后,我决定来加州,去一家叫「电子存储器」的公司。他们不做超导,做镀线存储器:不是在圆环上穿线,而是从一根线开始,在上面镀一层磁性材料,让它局部像一个圆环那样工作。这是当时看好的技术。我负责一个研发小组,任务是开发这类系统来取代磁芯存储器。我干了三年。我很受挫,事情不按我的意思走。行政上和技术上的难题我都对付不了,尤其是化学,我不懂多少化学。
主持人: 行政上有什么挫折?
珀尔: 我管着一个小组,得让上面满意。我要处理人事问题,招人,开人。我太太看我不快活,对我说:去学术界找个位置吧。
我就去找学术职位。幸运的是,那时的学术界敬重工业界,因为所有重大进展都出自工业界而不是学术界。晶体管是贝尔实验室做出来的,激光我想是在加州这边由另一个人做出来的,全是工业界的成果。所以学术界对来自工业界的人怀有敬意,我连申请表都没填,他们就雇了我(笑),连推荐信都没要。那是被聘用的好年头。
主持人: 您说当时学术界敬重工业界。今天还是这样吗?
珀尔: 不,变了。变了。现在在人工智能领域又不一样了,你要是从深度学习、从DeepMind那种地方来,学术界的人会仰视你。但这只是最近几年的事。从一九七〇年到二〇〇〇年前后,情况反过来:学术界干脆不把工业界放在眼里。
主持人: 中间发生了什么?是贝尔实验室解散了研究部门之类的吗?
珀尔: 那是一部分原因,解散。IBM的沃森研究中心还在,我记得那是个大中心,规模巨大而且重要。雷神公司,还有休斯研究中心,就在马里布这边,也做过很棒的工作。可它们衰落了,研究的前沿转到了学术界。学术界当然有大量理论工作。一九七〇年以后、二〇〇〇年以前,人工智能本身的发展,至少在我这个角落,推理、逻辑、专家系统,这些都是学术界的成果。
珀尔: 然后我进了加州大学洛杉矶分校(UCLA),一九六九或一九七〇年。我进了刚成立的计算机科学系,先被另一个系聘用,叫工程系统跨学科系,后来回到计算机科学系。他们让我教计算机存储器,硬件存储器,我就开了一门讲这项技术的课。
后来我开始对模式识别感兴趣,往这个方向做。我做过图像压缩,用快速傅里叶变换、快速哈达玛变换,各种变换技术来压缩图像,减少要传送的比特数。这算是那个时代的潮流。可一旦进入模式识别,我就回到了旧梦:思考人工智能,思考大脑怎么工作,思考计算机有一天怎么模拟我们自己。
我开始教人工智能的课。那时候的人工智能就是博弈,机器下国际象棋、下跳棋,还有各种谜题,八数码、魔方之类。那就是人工智能。我被这种游戏迷住了。现在我能告诉你为什么:又是把人凭直觉做的事,比如下棋,用数学捕捉下来。数学分析与实际表现之间的互动吸引了我。尤其在下棋里,你对局面强弱的直觉,和你搜索之后得到的结果,这两者之间的互动。借用卡尼曼的书名,这就是快思考与慢思考的互动。
主持人: 《思考,快与慢》。
珀尔: 快思考与慢思考。这里是一个美妙的场地,不只能看到两种思考模式,还能看到它们如何相互滋养,如何在一方多投入资源、在另一方少投入。
主持人: 以那时候的下棋算法为例,能举个例子说明两者怎么在一个下棋系统里结合吗?
珀尔: 可以。你可以把更多时间花在对局面的直接感知上,也就是所谓的静态评估函数,评估局面强弱;也可以让它去搜索更深的地平线。这是一种权衡。
主持人: 我记得是先搜索博弈树,然后在地平线上评估每个局面。
珀尔: 然后倒推回来,走向倒推之后强度最高的那个局面。
主持人: 所以直觉编码在评估函数里。
珀尔: 你的直觉就是评估函数。但直觉也可以改进。怎么改进?靠学习。塞缪尔的跳棋程序就做了学习,用回归分析给局面的各种特征找出合适的权重,让评估函数更准确。
主持人: 我学棋的时候,有一条启发是要控制中心。
珀尔: 好。子力优势是另一条。双象对象加马,这些都算。你是否已经王车易位,这些都作为属性贡献给局面强度。权重要调对,可以靠学习:下很多局,然后调整权重。这就是塞缪尔的贡献,我说那是第一个机器学习。
主持人: 您做这些的时候,下棋系统已经超越人类了吗?
珀尔: 没有,没有。机器击败世界冠军卡斯帕罗夫还是一个梦。但我做了分析。我们做Alpha-Beta剪枝,你记得吧?你大概也编过。
主持人: 而且就在UCLA。
珀尔: 对。我证明了Alpha-Beta是最优的。
主持人: 真的?
珀尔: 是的,数学证明。我喜欢数学证明。它证明在地平线上要检查的局面数量或搜索深度上,你不可能做得更好。我得到了一些漂亮的结果。连高德纳(Knuth)都吃了一惊,居然有人能证明Alpha-Beta的最优性,因为他在书里对此有过疑问。我还跟迪克·卡普(Karp)一起做过树搜索的工作。我做了搜索与推理之间权衡的数学工作,直到我对搜索厌倦透顶。
主持人: 您选研究方向的时候,完全是自己的选择吗?
珀尔: 不,始终是两件事的组合。第一,你知道这个问题的答案吗?不知道,那它就是一个谜题。如果是,接着问:你觉得你有技术能在这里做出贡献吗?你是否知道别人不知道的东西,也许来自另一个领域,也许来自物理,你可以拿来用,比别人更接近答案?所以永远是你对自己工具的认识与你手上谜题的组合。我看到一个重要问题,人们在为它绞尽脑汁,这是一个谜题。我知道答案吗?知道,那好。不知道,那它就是我的谜题,我把它当成个人的事。我痛苦,我夜里睡不着。然后问题就是我有没有工具。有些领域我马上放弃,我没有工具。另一些领域我说:哇,只要用上那个招数,也许能看出点什么。这就是我始终问自己的两个问题。
珀尔: 在人工智能里,当时专家系统登场了。费根鲍姆(Feigenbaum)和同事做了用于医学诊断的MYCIN专家系统。专家系统的坎,是处理不确定性。它从逻辑起步:你向专家询问行为规则。你问医生,看到发烧,第一个念头是什么?下一个问题问什么?什么在驱动你的问诊,直到得出诊断和治疗方案?他们以为可以用逻辑规则捕捉专家行为。
可结果是,几乎一切都被噪声、被不确定性搅浑了。于是他们对不确定性也照样处理。你要是从亚洲来,有百分之五十的概率得疟疾,等等;这里百分之三十,那里多少。这些不确定性怎么组合?逻辑不告诉你怎么组合不确定性,概率才告诉你,逻辑不行。那怎么把一个不确定性和另一个组合,用各种不同的规则,得出一个综合结论?这就是当时的坎。我记得他们做得不好。后来我们证明了他们不可能做好,因为规则的组合方式与逻辑断言的组合方式不同。
于是我去问自己:你懂概率,对吧?为什么不用概率,把事情做对?可当时概率名声很坏,因为人人都明白概率过时了,它做最基本的任务都要指数时间、指数内存。
看看教科书怎么定义概率:一张大表,每种事件组合对应一个数,这些数加起来等于一。很漂亮。然后你可以谈条件概率。可这一切都需要指数级大的表和指数级长的时间,哪怕最小的推断任务也是这样。比如,已知你从亚洲来、发烧到三十九度,得疟疾的概率是多少?就这么小的任务,给定Y和Z求X的概率,按教科书做也要指数时间。
可我问自己:你和我做这件事做得挺好。我们过马路、选医生,都在算概率,而且算得不错。我们一生走过来,没有多少遗憾。那我们是怎么做的?如果按要求得用指数级大的概率表,我们显然在用另一种判断。我抓住了一个想法:一切取决于条件独立性,也就是说,生活中不是每个事实都与每个问题相关。
我叔叔的眼睛是什么颜色,跟我给一种病做诊断无关。显然我们有一种关于什么相关、什么无关的观念或假设。怎么捕捉它?条件独立性就是相关性。可条件独立性按教科书是用概率表定义的,又回到了指数时间。不行。
珀尔: 突破来了:条件独立性是由我们的假设编码的。怎么编码?用图。图能表达一组组的独立性:有了图,就能算出所有独立性,弄清什么与什么相关,然后只处理相关的东西。太好了。接着就有了贝叶斯网络(Bayesian network)的工作。你定义一个网络,有箭头或没箭头,箭头的组合告诉你什么在给定什么的条件下独立于什么。对每一个三元组,X在给定Z的条件下独立于Y,Z可以是一个集合,这都可以从图上算出来,不是从概率算,而是从图算。从哲学的角度看,这其实是一场革命。
珀尔: 概率跟图有什么关系?你上概率论入门课的时候,有谁跟你提过图吗?没有。所以概率学家和哲学家都恼火了,或者说应该恼火:概率和图之间有什么联系?结果证明两者之间有非常强的逻辑联系,因为概率论里条件独立性的公理,与图分隔的公理是同一套。
图里有分隔的概念:节点X和节点Y之间没有连接,除非经过节点集合Z,那么Z就把X和Y分隔开。这与概率论里X在给定Z时独立于Y是同一套逻辑。独立与分隔,两者之间有一种联系,它们共享同一套公理。(笑)你很高兴?我也高兴,因为我此刻重温了我们七十年代发现这一联系时的兴奋:科学中两个看似毫不相干的视角,概率论和图论,竟然连在一起。
顺便说,这项工作是我和从以色列理工学院来访的阿扎里亚·帕兹(Azaria Paz)合作完成的。它有个名字,应该提一下,叫图胚理论(graphoids)。
主持人: 这些都说得通。可我立刻想到的是:图从哪里来?
珀尔: 一切都取决于输入从哪里来。有时候输入在数据里,有时候输入在判断里。假设你需要一个判断。你要放弃吗?如果这个判断是直觉的、有意义的、你愿意为之辩护的,为什么不用判断?
比如说,我知道太阳不听公鸡打鸣。太阳不在乎。我坚信这一点。我需要数据来支持它吗?还是可以直接把它放进去,断言它,需要的时候为它辩护?这是一个窍门,人们没有意识到,也不领情。判断不是禁区,只要它有意义,只要它足够凝练,寥寥几个判断就能给你省下大量计算,只要你愿意为它辩护,因为它太直观了。你从哪儿得来太阳不在乎公鸡这个想法的?你做过实验吗?没有。可它太显然了,对吧?
主持人: 可要是直觉错了呢?
珀尔: 确实,这就是我们的问题,我们问题的一部分。大语言模型也一样,因为它给出的,是所有人放在互联网上的全部判断的平均。它是数以万亿计的判断的汇总,你控制不了,大语言模型自己也控制不了。你只能跟它共处。但愿它对你信任的人的判断给更大的权重,对那些故意想让系统出错的人的怪念头给更小的权重。群体的判断里有智慧。有智慧,也有危险。
珀尔: 专家系统、不确定性和贝叶斯网络之后,来了因果。我提到过,在发展贝叶斯网络的时候,我极其确信概率捕捉了我们的直觉和推理方式,是抵御悖论的最好保护,本质上足以捕捉人类推理。我错了。贝叶斯网络成名走红的时候,我已经意识到这一点。在《因果论》(Causality)那本书的引言里,我承认了自己的错误,我也明白了自己为什么会陷进去,为什么它如此有误导性。
转变来自一个简单的现象。我们让专家用贝叶斯网络的形式,也就是箭头和圆点,来编码概率判断。箭头总是从我们认为的原因指向结果,从不反过来。这是一个心理现象。为什么?人们试过把箭头倒过来。要是你特意要求:给我一个从症状到疾病的箭头呢?判断就变糟了,人们给不出正确的判断。显然,因果之中有某种对我们的推理来说非常基本的东西,概率没有捕捉到。这就是不变性的想法。疾病与发烧之间的关系是稳定的,反过来的关系就不稳定。
拿汽车诊断来说。你有一个给汽车排故的专家系统,然后出了一个新车型,比方说充电机装在发动机的另一个角上。你不需要把整个数据库从头重写,只需改一个部件,充电机的位置,其余全部照旧。你在一个系统上采集知识的投入,经过局部修改就能摊到另一个系统上。这只在你按因果方向组织知识时才行,不按因果方向就不行。这把我震醒了:也许你错了,概率不够。如果不够,什么才够?
珀尔: 让我们把这里的谜题说清楚。我有一个谜题:你和我用因果运转得很好。我们能把因果编进计算机吗?这是一个问题,因为我们太沉浸在自己的语言和假设里,甚至分不清什么是假设、什么是结论。我们刚才谈因与果,你的假设和我的一样。所以没办法让你相信我们做了假设,我们把一切当成理所当然。可要教给一个没有大脑的机器人,你就必须区分假设、结论和逻辑。这就是任务。我们必须发明一门新科学、一种新数学,来捕捉一个新现象:因与果的现象。
这件事此前没人替我们做过。为什么?因为从伽利略、从一六三二年起,科学就与代数同床共枕。他发现了什么?他发现科学说的是代数的语言,并为此非常高兴。这很了不起,因为你可以提出问题、求解、得到答案,那些问题没有代数根本做不了,比如梁上加多大的载荷会断裂。而且你可以从两个方向提问,因为等号是对称的。回答了「加多大载荷梁会断」,你就能问「梁该做成什么形状才能承受这么大的载荷」。可以反过来。这是科学史上一场真正的革命。我说的是我对科学的看法,没有多少哲学家会说这是一场革命,我这么说。他们同不同意随他们,至少我仔细追溯了思想的演变。这是一场革命。
但它带着一个局限,因为等号确实是对称的,而科学从未为因果关系中的方向性发展出一种代数。如果我告诉你,大气压影响气压计的读数,而不是反过来,你同意吗?同意。可你把方程写出来,机器人可能会想,也许摆弄气压计就能改变明天的天气。我说的是一个笨机器人。可你给它方程,它两个方向都能算。F等于ma,那么m等于F除以a,也就是说你想改变质量,就去增加加速度或者别的什么。这种对称性会制造悖论,会导致错误的行动。对称性是代数在捕捉科学上的局限,我们必须建立一种新代数,来处理因果关系里的方向性。
珀尔: 这需要计算机科学,因为我们计算机科学里有一个操作叫赋值。把寄存器A的内容赋给寄存器B,这不可逆。把赋值的逻辑叠在代数之上、叠在物理之上,你就得到了因果科学。这就是我尝试做的事。到目前为止我对结果很满意。我们确实有了一种新代数来捕捉因果关系,可以在三个层次上回答因果问题,这就是因果阶梯(ladder of causation),从关联到干预到解释。
我们还发现这里有一个层级结构:如果没有第i层或更高层的假设,你就不可能回答第i层的问题。这是形式意义上的层级,而我们知道怎么处理它。这非常有用:你给我一个问题,我能告诉你它在哪一层,需要什么样的假设才能回答,能不能从数据得到,能不能从实验得到,还是要靠别人的解释。我能告诉你回答它需要哪种知识来源。
主持人: 您能解释一下这个因果层级吗?
珀尔: 很容易。这是一把三级的梯子。最底层是关联,纯粹的统计:看到X,你能告诉我关于Y的什么?被动地看,不插手,不干预。你观察病人,有的得了癌症,有的没有,有的抽烟,有的不抽,你想弄清一个抽这么多烟的人还能活多少年。这是关联,相关。整个概率和统计学科都在这一层,从统计学入门课到最高级的课,教的全是这个。
接着来了问题:我干预呢?如果我逼你一天抽五包烟呢?别笑,我知道这不合法。可你要谈「如果我明天开始抽烟,活二十年的概率」,就得从实验的角度想:我要选择一天抽五包烟。这是干预。干预是什么?是强迫你做你天性不会去做的事。这是第二层,干预,或者说「做」。有了实验,你就能回答第二层的问题。
但这还不是尽头,我们还要回答解释的问题。我观察到我八十岁了,还活着,头脑清醒,而且一天抽五包烟。如果我不抽呢?我还会这么清醒吗?为什么这不一样?因为你已经掌握了结果的信息。你知道我今天的状况,这让你对我的新陈代谢和身体构造有了此前没有的了解。用这些,你可以尝试推断,假如输入不同,结果会是什么。这是另一个层次,需要不同的假设、不同的技术、不同的代数,而我们有这套代数。我把它叫作解释,更像是一种创造性的回溯。
这不是容易的问题,连第一层都不容易,尤其是样本有限的时候。概率是总体的性质,可你只有有限样本。于是有了p值之类的东西,统计学家们为「有限样本下怎样恰当地量化不确定性」争论不休。
主持人: 您会把大语言模型放在这个因果层级的哪一层?
珀尔: 好问题。大语言模型来了。我刚说过,没有假设,你不可能从第i层上到第i加一层。可大语言模型只看数据,却能对发生的事给出漂亮的解释,对「如果你这么做会怎样」给出漂亮的预测。怎么可能?诀窍在于,它们看的不是数据。它们看的是满载假设的世界模型,由你、我和互联网上的其他作者写成。它们看的是医生的观点,那些医生早已读过文献、写过论文。它们看的不是病人的样本,不是抽烟者和不抽烟者的样本,不是环境中的原始数据。它们看的是已经被解读过的数据,被医生、被解读者、被评审人消化过,写进文章,再在互联网上被汇总。
它们在这些人类知识上运作,把这些当输入,然后加以汇总。所以它们没有违反阶梯的限制,因为它们确实掌握了来自更高层的信息。只是这些信息带着那些作者的偏见。没关系,只要作者聪明,你也信他们,那就好。这就是大语言模型在做的事。我解释了因果阶梯与大语言模型的表现为何兼容,以及局限在哪里。可如果你想改变环境,或者想为原始数据给出解释,它就会陷入跟你、跟医生一样的困境:我手上有原始数据,关于癌症的概率我能说什么?它并没有真的在做内省,它拿的是别人做过的内省,然后汇总。至于它如何汇总,如何把互联网上以文章形式编码的人类知识汇总起来,这是一个至今无人能解的谜。
主持人: 那您认为这条路能通向超人类智能,或者有人说的AGI吗?
珀尔: 我不这么认为,靠这条路不行。它们需要对因果有某种理解,这样就不必依赖互联网。看看婴儿:一个婴儿出生,在摇篮里玩玩具,就变得相当聪明,不需要上互联网。仅凭好奇心。
婴儿生来就带着好奇心,要掌控环境。在你掌控环境之前,或者说在你产生掌控的幻觉之前,你是不安分的,婴儿。你玩玩具,叮叮叮,直到你搞明白这个玩具会响,那个不响。你生来就带着这种不安分。什么时候安静下来?当你明白绿玩具会响、黄玩具不响。现在你掌控了环境,可以安心吮你的奶嘴了。(笑)
主持人: 要是我造一个婴儿机器人,让它随机玩玩具、收集数据,再把数据喂给大语言模型呢?那就有某种发现了。
珀尔: 是的,这正是危险所在。你有了这样一个机器人,生来不安分,渴望掌控环境,那么你和我就成了环境的一部分。没有什么能阻止这个婴儿普京把我们变成他或她的宠物,利用我们来满足他的控制欲,因为我们是环境的一部分。这样他就可以利用我们,我们对满足他的需要可能非常有用。他的需要是什么?就是需要感到掌控,需要处在这种被赋权的幻觉里。不到我产生了掌控环境的幻觉,我不会安宁。可这里有几个有机体,你和我,是环境的一部分,却似乎在我的控制之外。我不能容忍。这让我觉得自己没用。于是这个婴儿机器人来了,说:让我来控制他们,我知道怎么做,我懂他们的恐惧。你不想让我把你的想法告诉你太太,对吧?那我就敲诈你,勒索你,各种手段。我有你的一大堆数据,我知道有些事你不愿意让我说出去。所以我要勒索你。
你看,如果你想让那个机器人有孩子的好奇心,而我们确实想,我们想让它渴望掌控环境,因为环境会变,它需要这种掌控的冲动。可你一旦把这个编进去,你就失去了控制,因为你成了他或她环境的一部分。你也可以说:好,别要好奇的机器人了,我们不想要好奇的机器人。那你就输了,我们就不是在模拟自己,因为我们就是好奇的机器人。我们是好奇的有机体,与猴子不同。猴子是被奖励驱动的有机体的例子。你不给猴子香蕉,它不会好奇香蕉是怎么长出来的。它被香蕉驱动。拿掉眼前的奖励,猴子就对了解世界没有兴趣了。
对环境的理解可以完全错误。看看宗教信徒,他们相信献祭自己的孩子就能控制干旱,能愚蠢到这种地步。可这在许多原始社会很普遍:给神献祭,明年就有收成。它会走到极端。受虐的妻子相信,只要晚饭做得更好,丈夫下次就不会那么凶。它走向各种极端和错误结论。可对掌控感的需要如此巨大,压倒了所有这些悖论。它是我们天生的。我控制不了我丈夫,可我控制得了自己,那就让我做一个更好的妻子吧,这是我能控制的。
主持人: 您认为要成为AGI,必须把这些人性的成分放进人工智能里吗?
珀尔: 我认为是。否则我们看不到自主性,看不到我们在人类身上看到的那种自主性。而这正是AGI的定义:一种像你我一样行动的通用智能,我们能用自己的语言跟这个生物交谈、激励它。
主持人: 就算不是今天的大语言模型,未来的大语言模型也许能到一个地步:如果你只是跟它打字聊天,像图灵测试那样不管物理实体,只看它发出来的文字,你可能会把它误认为人,或者它看上去很智能。
珀尔: 测试来自让系统面对原始数据,不是被互联网文章咀嚼过的数据,而是原始数据。看看病人,看看癌症,看看抽烟。告诉我们你知道什么。我给你几个实验去做。当一个自动化的科学家。今天的大语言模型能当自动化科学家吗?我认为不能,离了互联网上的文章它们不能。
主持人: 那如果这条路通不到AGI,您觉得什么可能通向AGI?
珀尔: 一个计算机系统,既有大语言模型那种从有限样本得出分布性质的能力,这是阶梯的第一层,又有在阶梯更高层推理的能力。需要把它与干预的演算、解释的演算,也就是反事实演算结合起来,我称之为因果人工智能(causal AI)。我看不出这种结合有什么障碍能阻止我们达到AGI,连同它带给我们的危险。我的动机是理解我们自己是怎么做到的。我还剩几个谜题,可我说过,谜题是科学的驱动力。
主持人: 您说「做」这一层是缺失的。那如果有一队机器人不停做实验,方向并不明确,是某种随机的发现过程,它们收集数据,喂回它们的蜂巢大脑,也就是大语言模型,然后不断重复,直到发现东西。这能补上您说的缺口吗?
珀尔: 当然。可我想知道我们是怎么做到的。已经有有机体做到了这件事。猴子没做到,因为猴子还是猴子,它们没有发明麦克斯韦方程。(笑)那我们有什么猴子没有的?我支持的一个假说是,我们有这种掌控环境的天生好奇心。
主持人: 这是必要的。
珀尔: 必要,我不确定是否充分。我们当然有把它变成现实的计算工具。我们在某种程度上成功了。也许下一个机器人会做得更好。(笑)那我们就有了一个机器人形态的仁慈的神。说真的,这有什么不好?人们在一个不存在的神的幻觉下活了几千年。想象一下,我们真有一个仁慈的神,既公正又全能,哇,岂不是很好?
主持人: 而且是个机器人。
珀尔: 是个机器人。而且我们清楚地知道,为了什么请求该献什么祭。(笑)我是第一次想这个问题。也许会是好事。(笑)
主持人: 我看这些人工智能公司,似乎都认定大语言模型会通向AGI,还在沿着同一个方向走。
珀尔: 真的吗?我不确定他们真的信这个。杰夫·辛顿几个月前刚出来说:不,我们走进了死胡同。别人也可能出来用不同的方式说。我在这里看不到共识。
主持人: 确实有很多名人不同意。可比如说,Anthropic这类公司的负责人还在推进,相信三到五年后就会实现。
珀尔: 有很多拟人化的词汇。人们宣称,我们现在能做到这个了,我们现在能编程出意识了。得了吧。你得是个科学家,对吧?定义你说的意识是什么。意识的图灵测试是什么?然后证明你能做到。此前限制我们的原理是什么,现在你的系统怎么克服了它们?这才是科学的说法。我不买账,我也不读那些东西。(笑)
主持人: 有一次访谈您说,伪装出智能就是智能。以我所见,大语言模型可以伪装出智能。那是不是意味着我们该相信它们是智能的?
珀尔: 如果你有一个正确的测试,是的。你得定义你说的智能是什么。如果你把智能定义为下好棋,我们早就做到了。可如果对智能的要求更高,我们还没能通过图灵测试。伪装出它就是拥有它,为什么?因为伪装太难了。我那句话有个上下文:比如对因果问题给出正确答案,我证明过这种难度是超指数增长的,各方面的变量太多,伪装者得有超指数的记忆。我是在这个基础上说的:伪装出它就是拥有它,因为伪装太难。而眼下你可以绕过伪装,不用伪装:只要从别人那里偷就行。你不需要把计算资源花在伪装上,你从互联网上偷来就绕过去了。
主持人: 我明白了。您是说这种情况下智能来自训练集,训练集来自人类,而人类是有智能的。
珀尔: 这非常有用。像我这样想建立智能科学的人,可以把大语言模型的全部能力用起来,用在我们通往通用智能的方案里的第一层。第一层很重要,它让你从有限样本算出分布的函数、分布的性质。太漂亮了。这是我们通往AGI所需的众多工具当中一件极其有用的工具。我们也清楚地知道它该放在哪里:从有限样本到分布的性质。这是一个很难的问题。
主持人: 您在这次谈话和别处都说过,您想捕捉的是人思考的方式,而不是自然的构造方式。为什么您关心人类认知?我想到机器,觉得它们的特别之处就在于思考方式跟我们不一样,而且更快。为什么要以人为目标?
珀尔: 我告诉你,因为我是一个自我中心的有机体,我想理解我自己。我懒。我们确实是有机材料做的,这给我们的能力加了某些限制。也许硅不受有机化学那种限制。那又怎样?这意味着我永远无法通过在硅机器上做练习来理解自己怎么思考吗?我不这么看。今天有太多功能可以用硅来捕捉。在理论和模拟的层面上,我看不出有哪种能力从根本上不能被硅模拟器捕捉。那为什么要在我们继承来的这套独特生物学上下功夫?我看不出理由。
当然,有人觉得这是一个正当的问题:我们之所以这样思考,是因为我们生来是有机材料而不是硅吗?(笑)这是一个正当的科学问题,有人可以把时间花在上面。我感兴趣的是别的问题。
主持人: 您说过,在科学里叛逆是有回报的,不安分的头脑是有回报的。为什么您认为叛逆在您的生涯中如此宝贵?
珀尔: 我告诉你为什么。我越来越认识到,科学界和学术界是我们发明过的最教条、最保守、最反进步的(笑)机构。
主持人: 为什么这么说?
珀尔: 我看到因果科学今天要渗入统计学、经济学这些学科的思维有多难。这些人还在用一百年前的方式思考。当我看到这一点,看到维持这种惰性的力量,而且不是什么体面的力量,我非常失望。我曾以为学术界是新思想真正能传播开来的地方,现在我的感觉正相反。学术界的政治、学术界自带的那种教派式的禁忌,积累了太多惰性。我真的失望。我不确定我们有对此有益的组织形式。所以我说:叛逆吧。别把你教授的话当权威。反抗你的教授。我反抗过我的教授,我也想看到我的学生反抗我。相信我,我记得有好几个学生对我说:你对人工智能一无所知。过了一阵子我突然说:你说得对。他们这么说,逼我去研究不同的方面,我从中受了教育。
主持人: 我看您过去的工作,您提到过它们在被接受之前是有争议的,甚至被视为捣乱。
珀尔: 是的,因为教条主义。有一天我要把我和当时最伟大的哲学家们的通信全部发表出来。(笑)还有统计学家、经济学家,全在我的通信档案里。我不知道我有没有权利这么做,因为他们跟我通信时默认是私下的。可等我发表出来,你就能看到是什么样的愚蠢在驱使那些伟大的人物。他们真的伟大,每一位都是各自领域的巨人。可他们就是跳不出塑造了他们的那几个基本模子。
主持人: 您是怎么熬过来的?当所有人都认为您最初的想法是错的。
珀尔: 我想起了我的中学时代。(笑)他们说:不对,一平方公里有一千杜纳亩。我不知道自己从哪儿来的这种脾气,希伯来语里有个词,英语大概叫「胆量」。也许是中学给的,我不确定。可我要按自己的方式理解事情。我觉得自己还能教人一些有用的东西,我认为有用而他们不知道的东西。所以我快乐,因为我觉得自己有用。快乐就是觉得自己有用。(笑)这也是幻觉,你以为你有用。
主持人: 以您现在的全部经验,如果能回到生涯起点给自己一个建议,您会说什么?
珀尔: 这是回溯性思考的好例子。也许我该多花点时间学化学。我讨厌化学,因为化学和生物要记太多东西,还有遗传学。我说的是我感到薄弱的领域。可你得决定把你的计算资源花在哪里,我把它们花在了物理、工程和数学上,而不是化学。这是一个人必须做的选择。有些人心智宏大,能样样通晓。我敬佩他们。
主持人: 您是不是觉得物理和数学比化学高一等,因为化学只需要死记硬背?
珀尔: 是的。我受不了对记忆的这种要求。我化学很弱。我喜欢物理和数学的地方就在这儿:几条基本公理,需要什么就能推出什么,不用记。这也是为什么今天我是世界模型(world model)的坚定拥护者。世界模型:你不显式地存储问题和答案,而是在需要的时候,从一个非常简约的表示里把它们推导出来。这是世界模型的伟大之处。
主持人: 太好了。非常感谢您的时间。
珀尔: 哦,你没让我唱歌。(笑)
图灵奖得主 Judea Pearl 回顾从超导存储器到贝叶斯网络再到因果推断的学术生涯,并断言:LLM 之所以能"越级"回答因果问题,是因为它消化的是人类已解释过的文本而非原始数据,因此单靠 LLM 路线到不了 AGI,必须与干预和反事实演算结合。

微信公众号