迈克尔·乔丹
TTim Scarfe编者按:本文是机器学习播客 MLST(Machine Learning Street Talk)对迈克尔·乔丹(Michael I. Jordan)的一次长访谈,录制于哥本哈根。乔丹是加州大学伯克利分校教授、法国国家信息与自动化研究所(Inria)研究员,长期从事机器学习与统计学研究,《自然》杂志曾称他为最具影响力的计算机科学家。访谈围绕他新近发表的论文《人工智能的集体主义经济视角》展开,从 AGI 一词的虚妄谈到数据市场、机制设计、不确定性量化,以及一代年轻人正在被怎样的叙事所误导。本文依据现场录音编译整理。
主持人:顺便问一句,你怎么看 AGI 这个词?
乔丹:在我看来,AGI 就是一个公关用语。有人觉得它有趣,因为人总得有点宏大的抱负。我觉得它只会扭曲判断,把年轻人搞糊涂。今天我会稍微多谈一点这个话题:那些经常出现在播客和各种场合的所谓思想领袖,最让我警觉的,是他们那种要么危言耸听、要么狂热亢奋的腔调。二十岁、二十五岁的年轻人看着这些,心里想的是:我该做亢奋派,还是做末日派?好像只有这两个选项。我希望我们接下来的谈话能让年轻人明白,面对生活和技术,还有别的路可走。
我从来没有把自己当成人工智能研究者。我没读过人工智能的教科书。这个词是五十年代造出来的,约翰·麦卡锡他们造这个词时有特定的目标,也有特定的方法,比如逻辑推理之类,后来并没有真正走通。与此同时,在六十、七十、八十年代,一种叫「机器学习」的东西出现了。它的实际方法,决策树、最近邻、逻辑回归、隐马尔可夫模型,都是在别的领域发展出来的,主要是统计学和运筹学。这些方法带来了工业界的成功:供应链、商业、交通系统,当年就在大量使用机器学习,至今依然。它们用的是基于梯度的方法。事实上,云计算就是亚马逊为了处理机器学习的工作负载而发展起来的。这就是我出身的传统。我想的是如何把系统做大,做到规模化,同时服务很多人。
「人工智能」这个流行词大约是五年前卷土重来的,原因是开始拿语言数据来训练。于是这个盒子不再只是预测供应链、商业或价格,而是吐出人类般流畅的语言。人们说,天哪,我们把老的人工智能问题解决了。如果你把人工智能问题定义得很窄,比如图灵测试,那从某种意义上说,确实解决了。但机器学习这条传统一直在那里,到那时已经吸纳了各种背景的人,对工业界产生了实实在在的影响,现在也还在产生。「人工智能」这个词因为大语言模型而回来了,在我看来,它扭曲了研究的路径,扭曲了我们对研究该往哪里走的思考,也扭曲了我们对商业模式、对技术走向的思考。光是「人工智能」还不够,他们还得再造一个更夸张的词,AGI。
我们今天会大量谈到经济学,把它当作社会智能的一个来源。把它和机器学习式的智能放在一起,你谈论「规模」的时候,就不再只是计算机的数量和数据的数量,而是人的数量。这对我至关重要:在这些正在成形的系统里,人作为生产者和消费者的角色,应当得到尊重、放大和认真对待。
主持人:迈克尔·乔丹教授,能请你来 MLST 是我们的荣幸,尤其是《自然》杂志前不久刚说你是最有影响力的计算机科学家。
乔丹:说来好笑,我受的训练是统计学家和认知科学家。不过这个头衔我收下了。
主持人:你刚发表了一篇论文,叫《人工智能的集体主义经济视角》。请用几句话介绍一下它的核心主张。
乔丹:我从来不是人工智能圈子里的人。所以在某种意义上,我很容易走进来,看着那些自称人工智能研究者的人,问一句:你们在干什么?你们的要点是什么?你们的目标是什么?遗憾的是,他们往往没有一个清晰的目标。他们的想法就是:人是有智能的,人是一台计算机,大脑是一台计算机,我们把它模仿出来,取其中一些方面,做成并行的,做得更强大,它就会干出伟大的事情。到这里就停了。他们并没有一个面向社会的目标,说我们要用它解决这个或那个问题。他们的想法是,它自己就会替我们解决问题,然后我们就幸福了。我离开硅谷,一部分原因就是那里的人都这么说话,我听腻了。那里没有多少智识上的、更深层的、长远的思考。现在它又变成了一场竞速,一场钱的竞速。
我的视角来自一个很长的传统:许多人早就从社会科学的角度看待智能。我们是社会性动物,我们的智能很大程度上来自聚合。我们聚合意见和想法,我们有文化把它们保存下来。而且,社会为我们的智能提供了语境。在一个语境里聪明的行动,换一个语境就未必聪明,一切都是转瞬即逝、因时因地而异的。要理解这意味着什么,就需要社会科学的思想。我说社会科学,包括经济学,也就是博弈论的视角。所谓语境,就是外面有人想占我的便宜,或者想跟我合作,而我并不确定是哪一种。所以我得放出触角,发出信号,建立机制,让我们能有效地互动。经济学用数学的方式研究这些。这吸引我,因为我是一个偏好数学的人。
我不是人工智能的批评者。我想把它做对,做得更好,想弄明白在这个世界上什么叫智能,什么叫安全,去思考长远的问题。而在我看来,这些事在某个层面上必须用形式化的、数学的方式去做。光是把东西造出来扔到外面去,是不够的。
至于「集体主义」,我的意思只是:这项技术的大部分建立在几十亿人的输入之上,所以输入端本来就是一个集体;它又要服务几十亿人,所以服务端也是一个集体。这里面潜藏着一张巨大的网络。而「经济」这个词是关键,因为我不想只是说些漂亮话,我想写下可以付诸行动的数学思想。
主持人:这很有意思。七十年代德雷福斯提出过「第一步谬误」,它也和麦考黛克(Pamela McCorduck)描述的那种效应有关:我们造出了某个惊人的东西,就以为离无所不能只差一步。这些系统确实不可思议,能写出漂亮的文字,能解题,能编程。可奇怪的是,它们对我们的帮助并没有那么大。我们本以为它会带来一场革命。
乔丹:一点也不奇怪。因为背后的模型还是老的人工智能模型:我们就造一个智能的东西出来。它只是稍微升了个级,变成一个更好的搜索引擎。这没什么不好,我确实认为搜索引擎是人类的一大进步。可现在它变成了搜索引擎的加强版,像一个坐在你肩膀上的秘书,帮你干活,在你耳边低语。这是个愚蠢的商业模式。我不认为很多人真的想要这个。他们会把这该死的东西关掉。他们想自己思考。也许一天结束时要个摘要什么的,但他们不想一天到晚跟这个东西互动。这不是一个好的商业模式。
与此同时,我们有庞大的医疗系统、交通系统、金融系统,它们全都建立在几十亿主体之间的数据流之上,它们已经用了大量机器学习,正等着人用更经济学的方式去思考:主体是谁?他们各自想从中得到什么?其中潜藏着怎样的合作与竞争,可以被改进?市场是几千年前出现的,我们摸清了其中一些原理,但还可以改进它。思考是几十亿年前出现的,但我们并不完美,不只是思考上不完美,我们还会狭隘地只顾自己的盘算,无意中伤害别人。
人是美好的。我们要珍视人的生命、创造力、情感和爱,这是根本。但人也会作恶,或者做坏事。这正是技术应当能帮上忙的地方。所以你得从系统的层面去思考。而现有的这些东西并不是真正的系统,它们是巨大的统计盒子,有输入有输出。这不是系统思维。当然,底下有一层计算机系统,但我想站在那之上。我想问:这个东西属于哪个生态?它跟谁互动?以什么频率?什么质量?创造了什么价值?我说价值,通常指的就是钱。我想让这个东西创造出工作岗位。我不想它只是回答问题、替我们做事。我想让它创造工作和创造的机会。
主持人:理查德·萨顿常被引用来讨论「设计还是演化」。前几天我看了大卫·多伊奇的一场演讲,他谈解释。他说物理学家自然是追求底层的、有原理的解释,但有时候高层次的粗粒度描述也非常好用,经济学也许就是其中之一。那你会怎么回应硅谷的一些人,比如伊利亚·苏茨克维?他们谈论「人类价值函数」,说:我们有了这些大语言模型,把它们变成多智能体系统,你说的那些经济学的东西就全都免费得到了。
乔丹:这根本不是做工程的正确思路。假如你是四五十年代的化学工程师,说我们就把一堆东西掺在一起,让它跑起来。你可以这么干,但你会得到很多爆炸,很多经济上不可行的东西,你会伤害很多人。而我觉得这些人里有很多并没有想过,Facebook 之类的东西已经伤害了多少人。它伤害了大批年轻人,很多青少年有了心理健康问题。这件事计算机科学家根本不谈。现在我们又在谈下一个层次的冲击:工作可能会消失,那就只能认了,当然也会创造新的工作,历来如此。我不喜欢这样说话。
你得退后一步,问一句:你的要点是什么?你是想创造一种新的市场,让人们能进来,让他们的才能得到重视和赏识?让人们可以对自己需要的东西发出邀约,让协作得以浮现,让生产者与消费者的关系得以探索、理解和发展?而这一切可以是计算与人的混合体。我认为最终二者会融合,但一路上,用这么多既不是好的社会科学、也不是好的数学的比喻,去做这么有破坏性的事,那只是比喻而已。
是的,你能把它造出来,因为上一代人创造了这些惊人的东西来收集数据,我们可以在数据上跑梯度下降,配上一些临时拼凑的架构。是的,这行得通,很了不起。但别把太多功劳记在做这件事的人头上。真正的功劳属于二三十年前的人。当下这一代人,说实话,没有多少思考,没有多少智识含量。不过就是:造得出来;数据想从哪儿偷就从哪儿偷,因为互联网让这成为可能,而且不用给产生数据的人回报任何价值;可以在上面跑贪婪的梯度下降,虽然需要巨额资金,但现在可以从那些想得不深的人手里拿到钱。
也许我说得比我本意要黑暗。建造者里有很多好人。可是过去每一个工程发展的时代,电气工程、化工、机械,都有建造者,但同时也有大量的概念和大量的思想家。事实上,所有这些工程学科都有类似麦克斯韦方程或牛顿方程的东西作依托。这里没有。这里只有一群很聪明、会写代码、有很多直觉的人。我从来没有看到任何让我觉得有深度智识的东西。它给我的感觉是科幻。
主持人:还有一件事恐怕也帮不上忙:这些系统像一锅汤。甚至有一个领域叫机制可解释性,试图在汤里翻找,就像在找不明飞行物,想找到那些做推理、做某某功能的有原理的回路。往坏了说,这跟工程师造桥可不一样。
乔丹:我没那么悲观。我不认为造出自己不理解的系统是坏事。但你得在它周围搭建一些东西。而现在围着它转的,是一些流行词,比如「AI 安全」。这是个流行词,好吗?你真正需要的是什么?拿人来说,你没法向我解释你为什么选了这家民宿而不是那家。你今天做的所有选择对我来说都无从解释,它们是从你的大脑里冒出来的。而我并不需要知道你每个选择的来龙去脉。我需要知道的是,你在某种程度上是可预测的:如果我给你摆出某些选项,你更可能选这个而不是那个,这样我就能做我自己的打算,我们就能开始互动。这就是经济学的一部分。经济学式的思维说:我不理解外面这些主体,但有一些经验法则可用,有一些量化的预测可以放进去,让我能跟它们互动而不受伤害,甚至从中得到价值。所以不,我不认为必须理解所有细节。
不过,输入输出行为,我们常常需要比现在理解得更好。比方说,我在银行申请贷款被拒了,银行用的是一个基于历史数据的大型人工智能程序,我想知道为什么。这个「为什么」不是让你去翻内部,给我看某条回路。没人想要那个。人们想要的是:按照我们这张大网络里用的嵌入表示,这里有五十个人跟你很像,其中有些人拿到了贷款,有些没有,让我给你看看这些人是什么样的。于是你开始看出:哦,他们跟我的差别在这里。这对我来说是可以行动的,我可以去改变。所以你得围绕这个预测系统去搭建别的系统,比如一个最近邻系统。这样的系统提供的东西,才更接近人们心目中的「解释」。这不是钻进内部去找什么。
再说一次,工程学里当然有热力学,有很多被理解透的东西,但也有很多现象在很长很长的时间里没人理解。你把一堆东西掺在一起,产生了某些波,发生了某些事,你利用它,继续往前走。但你得理解一些关于输入输出行为和约束的东西。我认为当前这一代神经网络会继续存在,它们的扩展性质非常好。但必须把它们看成一个更大生态系统中的一部分。然后你去问:在这个语境里,神经网络能做什么?它缺什么?如果我有好几个神经网络呢?它们彼此之间、它们与我们之间如何互动?整体互动要有效,需要什么样的透明度?而不管我是否理解所有细节。
主持人:不知为什么,我有一种直觉,觉得行为主义是不对的:没有任何机制层面的理解,只看输出。有个著名的例子,那只鸡不知道自己的脖子会被拧断。一个实际的例子是 AlphaFold。上周我在谷歌采访了约翰·贾姆珀。你们对那两亿个预测的蛋白质结构做过分析,发现它们非常好,但缺了点东西,不过可以把它们「加固」。
乔丹:可以加固,没错。我觉得这是个好例子。我非常钦佩 AlphaFold。我不认为它像大语言模型,它是有针对性的,为一类特定问题而做,而且做得非常好。我们在经验上发现的问题是这样的:当你问某些特定类型的问题时,比如我们做过一个研究,考察蛋白质中的量子涨落是否与磷酸化相关,磷酸化意味着这个蛋白质在细胞里是活跃的。你可能会想,这些导致链条松散悬垂的涨落,大概意味着这是「坏」蛋白质,演化不会用它们。结果却发现,其中很多似乎是被磷酸化的,也就是说它们在细胞里是有反应活性的。
这就引出一个假设检验:磷酸化的是与否,跟量子涨落的是与否,二者之间有没有关联?这是一张小小的二乘二表,你对它做一个统计检验。问题是,如果只用已知的蛋白质数据,也就是有晶体结构的那些,你没有足够的数据以高功效检验这个假设。于是你无法拒绝「没有关联」的原假设,尽管看上去是有关联的。反过来,如果你用 AlphaFold 的两亿个蛋白质,你就能以高功效检验假设,也能拒绝原假设。但我们发现,那张二乘二表上的统计量,其置信区间极窄,而且离真值、离金标准的值差得很远。我们在一个又一个领域里都发现了这种情况。
为什么会这样?训练集里带量子涨落的蛋白质大概没有多少例子,因为这个课题过去研究得不多,而且很难结晶。例子少,就意味着 AlphaFold 很可能给不出好答案,可它不会告诉你这一点。它不给出误差棒,尤其不针对你正在问的问题给出误差棒。而我要的正是这里的误差棒。它在被设计和训练的时候,并不知道你会问这个问题。
于是我有了一个很好的统计问题:如果我在那两亿个之外,再加一点点真实的标准数据,能不能让误差棒依然比较窄,从而保有高功效,同时又能覆盖真值?答案是可以,有一套方法。我们发展了一种叫「预测驱动推断」(prediction-powered inference)的方法,做的正是这件事。它会像经典统计那样覆盖真值,但用的是这个偏差很大的架构。说它偏差大,并不是说它整体上有偏,它整体的准确率很高,但对于我正在问的这个问题,它可能偏得厉害。而这种情况在科学里会大量出现,因为科学家很少只对重新研究过去感兴趣,他们感兴趣的是知识边缘上的全新事物。而恰恰在那里,这些基础模型表现最差、偏差最大。
所以,在任何基础模型的周围,都需要有这样的能力:也许收集一点真实数据,用类似的程序把它们合并进去,然后给出一个更可信的答案。这一切都不是科幻,这是现在就能做、也真正需要做的事。我相信 AlphaFold 的团队会认同这一点,他们不会觉得这奇怪或意外。但外面有很多人在谈偏差之类的问题,他们要么不担心,说数据够多了偏差就会消失;要么只是批评架构、批评输出,但心里没有任何能帮助我们往前走的科学方法。这就是我们目前所处的状态。
主持人:我稍微追问了贾姆珀,问 AlphaFold 在多大程度上「理解」,他基本上对「理解」这个词过敏。他说:我们不是要告诉你一切,我们不是整个细胞的模型。这些机器让我们能预测,能控制。此刻,理解还得靠我们自己去推导。我们现在可以在这个人工制品上做实验,可以看两亿个预测结构,而不只是二十万个实验结构,以此帮助我们理解。但它不替我们完成理解这个动作,它做的是预测,也许还有控制。他向我描绘说,这是个奇怪的外星造物,它不是一次生成的,而是逐步精炼的,有一条回收通路,可以把东西反复过几遍,可以在中途把它弄乱,网络先迭代地解决复杂的部分,再不断精炼、精炼、精炼。我们能不能把这看成一个理解的过程?
乔丹:我认为没有必要。这种把智能、把理解拟人化的做法,既不必要,也不合适,而且对很多很多问题来说是一种干扰。为什么非要说它「理解」?
我的部分底子来自亲眼看到机器学习算法在二三十年前被部署到工业现场。我刚到西海岸的时候,大约两千年前后,我去参观亚马逊。他们当时用海量数据做供应链建模,用的是当年的「神经网络」,其实是随机森林。真的管用。他们能极其精准地预测某些船会不会在印度洋上延误,进而某些零件会不会不能按时到达。整个供应链把几十亿件商品每天送到一亿人手里。这个大盒子里发生的事,没有任何人能够理解。但也没必要理解。你其实可以问:这个整体系统「理解」运输和物流吗?答案是:谁在乎?它做了一个非常重要的优化和预测过程,让人们能在它周围搭建一个工程系统。它降低了不确定性,让囤货和计划成为可能,这就是你要的。你不在乎是不是非得把「理解」或者「智能」这样的词安在它头上。那是给媒体看的。这就是我对那些推销 AGI 和人工智能术语的人的不满。媒体照单全收,他们也知道媒体会照单全收。尽管我们根本不清楚「理解」和「智能」是什么意思,我们这些研究者知道,我们不在乎,也不需要。我们要造好的系统。
主持人:有意思。我同意我们生活在一个复杂、适应性的、不可化约的系统里,没法把它本质化。弗朗索瓦·肖莱、大卫·克拉考尔这些人把智能说成是适应,是粗粒度表征的综合。但假如中间还有一步呢?我们不拟人化,我们说,理解不是终点,而是把我们带到那里的路径。我们知道在现实世界里我们是一种集体智能,就像盲人摸象,各人走各人的路,各有各的视角看同一个整体。那么,一种更好的「理解」,是不是就是能从自己的视角出发,用积木把这个东西重建出来,而不是去本质化它?
乔丹:听起来都很好。只是这不是我们做研究的人会用的语言。我们当然也会稍微这么想一想,但我们会试着把它变成某种均衡问题或优化问题:这是可用的信息,这是数据,这是功效,这是错误率。我们会试着在它周围放上一点这种形式的结构。
当然,总有那么一个创造性的时刻。我小时候对跳高很感兴趣。你跑向横杆,用各种方式跃过去,那时奥运选手用的技术是滚式,侧身滚过横杆。然后来了一个叫迪克·福斯贝里的人,他说,不对,我背对着过去能跳得更好。此前没人想到过这么做。他一做,所有人都跟着做,成绩好像一下子提高了半米。是什么过程导致了这个?是一个理解的过程吗?那只是一点「试试不一样的办法」,加上能够去试、去测试的条件。工业界大量的规划工作就是试一试、看看哪个管用,这叫 A/B 测试。人们一直在做,我对此毫无意见。它不是基于理解的,但它造就了优化的系统,能做出人们之前没想到的事情。所以是这种东西和理解的混合。
至于单纯的「理解」,我当过认知科学家,我对神经科学感兴趣,人应该对这些感兴趣,它们很迷人。但它们不是思考如何造出能在世界上运转的系统的前沿,也不是构想下一代系统的前沿。很多人一直在说,我们得把逻辑放回去,或者把符号放回去,因为那来自我们以前对人类在做什么的看法。人类大概确实能做一些逻辑推理,大概也有某种符号,至于它们是嵌在某个复杂网络里,还是以某种方式被具象化了,我不知道,我的直觉不比你的更好。
真正的目标是什么?我骨子里是个工程师,一个偏好数学的工程师。我想问:你到底要实现什么?你是想取代教师?还是想让医生变得更好?你想做什么?切入这个问题的抽象和入口是什么?然后,你怎么从中退后一步,用某种普遍的、优雅的、能启发他人的方式去做?
主持人:看不同学科的科学家从各自的角度进攻这个问题,很有意思。比如物理学家,他们在很底层工作,谈粒子系统的动力学之类。而你从经济学的角度切入,这个学科传统上由主体视角主导,谈均衡、谈激励。这怎么进入问题?你会怎样把一个非常复杂的系统分解到这个新的思考框架里?
乔丹:这件事做得还不够多,我拿不出一大堆漂亮的例子。但我们一直在看一些规模适中的例子。比如我们看过一点药物发现和监管。我是一家制药公司,我测试各种蛋白质,把它们注射到动物身上,也许还有少数人身上,看看哪些有效。我有一些所谓的「理解」,也就是说,我懂一些背后的演化生物学之类,这引导着我。但到了某个时候,总得有人在真实世界里真正检验它,监管机构得进来说,行,这个可以上市,或者不行。于是你有了一张纠缠的网:科学家、制药公司(不是一家而是很多家)、蛋白质。你得思考这个系统是怎么运转的。监管机构的目标,应该是让整个系统的假阳性率和假阴性率都低。这就是问题的目标。所以它是一个统计问题。
但等一下,经典的统计问题,你会去某个来源收集独立同分布(IID)的数据。这里不是。数据来自有自身利益的制药公司。他们的动机是什么?钱,或者别的。也许他们也真心想帮助病人,同时也想赚钱。而作为监管者,这些都对你隐藏着。这时经济学的思维方式就派上用场了。它说:这些东西对我是隐藏的,但不是任意的,我可以用各种办法去探测。于是这就变得很经济学。
经济学家会思考如何定价。假设有很多人要坐我的航班,刚到了一千个人想从这里飞伦敦。每个人心里的价位都不同,而且这个价位会随时变动:他有多急着走?这不只是因为他钱多钱少,而是因为他有需求,而我不知道那是什么。所以我做的是,设置各种服务和各种价格,把各种可能性都框住,这样总体上我大概率能赚够钱,大家也都还算满意,这项服务就能继续下去。这就是把「知道一些事情」和「承认不知道另一些事情」结合起来,放进一个真正能在这种信息不对称和激励并存的环境里运转的系统。这里的激励是:有某种服务和某个价格,你选了它,你大概率能上飞机,大概率能得到你要的东西。它不是强迫你做什么,而是激励你。
在制药的世界里,如果我能激励他们,让他们送来的大多是已经做过一些测试、他们自己也相信不错的药,而不是随便往我这儿扔,那么整个系统也许就能达到你想要的错误率。因为如果不这么做,假如一种药会有十亿人使用,那么不管它是否真的有效,你都会赚钱。所以你需要它上市。怎么上市?往监管机构那儿一扔就是了,也许就出一个假阳性。它出了假阳性,把药放上了市场,你赚了一大笔。如果这种事够多,激励就全错了,整个系统就控制不住第一类和第二类错误。这些是我们实际做过的例子。
我希望你能体会到:当这一切真正在社会中铺开时,不会是「有几个大语言模型,人人都像用搜索引擎一样去问它们」。那不是真正的模式。真正的模式是:有本地数据,就像我刚才说的预测驱动推断,每个人都得审核送到自己面前的东西。还有本地数据是我花了成本收集的,我不会白白送出去。谢天谢地,Anthropic 终于开始付钱给人了。这必须是未来。所以我的数据会有某种竞争性的价值,我不会随便交出去。这样一来,当你开始和大量想从互动中获取价值的人互动时,你就必须谈激励。他们发送数据的激励是什么?不仅是发送数据,而是发送正确的、真实的数据,不搞对抗?我无法想象这一切在社会中、在我们一生的所有决策中全面铺开,却没有一套深入的微观经济学视角伴随着数据上的梯度下降。
主持人:你谈到过一个三层模型。比如有消费者,他们有自己的数据;有谷歌,谷歌使用这些数据,消费者得到服务,然后谷歌可能把数据卖给另一边。这算是传统模式。我们从这个说起吧。
乔丹:这些是玻尔原子模型那一类的东西。我们在这里是在做科学,想找一个最小的模型,能展现出我们想研究的某些行为。我们来想一个数据市场,因为数据现在不只是拿来分析、拿来训练大模型的东西,它也是可以买卖的、有价值的东西,而且还牵涉隐私。那我们就搭一个小小的最小模型,在里面研究这些。
我们做的一个模型,叫三层数据市场。它在现实世界里存在。这是一个抽象,但它是真实的东西。有一个或多个用户进入某些平台,平台提供一项服务,比如支付服务。我使用它的时候,他们从我这里获得数据,知道我做了哪些购买等等,然后用这些数据改进服务。这是一个不错的小循环。问题在于,他们很少能光靠这项服务赚到足够的钱。他们抽的那一小笔佣金,商户也不情愿给。所以他们得做别的事情才能活下去。通常的做法,大概二十年来一直如此,就是把数据卖给第三方数据买家。这些买家不是想毁掉别人隐私的恶人,他们是做市场研究的,想知道什么行得通,人们真正在做什么,也就是行为研究。这对他们有价值,他们愿意付钱。谷歌不需要这个,因为它创造了那个人为的广告市场,我们待会儿可以多谈谈,那东西给所有这些荒唐事加了超级马力。但像万事达这样的公司,就不得不卖数据。
于是就成了三层。而第三层一引入,均衡就必须移动,因为把数据送进来的用户失去了一些东西:一点隐私。某个我一无所知的第三方拿到了关于我的数据。我不能就这么接受,可我也走不掉。系统上于是有了压力。在一个有效的经济系统里,接下来发生的不该是等监管者进来、政府出面说这不许做。而应该是平台说:我们以某个成本,向你提供可调节的差分隐私等级。或者说,我是谷歌,我给你 0.3 的等级,另一家公司说,我给你 0.7。用户一看,0.7,那更好,我很在乎隐私,我去那家。那家公司于是开始拿到更多数据,服务变得更好,你看,一个漂亮的小反馈环。可现在数据买家看这个人的数据,0.7 意味着数据里加了更多噪声,对买家的价值就低了,买家会说,这个我少给点钱,我多给谷歌一些。
于是你看到这里有相互冲突的倾向。激励是对齐的,但对每个人都不是最优的。这时数学就不再是一个优化问题,而是一个均衡问题。但这是一个牵涉统计断言的均衡问题:数据,用这些数据能预测到什么程度,等等,你用误差棒和统计预测把它量化。你把这一切放进一个大的数学系统,就能求出均衡随各种系统参数的变化。比方说,监管者是否应该要求一个最低隐私等级?或者是否可以有异质的隐私预算?诸如此类。你可以放进各种设定,然后画出均衡如何移动。每个均衡都有三方效用的总和,那就是社会福利。你可以问这个均衡的社会福利比那个高还是低。监管者看了可以说,我更喜欢这一个,因为总体社会福利更高。法律可以在这个层面上制定。
所以,尽管这是个小小的玩具模型,它已经具备了我非常感兴趣的那些要素:预测模型、数据市场、金钱、激励,还有一个已经在实际运转、但人们并没有认真思考过的真实系统,就像药物发现那个领域一样。而只要采取经济学的视角,你就能把系统做得好得多。
主持人:当然,你是把它建模成一个动力系统,可以模拟,然后得到各种模态。
乔丹:不,这里不需要模拟。这个例子里你可以直接写出方程,算出均衡。它是一个斯塔克尔伯格博弈(Stackelberg game),均衡是能算出来的。其他情况下可能要模拟。但关键是,我很多机器学习界的同行对不动点算法、求均衡、均衡随参数移动这些东西知之甚少。那是经济学的东西。机器学习的人非常擅长优化,但这不是优化问题。有一整套算法和数学分支,用来找帕累托前沿,用统计的方式去找,并且作为市场规模、人口规模的函数去找。
这个时代有件挺惊人的事:这两个领域几乎从未相遇。经济学家从来没有大量数据来指导他们的市场设计,所以他们就写下一堆方程,做理性假设,然后用数学或别的方法找均衡。而机器学习的人从来不想均衡,他们只是有大量数据,拿来做最显而易见的事:预测一串词里的下一个词。但未来必须是这两支合流。经济学的均衡视角是关键,而「必须是自适应的」这个视角同样是关键。你刚才也提到,硅谷有些搞机器学习的人说,我们有这么多数据,所以行为层面的东西都已经内置了。这显然太天真了。但从某种意义上说,这个观点也有用。经济学家确实做了一些本不必做的理性假设,如果你用数据代替这些假设,大概会做得更好,一部分行为经济学就已经内置进去了。但如果你完全脱离任何经济学思考去做,你只会把事情搞得一团糟。而这恰恰是硅谷似乎很擅长的。
主持人:数据和你所说的那种知识,区别在哪里?
乔丹:社会知识是非常短暂的,非常「此时此刻」的。我可以在哥本哈根的街上走,这里有各种小市集。有什么货,什么价,我可能喜欢什么,这一切都极其短暂。我认为这才是思考这一切的更好方式。你不可能收集到足够多的数据,就知道那边走过来的人会来买这件商品。在我们所有的决策和选择里,不可能有足够的数据覆盖这一切,让你知道接下来会发生什么,哪怕只是接下来的十秒钟。所以你得谦卑一点。
我有大量的无知,但这不意味着我造不出一个安全的系统,比如某种市场,人们可以进来,不会被骗,能得到价值。它可以随时间演化,可以以各种方式变动。我不必是坐在顶端的上帝,去设计什么「人类价值函数」放进去,好让它按照我心目中上帝视角的世界观,去响应人类真正想要的东西。不。它必须是一个允许自下而上的偏好以人愿意的方式、在当下被表达出来的系统。这些偏好不是内置的,系统尊重它们,也许想多了解一些,然后在当下使用它们,也许保留一部分,也许全都是短暂的,过后就消失了。
可现在似乎有一种巨大的天真:以为只要有了数据,哪怕是艾字节量级的数据,就够了。你会漏掉所有那些细节,而对于某一类决策来说,那些细节很可能才是最要紧的东西。连 AlphaFold 这样建立在海量数据之上的东西,在某些查询上也表现不好。是的,他们会打补丁,它会越来越好,但人们要问的新问题,永远会在知识的边缘,或者说常常在知识的边缘。而人们没有在想这个。他们想的是,得把教师替换掉,因为教师做的不是知识边缘的事,他们做的是已知的东西。这没问题,你可以辅助教师,但好的教师也知道如何走向知识的边缘。
主持人:当我们做抽象和理想化的时候,总会有点损耗。你有一个说法让我着迷,你说市场早在资本主义之前就存在,它是自下而上的东西,是一种自然现象。
乔丹:对,这不是资本主义。资本主义只是让市场运转的一种方法,不是唯一的一种。
主持人:没错。所以我们可以称之为「市场」的东西的涌现是一种自然现象,它是建设性的,是发散而多样的。而你是说,在某个地方理论可以落地,我们可以创造抽象,做某种建模,并且尽量做得不那么有损耗。
乔丹:完全正确。人类文化创造抽象。个体也创造对自己有用的抽象。当这些抽象足够有用的时候,它们就会被提升到文化里,这种上下流动一直在发生。而这恰恰是系统或许可以帮忙的地方。我不会就此把这个担子全交给系统,但它可以有帮助。所以创造抽象的不只是单个的认知实体,我们不该把它重新定义成那样。是的,个体层面会出现抽象,但文化也创造抽象。你可以研究其中的微观经济,也可以不研究,只是说这些抽象是文化的一部分,它们有用,所以留了下来。往前走,我们不是只保留旧的抽象,而是要造出允许新抽象涌现的系统。而这不是由一个上帝式的人物把一切想清楚、再放进去。
硅谷说,我们有了,我们有这么多数据,多到可以自上而下把一切都做了。他们不知怎么忘了,首先,这些数据是自下而上来的,数据全都是有语境的,是人提供的。他们还忘了,这一切必须继续在一个微观的层面上进行,而那个层面会超出他们的感知能力。我们也不会想让他们那么深地介入我们的生活。搜索引擎之后,我认为搜索引擎是一项了不起的技术,它让人得以获取信息,此后的很多东西就很成问题了。我们要给你戴上眼镜,我们要在你家里装上摄像头,我们要知道你生活的所有细节,然后不知怎么就把你的生活变得更好。这个等式在我这里算不通。
主持人:所以文化就像天上那块存放抽象的硬盘。文化又非常适应性强,可以删掉策略。知识衰减得很快,组织维护着知识,真正好的知识会留存很久,而在底层,我们不断创造新的知识。这整个生态是怎么运转的?我们怎么指定哪些好东西留下来,又怎么找到新的东西?
乔丹:我们不指定。你和我,答案是我们不指定。但这是优秀的知识分子在做的事情。经济学里就有这样的领域,比如组织行为学,研究组织如何有效地形成。这非常有意思。它不是全部,但那里有很多已知的东西。有些是数学的,有些不是,有些是最佳实践。这些才是谈论这些人工智能生态系统时应该用的方式,而不只是神经科学、神经元的比喻、物理学的比喻之类。那些也是我的出身的一部分。但当我们真正看到这些东西落地的时候,那些东西就显得太单薄了。组织行为学研究的是人如何被组织起来,不仅为公司创造好的收入,也促进民主之类。有人在谈所有这些,我只是觉得他们在硅谷没什么存在感。
也许这样也好。硅谷,随他们去吧。他们会烧掉很多钱,惹出一些麻烦,然后他们也会创造出搜索引擎这样的东西。我也认为很多公司确实专注于创造价值。我认为亚马逊和 Meta 不一样。亚马逊有一个商业模式:把包裹送到门口。在这背后,他们创造了一些技术来支撑它,在我看来大多是好的。你得担心劳动力市场之类的问题,但那些都是值得担心的好问题。可是,光造出一些做预测的计算造物,然后说如果你戴上护目镜,你就能活在他们的世界里,这不是商业模式。这是科幻的梦,对人类可能有帮助,也可能没有。
主持人:我们能不能展开谈谈?你举过 Spotify 的例子。我们之前谈那个三层结构,而现在出现了一种奇怪的激励结构:Spotify 实际上有动力用人工智能来生成歌曲。
乔丹:是的,他们有。我参与一个项目,我是 United Masters 的科学顾问,它是一个替代方案:音乐人保留自己的作品,United Masters 把他们和品牌以及其他机会连接起来,让他们更像一个真正的艺术家,而不只是歌被播了几次、拿到一点点钱。因为 Spotify 确实接近垄断,它没有动力好好付钱,那里没有真正的定价,有的是垄断价格。人们会希望市场能修正这一点:足够多的年轻艺术家会说,我在这儿被坑了,我赚不到钱,然后另一个服务就会出现。但我们所处的时代,有些服务很快就变成了垄断。这一点我留给我的经济学家朋友去想透,去回看历史上的例子,思考是需要监管,还是有别的造市机制能让这对人更健康。我不反对 Spotify,但它应该是一个更多回报艺术家的生态系统的一部分。现在,艺术家拿到的钱非常非常少,我不相信这些价格是在竞争机制下定出来的。
我认为这里有一个更宏观的经济学问题:这些系统在做什么?它们在社会中的角色会是什么?搜索引擎出现的时候,我们很多人都困惑它怎么赚钱,看上去就没有钱可赚。后来整个广告的事情让人有点意外,至少对我来说,没想到它会变得这么庞大。当然,底层的原因是人们期望东西是免费的。所以谷歌没法向用户收费。但我认为他们在某个节点犯了错误。比如 YouTube,谷歌收购 YouTube 的时候,YouTube 不只是把人指向一个网站。YouTube 是在激励创作者去创作人们会看的东西。在那个时刻,一个有社会责任感的谷歌,容我批评他们一下,应该说:哦,我们在这里创造了一个市场,我们创造了一种生产者与消费者的关系,我们得让这个市场更有效。可以做到:当有人在看东西的时候,他和做出这个东西的人之间可以有某种经济联系,然后激励可以流动,这个人有了自己的观众,就有动力做更多。直接连起来。可他们没有这么做,一切都经过谷歌,谷歌在旁边放广告,为自己赚大钱,然后给出一点点微薄的激励作为回馈。在我看来这是一个巨大的错误。然后 Facebook 把它搞得更糟。
主持人:你和杰弗里·辛顿、伯克利的斯图尔特·罗素这些人有过交锋。他们描绘的图景是:这项技术会递归地自我改进,它是有主体性的,它不是一种文化技术,而是一个自在之物。乍一听,这有点科幻。
乔丹:非常科幻。
主持人:你怎么看?
乔丹:我认为这是科幻。我认为科幻对社会很重要,但以现在这种推销的力度,加上这些声音的分量,它正在实实在在地伤害二十岁、二十五岁的年轻人。这些年轻人数量庞大,他们对技术充满热情,想做出能帮助自己家庭、帮助自己国家的东西。说实话,帮家庭多过帮国家。他们看到了真实的机会。而领袖们对他们说的却是:我们已经玩过了,我们开发了一堆算法,我们做这些只是出于对「理解智能」的纯粹兴趣,尽管他们并没有理解智能,他们造的是梯度下降算法。现在轮到你们了,可你们不能做这个,因为它太危险,它大概率会把人类灭绝;或者,超级智能很快就要到了,所以没什么可做的了。就在你们这一辈子。这太让人泄气了。太泄气了。这是最让我难受的一点。
第二点让我难受的,是那里面没有任何经济思考。零。它完全是认知科学或神经科学的心态:我们搞清楚大脑是怎么工作的了,就是一大堆分布式神经元上的梯度下降。这些大语言模型运转得这么好,就证明我们搞清楚了,否则它们不会这么好。我认为这很可疑。大脑远远超出这些。你去问一个神经科学家这跟大脑有没有关系,他基本会说没有。这是个不错的比喻,一幅卡通画。梯度下降在超大规模上管用吗?管用,比我们任何人想象的都管用。它在显露弱点吗?在。能修吗?某些领域能。你做一些垂直领域的东西,它们会做得不错,会让数学家干活更快,但不会让数学家失业,诸如此类。它对社会有很大影响。我更担心的是劳动与资本的关系,而不是它决定接管世界。
其余的问题,在我看来更接地气:下一代人怎么拿起这项技术,用它工作?我不认为那些声音真的在帮助这一代人看清自己该做什么、为什么做。超级智能还是灭绝,这是你的两个选项。见鬼,这不是仅有的两个选项。在人的尺度上,有大量非常正面的事情可以做。但愿有足够多的年轻人投身其中。可他们没有足够多的榜样,能看到有人靠改善生活赚到了钱。山姆·沃尔顿算不算,不好说。我想在前几代人那里,更多一些这样的例子:这些人做出了疫苗之类的东西,哦,我想成为那样的人。而现在,不太行。
主持人:我想请你当一分钟心理学家。我不知道这是不是对意义的追寻,但你有没有注意到,有些人相信会有一个乌托邦式的未来?跟他们聊,你会发现他们的基因很相似:他们也认为它会递归自我改进、会变成超级智能等等。这些东西确实太聪明了,这我能理解。但如果我追问你,他们为什么相信这些?
乔丹:这些东西在某种意义上确实聪明,在某个层面上是我们认得出来的那种聪明。它们把所有人类的聪明才智收拢起来,用一种新的方式打包。而我再说一次,我认为它总会差那么一点意思,因为它不在当下,它不是那种转瞬即逝的东西。但这不意味着它不能变得更聪明。我觉得这没什么。对我来说,这里的目标从来不是造一个超级智能,让它来发号施令或者别的什么。从来就不是。有些人似乎认为这一直就是目标,我感到震惊。在我看来,从来不是。
相反,我一开始就说过,人是美好的。我不愿看到机器人取代我们,我也不认为那会发生。人性里有太多好东西,人能创造出令人震惊的美丽、创造力和灵感。我们要支持这一切。但问题的另一面是,我们远非完美。人会真切地伤害很多人,而且他们正在被赋能去伤害更多的人。我们非常狭隘。我们也不理解彼此。人伤害别人,常常是因为不理解对方的动机,产生了误解。有多少战争是因为一方不理解另一方的意图而打起来的?他们说,那我们就先发制人,炸了他们。这种事无时无刻不在发生。人就是这么行动、这么思考的。这里缺的是对不确定性、对信息信号的体认。后来博弈论出现了,帮人们把这些想得稍微透一点,但依然极其粗糙。
看看我们的政治制度:一个年迈的骗子在领导一个国家。这就是我们优化出来的、用于做最高层级决策的人类制度。人这种东西有太大的改进空间。民主必须是那条路,但眼下的民主,是几个年迈的人坐在各国首都的各种圆顶大厅里,大多数时候不知道自己在说什么。我们的人类制度在很多很多领域是坏掉的。有几个还不错:我认为大学还不错,很多公司还不错,各种规模的很多人类社团还不错。但坏掉的太多了。
所以对我来说,这才是人工智能的意义。人工智能是要去帮助那些对人类来说太难的事,去辅助信息的流动,让人们能在当下做出他们中大多数人真正想做的好决定,而不是做出那个因为知道得不够、害怕之下觉得不得不做的坏决定。如果你在这个层面上思考,机会太多了。这才是人工智能对我的意义。人工智能不是用计算机取代人。至于递归自我改进那一套,在我听来就是比喻。我们跟递归算法打交道,跟不断改进的算法打交道,我看不出它会像病毒一样失控。我们会和这些系统一起工作,而且,就像我说的,但愿我们主要专注于把那些演化没有给人类调整好的东西调整好,尤其是在七十亿人的尺度上。演化大概没有为这个尺度做准备。专注于此,在我看来才是人工智能可以承担的事。所以我是乐观的,在这个意义上我看好人工智能。
而我对现在的对话感到震惊:一边是手握所有资金、只想为了造而造的人,另一边是反智地喊着「太可怕了,它要毁灭全人类」的人。这就是眼下公众视野里的对话。我觉得这太有害了。让我不安的还有,那些在这上面干了这么多年的人,竟然认为我们已经到了终点:梯度下降就像大脑,所以你可以拿好几个大脑把它们融合起来,天哪,它会做出不可估量的事情。这纯粹是科幻。不管它是真是假,都不值得去想。该想的是路径:我们怎么让年轻人去做正面的事?你要谈什么机制?什么教育?设什么目标?而那些思想领袖谈的完全不是这种语言。思想领袖朝这两个方向出发,我认为这在人类历史上是不寻常的。
主持人:这也很复杂,因为任何自主软件在没有人直接监督的情况下做事,都存在非常真实的安全风险。所以我们应该说……
乔丹:是也不是。想想飞机,这是经典的例子。现在大规模的空难非常非常少。我小时候空难很多。这要归功于自动驾驶仪。现在飞机大多是自动驾驶仪在飞,人在需要的时候介入。正是因为这样,自动化与人的这种混合,才是最有效的路。它又一次是在改进:人类不是演化来开着这么大一个东西在天上飞的,所以你可以在这方面改进人的能力。把二者放在一起,你就能做出对所有人都有帮助的东西。
主持人:我猜那种情况下问题定义得比较清楚,我们要从 A 到 B,这是参数。
乔丹:是也不是。天上有很多架飞机,有云,有变化的天气,有某个人干了蠢事。它容易一些,是因为天上空间大,三维比二维宽敞得多。而在二维的地面上,这么多车跑来跑去,每个国家每年有几万人死于车祸。在某个层面上这是一团糟,尽管它对我们很多人来说很重要也很有用,所以我们还在开。但一个有大量自主性、加上一些人的介入的混合系统,你得在系统层面上思考它。光是把一个超级智能放到方向盘后面,这是思考技术的一种愚蠢方式。
主持人:还有希望吗?我不知道你觉得什么东西能让这些人更新看法。
乔丹:顺便说,我认为伊利亚他们做了一些很了不起的事。他们造出的系统,我们所有人不仅在用,它还在改变我们的思维。我从他们的话里读出来的大概是:我是个建造者。你以为我是个教主、思想家,也许我自己也这么以为,但也许我其实更适合做建造者,我能用现在可以拿到的资源把东西造出来。而且不只是钱,是整个互联网,是前几代人做的一切。这些人让我很不舒服的一点,不是说埃隆·马斯克、山姆·奥特曼这些人,他们只是进来把别人努力的成果上面那层奶油撇走。很多当年做出这些东西的人,他们并不是要功劳,他们只是恼火:这些人把它带往了这样的方向,却不理解当年的人为什么要造这些东西。不是为了你们,他们心里有别的目标。
所以,是的,这里有一些建造者,有些非常出色。但有一个我们称之为硅谷的系统,这些人生活在其中。在那里,你的语言越离谱、越天马行空、越带着物理学、生物学、神经科学的味道,你就越像一个教主。人们享受那种姿态和那种活动。它带来巨额的财富。他们也许不在乎财富,但财富让他们更显赫,因为他们现在可以再开一家公司,再试一件疯狂的事,还是没问题。而作为工作成果,那被当成你曾经有过一个伟大想法的标志。我不想活在那个世界里。
我正在试着做一点历史学家的工作。我提到过化学工程、电气工程,回看历史,这类东西也有过一些苗头。但我认为,眼下这种脱离现实的程度,在人类历史上是不寻常的。「我二十五岁时那些疯狂的科幻梦想,就是我余生要追求的一切,不管发生什么」,然后到了某个时刻他会翻转过来,因为他意识到,糟了,我其实根本没有一个好的目标。我手里有什么?我花了一大笔钱,造出了这个东西,我不知道该拿它怎么办,而且我开始为它担心。坦率地说,在我看来这是某种不成熟的表现。
主持人:回到你说的「统计契约理论」,也就是在存在信息不对称的情况下对激励建模。观众里很多人听说过博弈论。这两者有什么区别?
乔丹:博弈论是一门学科,一门数学学科。它始于二十年代的冯·诺依曼,有很多分支。它其实是一种数学的思维方式。我喜欢这样看它:它像 F=ma,是一套会做出预测的东西。如果我写下一个博弈,就像我在某个坐标系里写下 F=ma 一样,我就能预测会发生什么。对于 F=ma,我积分一个微分方程;对于博弈论,我写下博弈,算出纳什均衡,或相关均衡,或别的什么均衡概念,然后说:自然界会发生的就是这个,因为我这个小小的数学模型抓住了恰当的要素。对于 F=ma,是的,物体沿抛物线运动,说明理论是对的。然后爱因斯坦说不完全对,他做了一个更好的。博弈论也一样。你去看,这些均衡真的刻画了系统、组织和人的行为吗?有时是,有时不是。但这些不是终点。还有各种各样别的均衡,斯塔克尔伯格均衡、序贯均衡,各种品质指标、各种社会福利构造、各种遗憾构造等等。这本身是一个庞大的领域。我们可以设想它最终会像物理学一样大,因为它研究的是策略互动,只不过不是分子之间的互动。
你也可以问反问题。在物理学里,反问题是:我要造一座桥。我的目标不只是看某个东西是否沿抛物线飞行,我要那座桥立得住。于是我反过来用 F=ma,从目标倒推回能保证桥立得住的设计。大多数工程领域都是反问题,从目标倒推设计。而正方向是科学:这是设定,这是预测,预测实现了没有?实现了,说明模型是好的。
那么博弈论的反问题是什么?在经济学之外,谈得也许不多,博弈论听起来像是包揽一切。博弈论的反问题叫「机制设计」(mechanism design)。机制设计说:我想要世界上出现某个结果,比如那个人得到报酬,财富被平均分配,有某种公平,或者创造出某个市场。我该设计什么样的博弈,才能让这个结果实现?我是博弈的设计者,而不是把博弈当成给定的、只去看它预测什么。机制设计也有很多分支。我做的是契约理论(contract theory),它是机制设计的一部分。它问:如果有两个实体互动,它们不对称,一方比另一方知道得多,而它们必须互动,怎么办?这是契约理论。拍卖理论是机制设计的另一部分:有一群人进来,我把他们看成对称的,我不知道谁的钱更多、谁更想出价,但我有一个叫拍卖的机制,能揭示他们的估值。结果是最想要那幅画的人得到了它。这是一个想要的结果。
长话短说,博弈论是一门极其丰富、不算太老的学科,一百年了,还在持续演进,不断为我们这些干这行的人提供各种算法思想。我职业生涯里主要是个统计学家,关心不确定性、概率、不确定性下的决策。而当我走向均衡、博弈或经济学的思想时,博弈论就是这种思考中不可分割的一部分。
主持人:你说过我们需要思考的,除了我们已经谈到的激励和集体,另一大项是不确定性量化。机器学习里有一个很棒的领域叫保形预测(conformal prediction),是我大学时的教授弗拉基米尔·沃夫克发明的。我们当年学的是「转导置信机」,那些「奇异度」的度量,比如到支持向量机超平面的距离,你基本上可以算出类似 p 值的东西,得到一个置信区域。
乔丹:其实是 e 值。
主持人:e 值?请展开讲讲。
乔丹:我不想陷进 e 值的技术细节。弗拉基米尔非常出色。我不知道他怎么看自己,但我把他看作一个统计学家,同时有博弈论的背景。他属于菲利普·道伊德、大卫·布莱克威尔那一派,从统计学里溢出来去做各种别的事情。经典地说,p 值是统计学家谈论的一种一次性的量。这要追溯到费希尔:我有一个关于世界上会发生什么的模型,它给出结果上的一个概率分布。某个结果出现了,在这个模型下它看起来非常不可能,那模型一定是错的。这大致就是 p 值,尾概率。问题是,如果你反复这么做,然后挑一路上最小的那个 p 值,那叫 p 值操纵,它在数学上给出错误的答案,在实践中也是。
e 值不一样。它是某个非负随机变量的期望,更一般地说,是一个非负上鞅。你看着证据不断累积,同时确保这些证据的期望在每一步都小于或等于 1。然后你就可以考虑一种乘法式的证据收集:如果期望始终小于或等于 1,它就大致会待在 1 以下;而且它是非负的,它就会慢慢衰减下去。所以在原假设之下,我有一个不断衰减的随机过程。我可以在任何时候看它,断言它在衰减;我可以反复看,反复断言,而且仍然有控制。有一个叫维尔不等式(Ville's inequality)的东西,弗拉基米尔和其他人利用它证明,这在整条路径上都可以被控制。于是我们可以用一种新的方式做统计。这叫任意时刻推断(anytime inference)。我们可以偷看,可以改变,可以收集新数据,可以每天更新着做。非常解放。弗拉基米尔是这方面的领军人物之一。一个 e 值,就是这样一个鞅在某个特定时刻停下来的值。根据可选停时定理,你想什么时候停就什么时候停。
这打开了很多联系。事实上,在我们的统计契约理论里,什么是契约?记得吗,就是服务和价格。这里的服务就像证据收集,而价格也是其中一部分,它是一个随机变量。结果发现,在契约的世界里满足激励相容,当且仅当在统计的世界里是一个 e 值。所以博弈论概率和激励理论之间有一个非常紧密的联系。对我来说,不确定性量化很少只是「这是一根误差棒」,那是经典统计。它更多关乎语境是什么。这里的语境可能是一份契约,也可能是别的证据收集机制。这种思考方式让你向更宽的一类证据收集敞开。
主持人:你论文里有一张三角形的图,我们会放到屏幕上。你大致是说,一角是经济学,一角是计算机科学,一角是统计学。
乔丹:我甚至不用这些学科的名字来称呼它们。周以真几十年前有一篇文章谈「计算思维」。它说,计算机科学发展出了一些比计算机本身更抽象的思维方式:模块化、抽象、接口之类。为什么不教所有学科的所有人做计算思维?我认为这完全正确,很好。但很多算法并不是从那类计算机科学原理里产生的,它们来自对推断不确定性的思考:我如何收集数据,去预测尚不存在的东西?也来自对激励的思考:我如何确保激励到位?我把这两种思维分别叫做推断思维和经济思维。推断思维不只是统计学,很多领域里都有推断。经济思维也不只是经济学,还有各种社会科学家、法律学者等等。
把这三者放在一起,你就有了一个很好的平台,用来培养下一代,也用来解决我们整场谈话在谈的那类问题。只有其中一个领域,也就是计算算法和优化,给我们的是大语言模型。行,很好。但它给不了大语言模型周围的任何语境。激励这一角给你的是我们一直在谈的整个东西。而统计学在我看来是关键,它思考我会犯什么样的错误,如何确保数据受控以免犯错。三者合在一起,它们还会带来各自的伙伴:经济学家和行为心理学家对话,计算机科学家和物理学家对话,统计学家和法律学者对话。有一整套子社群会走到一起。
所以,如果你摆上这个三角形,围绕它去思考,它开始成为思考学术的一种新方式。这是这个时代的博雅教育,是核心。我人文学科的同事可能不同意,核心还是人文。但我觉得人文学科并没有触及这个时代的核心智识问题,那些问题关乎数据、关乎计算。而我想把这些要素摆到位,让这些问题能以一种对社会负责的方式被思考。
主持人:能不能把它讲得更具体一点?你有一个很有名的例子:这是一个语言模型,我问它,你对这个答案有多确定?它的回答往往非常两极,要么是 1,要么是 0。为什么语言模型对自己的置信度其实毫无概念?
乔丹:这你该去问造语言模型的人。他们做的只是预测下一个词,其中没有任何关于不确定性量化的思考。你可以往上嫁接一些想法,但很可疑,往往是塞进一个可疑的先验。你也可以去找统计学家,人们确实这么做了,他们说,好,我把它当黑箱,在外面套上保形预测。这是个好方法,不需要很多假设。是的,没错。但它有一个可交换性假设:数据打乱以后是一样的。我认为这些都非常关键、非常重要,但我更多想的是更宽的语境。
我在你提到的那篇文章里举了一个例子:一只鸭子来到湖边,这是一只统计学家鸭子。它算出来,过去一年里,湖那边的谷物往往是这边的两倍,二比一。现在第二天,我这只鸭子要决定去湖的哪一边。手握这些概率的贝叶斯鸭子会做期望值最大化,以概率 1 去左边。但真实的鸭子不这么干。它们大约三分之二去那边,三分之一去这边。它们在对冲。但这不只是对冲。对冲的话,只是偶尔去另一边就行了,而它们实际上是把比例弄对了。解释是,你没有把这个不确定性的语境想对。不只是你这一只鸭子。你大概演化于一个有许多鸭子的世界。如果所有鸭子都去同一边,显然你就错过了一份资源。那么有没有一种算法能让许多鸭子在这里协作?如果它们都有同样的不确定性,那它们就可以以三分之二的概率去这边、三分之一去那边来抽样。而这正是那个更大系统的一个纳什均衡。所以思考不确定性的正确方式是:在群体的语境里,我该如何使用我的不确定性?这是经济学这一边的另一种不确定性。
经济学里还有一种不确定性,就是我提到过的信息不对称。你知道我不知道的事,你有我不了解的专长。但我们要一起工作,也许我给你一份契约,一份选项菜单。即便我跟你互动了一阵,我可能还是不知道。有些事你知道但不会告诉我。也许你会打马虎眼,撒一点谎,好让我不知道。这不是抽样,这是另一种不确定性。
最后还有我喜欢称之为「来历」(provenance)的东西,更像数据库层面的不确定性。假如我要做一个手术,你是医生,你看了像我这样的人的数据:这样做手术生存概率是多少,那样做是多少。我看了说,很好。但你接着告诉我,这些数据都是十年前收集的。我就会说,好吧,我的置信区间应该放宽。经典统计能谈这个,事实上我会更贝叶斯一点去想它。但现实中没人这么做,数据就是数据。而在一个更大的系统里,数据流动的时候,应当始终带着元数据,标注它有多老,并且定量地纳入不确定性量化。我们现在完全没有做这样的事。
所以可怜的大语言模型,以上这些它基本一样都没有。如果它想开始做人类做的事,就得在所有这些方向上都往前探一探。我们人类在这些方面相当不错:带一点来历,哦,这是旧数据,我打个折扣;带一点语境,哦,这里有个社会环境,我不该跟大���做一样的事,我该随机化;哦,这里有抽样的不确定性。我们几乎无缝地把这些放在一起。而且我们在社会语境里做这些:如果我不知道怎么去城市另一头,我会找一个看起来像丹麦人的人问路。我知道怎么去收集更多数据。可怜的大语言模型,以上全无。那么当你问它「你有多确定」的时候,它该说什么?据我所知,它做的无非是:过去互联网上有人问过某个人,你对你刚写下的那个方程有多确定?那人回答说,我非常确定,因为如此这般。它只是在模仿那类断言。那不是不确定性下的推理。
主持人:如果我们真的有了认知层面的不确定性量化,最主要的提升会是什么?是不是「我知道我不知道某件事,所以我要在那个方向上多做一些认知上的搜寻」?
乔丹:这又回到了统计学的地盘。统计学家一直在研究:岛上有哪些物种?我采样得够多了吗,能不能确定没有新物种了?这些都是统计学的经典领域,最优实验设计。对于那个子群体我数据不够,我在做糟糕的推断。在推断的语境下收集数据,在做断言并反复做断言的语境下收集数据,这是统计学长期关注的东西。所以我认为应该给统计学家记一功,他们处理的是一种主动的不确定性削减。
但对我来说,大尺度上的不确定性削减,来自宽得多的一组部件,比如市场。我在论文里用过一个例子:我想开一家餐馆,像这样的,做披萨,我需要西红柿。如果我每天都得自己去找西红柿,那我今晚能不能做出披萨就很不确定。但因为存在一个市场,有别人去找了,每天就有稳定数量的西红柿。我可以在这个前提上把餐馆开起来。我找到西红柿的不确定性降低了,于是我可以在这之上做别的事情。市场消解不确定性。而它们做到这一点,不是因为有人设计了最优实验,或者跑了什么多臂老虎机,至少不是直接的。而是因为市场确实尝试了各种东西,有激励让人们去探索和利用。
主持人:乔丹教授,很荣幸请到你。非常感谢。
乔丹:我的荣幸。这次谈话我很愉快。
Michael I. Jordan 主张智能本质上是集体性、社会性的现象,AI 应被视为由数十亿人的数据输入与服务需求构成的经济生态系统,而非模仿单一大脑的"人工智能",因此必须把微观经济学(激励、均衡、机制设计)与统计推断结合进机器学习,而"AGI""超级智能"等叙事既缺乏经济思考,又正在打击年轻一代的建设热情。
Jordan 明确表示自己不是 AI 的批评者,而是想"把它做对",对 AI 持乐观态度,但乐观的方向是修补人类进化未能为 70 亿人规模准备好的决策与信息流动缺陷,而非用计算机取代人。他对"人类价值函数"这类顶层设计尤其反感,坚持系统必须允许自下而上、随时变化的偏好表达,因为社会知识是即时且转瞬即逝的,再多 EB 级数据也覆盖不了下一个十秒。
值得注意的细节:他承认 Ilya Sutskever 等人是杰出的建造者,批评的对象是 Silicon Valley 中"越离奇、越掺物理与神经科学隐喻越像大师"的话语文化;他区分 Amazon(有送货上门的真实商务模型)与 Meta;他对"用 LLM 做多智能体就能免费得到经济学"的回应是"这不是好的工程思维",类比 1940 年代化工若不讲原理会炸很多次。关于自动驾驶软件的安全,他以自动驾驶仪大幅降低空难为例,强调人机混合系统在系统层面设计才是正道,而"把超级智能放到方向盘后面"是笨办法。他把市场描述为一种降低不确定性的机制(餐馆不必每天自己找番茄),并强调市场先于资本主义存在,两者不可混淆。他还提到自己观察到大学与不少公司运作良好,但民主制度目前由"坐在各国圆顶大厅里、大多不知所云的老年人"主导,这正是 AI 该帮助改善的信息流问题。

微信公众号