编者按:本文是斯坦福大学医学院神经生物学教授安德鲁·休伯曼(Andrew Huberman)在其播客节目《Huberman Lab》中对李飞飞(Fei-Fei Li)的访谈。李飞飞是斯坦福大学计算机科学教授、以人为本人工智能研究院(Stanford HAI)主任,因主持 ImageNet 项目而被称为「AI 教母」,也是空间智能创业公司 World Labs 的联合创始人。两人同出身于视觉科学,谈话从五亿年前动物第一次「看见光」开始,一路谈到今天的大模型、脑波传感、机器人手术与课堂里的老师。本文依据现场录音编译整理,仅删去口语枝节、广告与寒暄,论证与例证均按原样保留。
休伯曼:你是人工智能领域的顶尖人物,但我也把你看成一位神经科学家,一位计算机科学家。我们有一条共同走过的路,就是视觉科学,而且我们还是斯坦福的同事。所以我想从视觉开始谈。视觉、看见、光,这些东西对于人工智能以及它的走向究竟有什么特别之处?对大多数人来说这两个话题大概相去甚远,可事实上一切都是从这里起步的。
李飞飞:我把视觉看作智能的基石,而且是从两条平行的线索来看的。一条是进化教给我们的:视觉的进化和动物智能、人类智能的进化是什么关系。另一条是计算机视觉与人工智能的关系。我分别来说。
李飞飞:先说进化。我常说,五亿四千万年前,动物第一次看见了光。那是一些简单的海洋动物,三叶虫和它们的近亲。在此之前几乎不存在感知能力。大约同一时期,触觉也开始在动物身体里出现,但没有听觉,没有嗅觉,而且完全没有神经系统。可是最早的感光细胞制造出一种进化的推力,逼着动物往前演化。因为一旦能感知外部世界,你对自己的认知就变了,你和外界的关系也变了。说得简单点,如果你能看见食物,你的生命就不一样了。你会变成别人的食物,同时你也在主动觅食,主动找配偶,诸如此类。正因为有了感知和知觉,动物物种的进化速度极大地加快。化石研究告诉我们,动物第一次见光之后一千万年,就出现了我们所说的进化大爆发,即寒武纪物种大爆发。
李飞飞:再往后看,视觉不只在动物早期进化里作用巨大,在高级智能的出现上同样如此。你我都是学视觉出身的科学家,据估计,人脑皮层活动有一半与视觉功能有关。儿童在发育过程中也是先有视觉,后有语言。所以直到今天,视觉在动物智能的进化和人类的日常生活里都处于中心位置。
李飞飞:与此平行的另一条线:视觉作为人工智能的一个学科方向,在我们所说的现代 AI 时刻里扮演了关键角色,主要有两个方面。第一是算法,也就是神经网络算法。计算机科学家在二十世纀五十年代初就开始尝试神经网络了。安德鲁,你应该记得五十年代初神经科学那边发生了什么:休伯尔(Hubel)和维泽尔(Wiesel)这样的神经科学家开始记录哺乳动物大脑里的视觉细胞,并发现神经细胞有一种层级结构,一层叠一层,把神经信息沿着这个层级传递下去,从视网膜采集光开始,一直到辨认出眼前有一个形状。哺乳动物大脑里的这套神经架构,正是神经网络算法的灵感来源之一。今天的神经网络算法跑着数千亿甚至上万亿个参数,复杂程度早已脱离了我们在哺乳动物视觉通路里记录到的东西,但两者的源头很近,大约半个多世纪之前是同一处。这是视觉对 AI 的第一个贡献。
李飞飞:第二个同样关键的贡献是通过大数据实现的,这和我自己的工作更贴近。世纪之交那会儿,AI 主要就是机器学习这个领域,很多实验室、很多研究者在尝试不同的算法,不光是神经网络,还有别的方法,比如贝叶斯方法、支持向量机之类的术语。这些方法叫什么并不重要,重点是那是一个探索阶段,大家都想让这些算法跑起来,好让机器能读、能看。我们这批计算机视觉科学家被这些算法折腾得很苦。2006 年我在普林斯顿当第一年的年轻教员,我和学生看着这些算法,看到喂给它们学习的数据少得可怜。
李飞飞:于是我转向认知神经科学文献,尤其是视觉方面的文献,开始研究人类到底学了多少、能看见多少。那些数字很惊人。人到六岁能学会数以万计的物体类别,而且接触到的视觉世界也是海量的。婴儿几乎从出生那一刻就开始看,所以他们是被大数据淹没着长大的。我们据此推测,缺少数据是 AI 进展迟缓的一大原因。所以我们和当时只盯着算法的所有人分道扬镳,说我们需要数据,需要用数据来驱动这些算法。长话短说,我们主持了 ImageNet 项目,为人工智能领域收集了第一个互联网规模的大数据集,而且是通过视觉这个领域做到的。ImageNet 收录了一千五百万张图片,目标是让机器认出日常物品:麦克风、杯子、椅子。这项工作后来与神经网络算法的进步以及 GPU 计算汇合到一起。到 2012 年,现代 AI 的三个要素合流,成了现代人工智能的定义性时刻。
休伯曼:我记得大约 2012 年前后,冷泉港每隔一个夏天举办的视觉课程上有过一场争论:计算机能不能像人一样学会辨认特定的人脸。现在我想大多数人会说计算机其实比人强得多,尽管确实存在那种认脸能力超群的「超级识别者」。你能讲讲这项技术是怎么从会把你和你的表亲、甚至只是长得有点像你的人搞混,走到今天这样精确入微的?我们是怎么到这一步的?
李飞飞:我很愿意把这次技术汇合再往深处点几下。大约在二十一世纪第二个十年,也就是你说的 2012 年左右,一个巨大的汇合是 GPU 计算能力:它把计算加速了,或者说并行化了,让更多的浮点运算能穿过算法,你需要这种速度。其次,经过几十年的研究,神经网络算法日趋成熟。像我们说的,从五十年代起,人们就开始造这种行为上有点像神经元、但简单得多的算法。神经元你知道是非常复杂的,而这里的想法只是一个节点单元,接收一些输入,输出一些东西,内部只是一个函数,一个非常简单的函数。把它们堆叠起来,就是神经网络。到了 2010 年前后,这些算法成熟到了真正好用的程度。最后同样重要的,是对大数据的认识。互联网确实推动了这一点,让数据更易得。但真正的转折是那个「啊,大数据必须成为等式的一部分」的觉醒时刻:我们得用大数据来驱动这些算法学习模式。三者汇合,掀起了这场 AI 革命。
李飞飞:既然你提到人脸识别,还有一个具体的时刻值得一说,就是 ImageNet 挑战赛。我们收集了这个庞大的数据集之后,从 2010 年开始,我的实验室连续多年向研究界发起公开挑战,邀请大家来解决计算机视觉里一个重大的问题:物体识别。当时 GPU 还没有成熟。任务很简单:我们有一个包含一千个物体类别的数据集,超过一百万张图片,这是测试集。算法的任务是,我给你看一张图,你要说出里面的主要物体叫什么,猜对得一分,猜错不得分。几年之后,斯坦福一位非常聪明的研究生给人类的表现做了基准测试,人类的错误率大约是百分之四。随机猜的话,正确率是千分之一,所以人类的百分之四错误率算是相当不错。
李飞飞:头几年机器不如人。转折点在 2012 年,神经网络、ImageNet 数据集和 GPU 三者汇合。即便那一年错误率也只是降到了百分之十几,还没到人类的水平。
休伯曼:也就是看图片,然后从一千个标签里挑一个贴上去。
李飞飞:对。但 2012 年之所以如此重大,是因为神经网络算法把先前算法的错误率一下子拉下来一大截。在研究界我们知道,出现这么剧烈的变化就意味着拐点到了。不过我记得又过了三年多,到 2015、2016 年,算法才在给一千种物体命名这件事上打败人类。
休伯曼:我能问问这位聪明研究生的百分之四错误来自哪里吗?是他们认不出物体,还是在时间压力下的识别失误?比如图片喂得太快,偶尔就贴错标签。
李飞飞:我不认为时间压力是主要问题,虽然对一个研究生来说,我想他们也不愿永远干这个活。我觉得人脑的记忆是有限的,不管长时还是短时,所以要记住一千个物体类别的模式并不容易,哪怕有些类别你很熟。所以会有混淆。另外比如说,不同品种的狗长得非常接近,这也是个难点。
休伯曼:我能理解在视觉领域这么做的道理。可听觉、声音这方面有没有做过类似的探索?作为人类,我们非常擅长识别言语的语调、情绪色彩这些东西。但如果让我分辨哪怕十五种不同的声音频率,我作为一个非音乐人可以告诉你,那会非常困难。
李飞飞:当然有。你看到的情形是闸门一开,AI 的每一个子领域,语音识别、声音识别、不止于识别的自然语言处理,还有视觉,全都在技术上得到巨大提升。我们斯坦福有同事在用机器学习和 AI 研究鲸鱼的声音、鲸鱼的歌。语音识别是这场 AI 革命早期做得非常出色的另一个领域。技术当然还在继续往前走。到 2016、2017 年左右 Transformer 论文发表,很快就显示出它比早期的 ImageNet、AlexNet 算法更强。这一次做出下一个大突破的不再是计算机视觉领域,而是自然语言处理。因为配方没变:现在我们有了更强的神经网络算法 Transformer,互联网上有更多的数据,至少是更容易拿到的文本形式的数据,GPU 也更强了。OpenAI 和谷歌这些公司很快围绕这项重要技术集结起来。从 2017 年到 2022 年,又花了大约五年才走到自然语言领域的 ChatGPT 时刻。但这又是往前跨了一步。
休伯曼:对于既不是计算机科学家也不是神经科学家的人来说,人类的日常经验或许更能引起共鸣,让我用这个视角来提问。一个孩子知道有一种东西叫「小猫猫」,就会说「哦,猫」。然后通常会把「小」字去掉,也许先说「猫猫」,再学会说「猫」。如果他和猫有足够多的接触,就会明白猫是什么,哪怕从侧面、从背后看。最后,如果他看见一条有点像猫的尾巴,在几本书后面,你问「那是什么」,他很可能说「猫」。即便他也见过狐狸和其他有尾巴的动物,凭着自己的经验,他在做一个概率判断。这本质上就是 AI 能做的,就是机器学习能做的。
休伯曼:但在我看来,从计算器走到今天的 AI,中间必须发生过一个关键时刻,让机器能看见一张尾巴的图片就合理地推断,如果是在室内,那多半是猫,因为狐狸一般不在屋里。诸如此类。那么机器学习和 AI 是在什么时候获得了这种情境学习的能力,能给出一个东西最可能的归属?给它看苹果、香蕉、橙子,它们都是水果,能区分开,也能把它们和汽车、卡车区分开,这是一回事。可这种物体恒常性,一个东西在移动、你只看到局部影像的时候还能认出它,这是另一回事。大多数人想到智能时不会想到这个,但正是这一点让我们的大脑,以及其他动物的大脑,尤其是我们的大脑如此不凡,也是我们自认为地球上最聪明的物种、至少是最擅长发展技术的物种的原因。AI 是什么时候做到这一点的?这是怎么写进这些计算机里的?
李飞飞:我们就拿这个问题来说。你描述得非常好:瞥见一截猫尾巴,就能认出是猫,或者说认出很可能有一只猫。有意思的是,安德鲁,一代又一代的机器学习和计算机科学家都在这个问题上试过手。在今天机器能可靠做到之前,有过各种算法。你可以想象一种常识式的思路:要不我们先把所有家具认出来,就知道这是室内,于是不太可能是狐狸。这类规则确实被写进过前几代算法。也有另一类规则,比如与其直接猜是猫,不如只在十种可能的动物里猜一种,猫是其中之一,这样缩小了搜索或猜测的空间,会有帮助。很多想法都试过。
李飞飞:那什么时候变得可靠得多了?就是当下这个时代。这些算法学过的海量数据,拿 Gemini 或者 GPT 来说,在机器的学习空间里造就了这样的能力:学到了那么多知识、那么多模式,当一张多少算是新的照片摆在面前,一条猫尾巴从书架外面伸出来,这个模式激活了我们所谓的已学习权重或参数,把机器对这个物体的判断推向它见过的东西,而它见过的多半是猫尾巴,或者至少是尾巴。因为数据实在太多了。
休伯曼:明白了。
李飞飞:安德鲁,作为神经科学家,我想这里正是我们与人脑分道之处。那个学会认「小猫猫」的孩子没有机会把互联网上所有猫的图片下载下来。他可能只见过三只猫,最多十只,可他却能通过一条不同的学习路径把那条尾巴认成猫尾巴而不是狐狸尾巴。这些是我们还没有完全解开的谜。但我确实想指出,今天用海量数据学出来的 AI 算法,与人类进化出来的方式,存在这样一道分野。
休伯曼:如果我们继续沿着这个层级往上走,从简单的物体识别到你我所说的高阶脑功能,走向大多数人听到「智能」这个词时想到的东西,创造力、想象力之类。我们先走到一个中间台阶,再走到更远的一步。还是用猫的例子。如果一台计算机或者一个孩子通过尾巴或者整体学会了认猫,而且见过猫移动,那么对那个大脑、那个孩子或那台计算机来说,一个全新的世界就此打开。因为现在他们知道猫通常朝着头的方向走,而不是尾巴的方向。这些都是非常简单的学习规则,对吧?猫可能去追老鼠,也可能躲开狗,也许是,也许不是,可以一直列下去。所以在所谓「智能」的下一层,似乎是给移动的方向、不会移动的方向、这个物体可能与之互动的其他物体分配可能性。对普通人来说这听起来非常基础,可这就是大脑学习的方式,也是机器学习的方式。所以,下一个大拐点是在什么时候?就是给 AI 一张猫的图片,说:把这只猫动起来,让它像猫一样动,却不给它任何关于四肢怎么动的具体指令。我想那大概来得很快,但对于我们称为 AI 的这整件事来说,那是一次极其重要的转变,因为大脑做的就是这个。
李飞飞:你这么问很有意思,而且说得很漂亮。我从来没想过对公众这样表述,但那个时刻,就是视频成为训练数据的时候。你看,我又回到训练数据上来了。大约在 2023 年,ChatGPT 时刻之后不久,多个研究团队开始把视频放进训练数据。算法上当然有一些细微的调整和变化,我不展开。记得 2024 年 1 月 Sora 发布,人们第一次看到视频可以被生成出来,正是你刚说的那样。你可以打字说「一只猫朝一只老鼠跑去」,然后生成几秒钟的片段,里面有一只猫以合理的方式动着腿,朝老鼠跑过去。当时还有错误,直到今天也不完美,但已经好了很多。这打开了你所描述的视频生成的闸门。
李飞飞:那里究竟发生了什么?其实没有你想的那么革命性,因为归根结底,还是数据。作为科学家我可以告诉你,算法上有各种调整、改动和改进,但如果拉远了看,这仍然属于这个伟大的神经网络时代。发生的事情是,我们现在能够处理视频数据了,靠一些巧妙的工程,叫「token 化」也好,随便叫什么,然后我们就能生成这些短视频片段,也就是把帧接在一起,看起来像是合理的猫的动作。你可能会问,算法知道猫腿的肌肉结构吗,才能让猫爪按顺序合理地动?我会说算法不知道。但它有的是互联网上那么多视频,尤其是猫的视频,多到它学会了那应该是什么样子。某种程度上人也是这样。我们大多数人没受过专门教育,不知道猫的肌肉是怎么动的,我到现在也不知道,医学院的同事可能知道。但我们看猫这么动看得太多了,对猫怎么动有了一个合理的概念。AI 与此相似,就是统计,就是海量数据告诉你,怎样生成猫的动作才合理。
休伯曼:所以当人们听说大脑是一台预测机器、一台学习机器时,你指的就是这个。
李飞飞:是的。
休伯曼:我们跳到脑功能里非常远的一端,我们知道人类确有的东西:思想和创造力。思想和创造力大概也有规则,只是比视觉系统的例子难钉住一些。比如「如果是尾巴、又在室内,那多半是猫」这类规则,在思想和创造力里也是有的。拿苹果举例,我们可以从低层次的「看见一个苹果」,到中层次的「苹果总是往下掉,不会飞走」,再到最高层次的「支配苹果运动的方程是什么」。这是往更高阶、更还原论的分析上升。
休伯曼:我想问你怎么看这样一个想法:AI 确实是智能的,能做大脑能做的事,甚至能做单个人脑做不到的事,这一点从它在国际象棋上赢过人类就知道了。可就我的理解,现在的 AI 是在互联网上训练的,图像、讨论、视频、歌曲,但那并不是人类认知的全部。那么,不论是 ChatGPT、Claude,还是尚未发布的最强机器学习工具,是否存在一些人脑功能的特征,AI 至今无法触及,因为它们从来没被上传到互联网,至少没以 AI 能提取的方式上传?比方说,你可以把一首交响曲放上去,它遵循某些音乐、数学和声音的规则,说得通。可你整天都有念头,我也整天都有念头,那些念头和语言并不完全咬合,我没法把它们直接打出来放到网上。请跟着我,我知道这个问题很长,但我觉得这正是你最适合回答的一件事,自一年半前在犹他见到你以后,我一直等着问。艺术领域有一种叫「抽象」的东西。偶尔有人画出一幅画,它不像任何具体的东西。音乐里也有,你就是感觉到了什么,像是触到了某种根本的规则或者情感。他们接通了脑功能的某个方面,但你说不出那是什么。我觉得这类东西对 AI 来说很复杂,或者说我很难理解 AI 怎么能做到,因为你可以把那件艺术品放进 AI,问它「这揭示了人类经验的什么根本特征」,可它只能接触到互联网上的东西。那么,怎样用 AI 去捕捉一整团复杂的感受和体验?这对我来说是一道鸿沟。我相信 AI 终会走到那里,但我看不到从神经科学到 AI 有任何直接的路,不像我们可以一级级从视觉运动、悲伤、快乐这样爬上去。很多东西能拆出来,但那些说不出、写不下、画不了的高阶抽象表征,很难触及。如果我说「给我讲讲你对童年老家的怀念」,你可以写下来,但那只是文字。我无法以第一人称去理解你的体验。
李飞飞:完全同意。安德鲁,我知道你在这个问题上花了很多心思,这是一个非常重要的问题,我们一层一层来剥。首先,简短的回答是:我同意你的看法,我们必须非常谨慎地认清 AI 能做什么、可能做什么,而不是去揣测一百年以后的事。我承认你刚说的这些是极其细腻、个人化、难以刻画、甚至根本没被捕捉过的人类认知行为。正因为没被捕捉,它们没被上传到互联网,而今天的 AI 没有办法触及它们。
李飞飞:所以当你说「互联网」是 AI 数据的来源时,我们要弄清楚互联网到底是什么。互联网不是什么随机的东西。互联网是人类行为以多模态形式存在的最大集合。再拆开看:全世界的人口在上面打字,到现在已经打了几十年。打字是一种感知机制,捕捉了从青少年闲聊到深奥的科学论文的一切,只要被数字化、上传。所以捕捉人类语言是互联网极其擅长的。然后互联网捕捉图像。怎么做到的?因为我们有了数码相机,智能手机里到处都是,人类又爱拍照,从家里的猫到自拍,再到 BBC 拍下的美丽照片,这些也进了我们的数字空间。再往上是视频,视频有声音、有动作,也上传了。再往上还有音乐。我们先不谈版权那些法律问题,我只说数据的形式。演讲、歌唱、音乐、管弦乐,也进了数字空间。于是我们造出了这样一座巨大的图书馆:文字形式的人类知识,视频形式的人类行为,声音形式的人类表达乃至自然的声响。AI 就在这上面训练。这就是它为什么这么强,尤其在文字方面,能识别模式、合成模式,因为那么多东西早就摆在那儿了。
李飞飞:可你刚才说的那种东西,比如毕加索对于以某种特定方式表现那位年轻女子肖像时产生的那个极其深刻的念头,那个念头从来没被捕捉过。事实上,作为神经科学家,如果我问你那个念头来自哪个脑区,你也不知道。是布罗卡区?是 V1?是运动区?是前额叶?我们不知道。也许弥散在各处,因为那个念头如此个人、如此特殊。你可以叫它创造力,叫它情感,叫它任何名字,叫「猫 231 号」都行。那个念头没有被捕捉,所以不在互联网上,所以 AI 没见过。这就是人类依然独一无二的地方。
李飞飞:但我们也得给 AI 应有的评价,因为它学了那么多东西,能以高度创造性的方式组合信息。你记得第 37 手吗?
休伯曼:AlphaGo,对。
李飞飞:第 37 手已经成了 AI 创造力的象征。我认为这既是真的,也容易被断章取义。那是 AlphaGo 对李世石的比赛,我想是五局中的第三局,AlphaGo 作为一个计算机算法走出了一手人类围棋大师从未想过的棋。那确实是不可思议的一手,因为人类集体,那些大师们,从未想到过。但如果你深究 AI 在那里做了什么:首先围棋是一种高度数学化的游戏,目标在数学上非常清晰,落子规则也非常清晰。当 AI 有更大的算力,又有办法记住更多步数时,它就能做到人脑通常做不到的事。这算创造力吗?我认为算,但我们必须承认那是一种特殊的创造力。
李飞飞:我和当代一位杰出的数学家聊过,问他 AI 能对数学里的未解难题做什么贡献。他很乐观。他说,今天数学里有很多难题,虽然难,但也许存在已知的方法能解决它们,只是我作为一个菲尔兹奖得主也可能忘了。因为我有的是一颗人脑,我不记得、也不知道过去几百年里所有的数学解法,哪怕我是菲尔兹奖得主也一样。所以 AI 能帮我们解决这些问题。可作为数学家,他也告诉我:我不知道 AI 能否解决所有的数学问题,因为其中有些问题需要的解法尚未被发明,那会把创造力推到一个完全不同的层次。这正是我们应该好奇的地方:那会是人类的创造力,还是 AI 通过一轮轮迭代改进,达到一种人类没有的创造力,还是一种合起来的创造力?我目前的推测是混合式的:人与 AI 并肩工作,帮助我们解决那些解法尚待发明的问题。
李飞飞:至于你说的,尤其是情感,那就更个人化了。这不一定是逻辑,不一定是演绎推理。也许,安德鲁,你看着这只杯子,说这是一只好杯子。可要是它在我心里勾起了一种情绪,一段童年的时刻,一只灰色的杯子意味着某件只有我和我最好的朋友共享的事情呢?那是我大脑里一条完全无法触及的信息,从未上传到互联网,今天的 AI 不论多么强大都拿不到。所以我对这只杯子的反应,以及我因为那段记忆而可能拿它做的事,可以完全不同。你可以叫它创造力,叫它表达,叫它讲故事,怎么叫都行。但那是 AI 触及不到的地方。
休伯曼:我觉得在不太远的将来,计算机会以非侵入的方式获得我们的大脑活动。我甚至可以想象,五到十年后,我头上戴着一个东西,你看不见,一个非常细的发网之类,一些电极就搁在头骨外面,不碍事,感应我脑内的活动,也许还感应我的心率、自主神经活动、我的警觉程度,然后拿这些和我说的话、做的事做比对。这完全在可及范围之内,一定会发生,你我都知道。这大概已经开始让人害怕了,但我们把它保持在善意的框架里。想象一个世界:有一台我自己拥有的计算机,我不担心数据外泄之类的问题,那些我们可以设法解决,它在感应我的这些方面,并且察觉到,我说的话固然重要,但我的内在状态和大脑活动里有一些东西连我自己都没意识到。
李飞飞:对。
休伯曼:我可以决定和这个「我的一部分」合作,说:我们来做一幅我从没见过、却来自我某段重要经历的有趣图画。它可以把这个揭示给我,因为它接触到了我大脑活动里无意识的部分。我认为这在不远的将来很可能发生。如果人们把它放在自己经验的气泡里去想,这东西不会立刻传到互联网上,也不会被用来对付自己,你其实是在了解自己。我相信大多数人天生对自己身上发生的事有兴趣,也对别人有兴趣,谢天谢地。我很想知道为什么我在某些方面老是出岔子、过得不顺,为什么有些日子又特别好,我的想法从哪里来,我可以在哪些状态里深耕。但我不知道怎么做到,只能靠:一杯咖啡不错,一杯半更好一点,两杯就过了。想想我们现在做这些事的方式有多原始,简直疯狂。每个人都有自己的办法,都在试着搞对,等到搞对的时候你已经老了,又得重新更新。我们现在很可能根本没有把自己的生物机能和大脑用到最好。
李飞飞:没有。这就是为什么我一直在说,有些人谈 AI 的方式让我不舒服,他们说得好像 AI 是在取代人类。而你描述的,是增强和扩展人类。这甚至不必科幻到用一个智能发网去读你的脑波。仅仅是让 AI 学会你的写作模式,就已经能帮你成为一个更好、更有效、更高效的沟通者。这是今天的 AI 就能释放出来的一种赋能。安德鲁,我认为作为神经科学家和大学教员,我们都知道最重要的一点是:主体性(agency)对人类至关重要。它归结为每一个个体层面的动机、主体性和尊严。我们必须认识到,要把 AI 当作一个帮助我们发挥主体性的工具。它不应该拿走我们的主体性,而今天领导 AI 的人也不应该用那种口气说话,好像这项工作会把人的主体性拿走。
休伯曼:对技术非常熟悉的人,不管是计算机、生物学还是汽车这样的任何技术,都会变成那件事的极客,然后忘记它对别人来说可能是可怕的,也忘记围绕它的语言是至关重要的。我记得九十年代初,你肯定也记得,基因检测曾被当成那样一种东西:你愿意做吗?你愿意验血吗?天啊,你可能看到什么真正吓到你的东西。现在同样的讨论发生在自选核磁共振之类的事情上。这些都没人强迫你做。我的立场是信息越多越好,但我逐渐明白不是所有人都这么想,有些人不想知道。
李飞飞:他们不想知道,但他们应该有选择的权利。与此同时,我们应该有足够的公众教育和沟通,让人们知道利弊,而不是剥夺他们的选择,也不是说:既然你不懂,那就让我替你决定什么对你好。那样不好。围绕 AI 的言论现在变得非常扭曲,因为懂这东西的人往往对公众居高临下地说话。不管动机是正面的还是负面的,那种话语都是「你们不懂这是什么,我来告诉你们,我会让你们快乐、安全,随便什么,我替你们决定」。这既不健康,也没有帮助。
休伯曼:我同意。我开这个播客的原因之一,就是想展示那些真正心怀善意的科学家和医生,他们没有兴趣把东西讲浅,但他们有兴趣让人们理解事情。很多人会觉得健康信息属于最值得理解的事情之列。谢天谢地,你正在打破你刚描述的那种类型。还有另外几个人,但你一直在最高的层面上做这件事,鼓励人们去思考 AI 这种协作、去思考存在的主体性、去决定用还是不用。
李飞飞:主体性的一层,我认为对每个人都很重要,不管你是学生、老师、医生还是决策者:去了解它。不一定要学编程,我不认为那是必需的,看你的工作。比方说你是艺术家、老师或医生,你不一定要写代码,但要了解这项技术是什么,了解你自己怎么用它来赋能你的学习、你的工作、你的表达。通过学习,人会觉得更能掌控;通过学习,你不那么害怕去尝试;通过学习,你保住了那份主体性和尊严。因为说到底,不论技术或医学多么先进,作为人,我们想要的是那种帮我们活得更好、保住尊严、让社区更好的善意。
休伯曼:技术可以是连接者而不是分隔者,这个想法必须放在讨论的中心。这个领域的大名字们,我们都知道是谁,有好几位,他们也处在一个成长过程里,在学习如何面对公众,而且这发生得非常快。显微镜对着他们,摄像机对着他们,每一点细微的失当都被放大。我愿意相信他们会足够快地成熟起来,认识到公众需要听到正确的、真实的信息,但要用让他们听得懂的方式。医学界和学术界有一个「肮脏的秘密」,你打破了它,我也愿意相信自己打破了它,那就是:不分享事情的运作原理,本身是一种权力。
李飞飞:没错。
休伯曼:但到最后这对谁都没好处。你把帷幕拉开,让人进来,人们会感到更安全。
李飞飞:不分享是一种权力。还有一种权力是说「相信我就行,我会告诉你」。而作为教育者,这两种我们都不做。我们不会走进课堂说「相信我,二加二等于四」。我们说的是:这是怎么拆解的,你来学一下,下次你就能自己做了。我还认为,你的播客作为公共传播和知识教育的一部分非常重要。我们也需要听到不同背景的声音。有很多学者、技术人员、建设者和思想者一直在研究 AI、使用 AI、认真思考如何用 AI 来赋能人,这些声音非常重要。
休伯曼:接下来我想谈一件几乎所有人都会同意「如果存在就太好了」的事,而且它已经开始发生:用 AI 推动健康领域的发现、疾病的治疗等等。回到前面 AlphaGo 的例子,大家肯定也还记得猫的例子,它们都遵循某些规则。AlphaGo 的规则很复杂,但学会之后就是一组有限的规则。猫这件事看起来不受约束,像有无限可能,但也约束到了机器和人类都能学得很好的程度。
休伯曼:一旦进入医学,医学有规则,科学有规则。你有一个问题,提出一个假设,检验这个假设,试着排除它,等等,这是科学方法。医学里每个领域都有自己的方法。我们观察,观察疾病,观察谁康复了,写病例报告,做随机对照试验。所以有规则,而互联网知道这些规则。所以大语言模型可以很好地用来挖掘健康信息,因为规则是有约束的。但我想你我都知道,我也把你看成一位生物学家,生物学的规则还在不断向我们揭示自己。这不是说皮肤科医生、神经外科医生和肿瘤科医生不知道自己在做什么,而是他们是在自己学过的一组有限的规则之内工作。即便他们不断学习、更新,现在似乎每个月都有一个发现出来,打破了规则。
休伯曼:比方说我学到的是动作电位是单一的,形状总是一样,要么放电要么不放。可十二年前有一篇论文表明,动作电位的形状可以变化很大,发在《自然》上。大家都看到了,然后没人愿意去处理。太麻烦了,它改写了规则。神经元应该要么是分级的,要么是全或无的,全或无写在每一本教科书里。现在如果我拿一堆神经活动,告诉它这个规则:同一个神经元里动作电位可以大也可以小,那就把我们对神经科学的一切理解全搅乱了,我们对大脑的理解就崩塌为零。但如果你给 AI 这条规则,这个信号可以有一百种形状,AI 大概能比最好的研究生做得多得多,哪怕是斯坦福的,或者公平地说,麻省理工或加州理工的,我不认为研究生能做到,而 AI 能在我问这个问题的时间里做完,尽管我承认这个问题有点长。所以我想听你说说:医疗领域的人、普通公众和 AI 怎样协作来攻克疾病,最好还能提出新的发现规则,让我们最终在一个能真正改善人类进程的层面上理解自己的生物学。
李飞飞:安德鲁,你大概触到了 AI 最激动人心的用途之一:科学发现。在生物医学的情境里,科学发现直接关系到人的健康与疾病。我认为我们已经准备好彻底改写科学发现的做法。因为长久以来,我都说不清有多久,科学发现依赖聪明的人记住从其他聪明人那里学来的东西,然后以我们自己肌肉的速度去做事。当然有超级对撞机之类的东西,但总体而言,在科学发现的方式里,人脑或者说科学家的大脑是唯一的中心角色。
李飞飞:现在我们有了一个新工具,它的「大脑」能保有海量信息,能帮我们综合知识,能以你我做不到的方式跨越学科。比方说我们恰好都在视觉、神经科学、AI 这个领域。我对嗅觉一无所知,零,我们同事知道的那些词我大概连拼都拼不出来。我们的大脑要跨过去太难了,但现在有了一个能把它撬开的工具。所以我认为我们必须改变,必须用这个工具。我刚在想,大约一百五十年前,我不确定具体是什么时候,电改变了我们生活里的一切。我相信那也是一个人们在思考变化、机会和恐惧的时刻。我认为我们必须认识到,科学发现是 AI 和健康领域最激动人心的机会之一。信息怎么被综合,怎么呈现给临床医生,也呈现给患者,患者怎么参与从诊断到治疗的过程,现在能做的事太多了。
休伯曼:我不会说 AI 比所有医生强,但几个月前 AI 帮我把眩晕和低血压区分开了,而搞错的人里有一位专门研究前庭系统的耳鼻喉科医生。
李飞飞:你提供了什么信息?只是你的主观感受?
休伯曼:我一两天里的主观感受。后来发现是一位医生给我开的药,我出现了轻微但确实的不良反应。那种感觉很怪,一迈步就觉得整个世界往下掉,然后开始转。我想,天啊,这像眩晕,可我记得头晕和头重脚轻是不一样的。于是我开始查,果然是血压问题,那种药把我的血压压得太低了。我咨询过几位聪明的医生,我得说实话,他们都不在斯坦福。
李飞飞:我们要在学术上诚实。
休伯曼:但这实在了不起。我把结果反馈给他们时,他们说「这太不可思议了」。公平地说,他们的意思是,你要不是在电话上而是在我的诊室里,我本可以做些额外检查。可这是零成本的。一个上午我就知道了:如果我喝一些电解质,喝到我原以为过量的程度,两小时后就会好。当然这里有安慰剂效应的可能,但两小时后我确实好了。对患者来说这也是极大的安慰。这不是说别去看医生,但这太不可思议了。这东西现在就存在。
李飞飞:医生也可以用这个工具。顺便说一个很有意思的例子。你知道我们这次谈话改过期,因为我父亲当时正在斯坦福做手术,主刀的是一位非常出色的外科医生。但手术是由机器人完成的,达芬奇机器人系统,因为是肝脏手术,那位出色的外科医生在操控机器人。这是一次深度的人机协作。手术后我问外科医生:假设你做过一百万例,这对人类外科医生来说不可能,但假设我们把全人类外科医生做的这类肝脏手术的数据都收集起来,能不能训练一个自动 AI 来做这个手术?答案并不明确。于是我们往深处聊了聊。肝脏是一个非常复杂的器官,血管极其丰富,而且每个人的肝脏都很不一样。考虑到每年做肝脏手术的患者数量,即便把全世界的肝脏手术汇总起来,数据可能也不够训练这些算法。
李飞飞:这说明一个非常重要的事实:AI 从模式中学习。当模式不够丰富时,我们就必须谨慎,必须知道怎么用 AI、怎么不用 AI。在这个例子里,人与机器人协作远远好过一个学得不够的机器人自己做手术。但同样的问题对外科医生也成立:一个外科医生一辈子能在多少台手术上练手?所以这些都是人与 AI 可以充分协作、并可能得出最佳结果的机会。未来还有待观察:我们能不能造出一个人工模拟的肝脏,在上面训练无限多的可能?这些都是摆在前方、极其开放的科学可能性。而像你那种情况,眩晕对低血压,很可能已经被报告过太多次,数据库里足够多,AI 学会了。那么对于无法立即见到医生的人,我们就可以利用这一点。
休伯曼:太好了。你父亲的手术顺利吗?
李飞飞:顺利。而且出血量只有常规手术的十分之一,这要归功于机器人手术的腹腔镜能力。
休伯曼:我想谈谈一些我们认为人类独有、但也许并非如此的特质。你来告诉我。这些是真诚的提问,不是设套。然后我也想了解,AI 的结构是怎样允许这些事情发生的。比如直觉。我们都愿意把直觉想成某种神秘的、确实强大的东西,一种属于我们、谁也拿不走、没法模仿的东西。但我也可以把直觉拆开来看:它是我长期积累的经验,是一个数据集,加上一些身体和大脑的感觉,再加上一些预测线索,比如上次我有这种感觉时发生了那件事,前两次我有那种感觉时事情没有那样发展,所以这次我走这条路。这些规则是可以写给计算机的。但我们更深层的自我,如果可以这么说,还有别的方面。我们不知道直觉映射在身体的哪里,可以做成像实验,但你不可能同时采集所有神经元、所有激素和一切。那些没有一个位置、甚至没有一个网络可以指认的东西,比如创造力、直觉、预感,那种你真切感到有什么要来、但还没发生的感觉。
休伯曼:AI 能得到什么样的规则,让它具备这类能力?这里我想放在「能量」的语境里谈。不管这东西是什么,它就像线粒体推动细胞更多地围着一件事转而不是另一件,恐惧或快乐也会这样。在 AI 系统里,我不是计算机科学家,在 AI 系统和 GPU 里,我们能不能实际给特定的学习规则分配更多的能量流?这样也许某一天我们可以说:基于你对我姐姐的一切了解,我爱她,你直觉上认为我们的兄妹关系会怎样演变?你觉得今年生日我们做点什么会很棒,和以前不一样?它只能接触互联网,它真的能变得像心智、像身心一体,形成一种对什么真正值得做的感觉吗?还是它只需要越来越多的提示,不停地反问我,结果实际上是我在干活?
李飞飞:很有意思的问题,安德鲁。为了论证方便,我想把直觉和创造力分开,也许最后再合起来。先谈这种直觉:考虑到我对手足的爱,会发生什么。这真的是直觉吗?今天你去用一个 AI 聊天机器人,你会输入:我是斯坦福教授,神经科学家,给我这个信息。这个东西已经有名字了,叫「上下文」(context)。我不知道你会不会叫它直觉,但因为你给了那条信息,AI 给你的答案就已经不一样了。如果我输入我是个十四岁、喜欢赛车的少年,即便问同一个问题,它也会给出定制的答案。这是一个数学事实,我不会称之为能量。这些算法就是这样接收上下文并调整输出的,就叫上下文,在计算机科学里没有那么深。这是一种相当浅的直觉,因为你已经能用语言描述它,或者说我上传一张图片,那也是已经可以表达的东西,AI 就能接住。
李飞飞:而你说的更深的直觉,是你连它从哪来都不知道。是因为我闻到了什么?是激素?是情绪的混合?是我的早餐?那种直觉,AI 能拿它怎么办?我会说那是无法触及的。目前没有任何感知装置能采集到那种数据并喂给 AI,其实连喂给另一个人都做不到。比如作为一对伴侣,有时候你们就是互相看不顺眼,处处别扭。
休伯曼:从来没有。开玩笑,当然有。
李飞飞:如果彼此很熟,你大概能感觉到,但说不太清。也许你就悄悄走开,让对方一个人待着。这意味着那个人的直觉,他自己都没法用语言或手势表达出来,交给另一个人当作一条信息来用。当你自己都触及不到时,无论是另一个人还是一台机器,都拿它没办法,因为没有通向那种高度个人化直觉的入口。没有技术能做到,除非你说我们装上脑波采集器或者皮肤电导传感器。等到我们做了那些,也许它们就变得可以触及了。所以我们必须认识到,我想说的是,这并不很深奥:数据是否可以触及?不管是通过语言、图片、成像还是脑波,它必须是一条可以触及的信息。如果可以触及,而且我们收集得够多,就可以用它训练机器;或者如果机器已经训练得很好,那它可以像你说的那样,在私密的前提下,先不谈隐私泄露,机器大概能用上它。安德鲁,我在这里想做的不是把它说得神神秘秘,而是试着给它一个科学的过程来描述:如果它要发生,会怎样发生。
休伯曼:我听到的是,基于大数据集和规则的模式识别能带我们走很远。前面我们谈到医生在哪里失手、机器人和机器在哪里也许做得更好,或者两者协作好过任何一方单干。作为神经科学家,你的职业生涯里总有一段时间花在看细胞上。电生理学家几十年甚至更久以来,会发展出一种直觉,这很奇妙。我算不上生理学家,但我学会了凭一些从没写进任何论文的特征认细胞。比如这东西沿着某一侧有一条比较直的边,有某种形状和圆度,我现在就能告诉你,那是视网膜里的一个瞬态撤光细胞。后来我们开发出遗传标记,证明每一例都对。但你也会看到一些不符合规则的。机器能学这个,计算机能学这个。有了所有那些论文里的全部信息,现在我们有了一份相当完备的视网膜零件清单。好,这行得通。然后你可以套规则:这类这样放电,那类那样放电。这些我都接受。
休伯曼:我刚才谈直觉真正想问的,大概例子没举好,是:人类有哪些内在状态很难想象机器能复现,但也许它们可以?比如动机。机器会有动机吗?机器人会被激励吗?我们有动机的规则。当我非常想做一件事时,我们称之为紧迫感,一种紧迫的状态,我可能动作更快,激活能更低。你说「走」,我站起来快一点。机器可以朝某个方向跑得更快。但你能不能说「我要你去找这个东西,但要带着更高的紧迫感」?还是它们只受自己能处理的数学规则约束?
李飞飞:这可以写进数学里。有些东西,你叫它动机也好,在机器学习的世界里我们叫它目标函数(objective function)。你可以把某些东西写进数学。比如现在你去用 ChatGPT,它有不同模式,比如「深度思考」模式和「快速回答」模式。你要是不知道原理,会觉得有意思:一个更有紧迫感,快速给我答案,另一个要往搜索的深处走,花更长时间回答。作为人,如果你过度拟人化,可能会称之为紧迫感或动机。但事实是,这只是算法的不同目标。你可以说思考快的那个有时间限制或 token 限制,思考慢的那个激活了模型的另一部分,耗时更长。所以在数学上这其实很干巴,不那么深。但对人来说,你可以把它叫动机或紧迫感。
李飞飞:但我们再深一层,因为你问的比这更深。有些认知状态,不管是动机、紧迫感、恐惧还是爱,人类是真切拥有的,却很难触及和表达。今天的机器有吗?没有。我们要说得非常清楚。我们倾向于想象机器有感觉,可它们没有那些数据,没有那个数学目标函数。所以当机器说「很遗憾你今天病得这么重」,和你的朋友对你说这句话是完全不同的。机器这么说,是因为它从模式中学到了:有人告诉它「我病了」,你应该说「很遗憾你病了」,而不是「真高兴你病了」,因为那种数据存在。而你的朋友听到这话,是真心希望你好,他们爱你,不想看你受苦。他们有那种共情的感受:如果你在痛,我也经历过痛。这不一定是镜像神经元,但至少是一段关于痛意味着什么的记忆。机器没有这些。所以我们必须做出区分。很多驱动人、触动人、激发人的东西,在今天的机器里并不存在。我们的运作方式与今天的 AI 根本不同,我们必须认识到这一点,尊重这一点。这也是公共传播如此重要的原因,我们不能在这件事上误导公众。
休伯曼:我觉得人们默认 AI 聊天机器人里面有一种情感、有一个人,因为我们太以语言为导向了。它在跟我们说话,在给我写东西,而且我们现在这样做的频率比三十年前高多了。当然,我们已经非常习惯用相当贫乏的语言接收信息。短信不是长篇大论。语言变了,沟通方式变了,是往贫乏而不是往丰富的方向变。但我猜很快,人脸就要进入画面了,没有双关的意思。比如你我给对方发短信:下周这个时间在校园喝咖啡见。那条短信多久之后会变成一张照片或者一段像你本人在对我说这句话的视频?这在今天做起来是很轻松的。
李飞飞:技术已经在那里了。但我们现在必须拉远一点,去想社会参数、法律含义。人类用自己的工具能做很多事,但我们并不全都去做。比方说,今天任何一家汽车制造商都可以做到让刹车每逢周五失灵。这在技术上微不足道,车载电脑里有个时钟,每到周五把刹车关掉就行。但我们不这么做,因为这对人类社会有极其恶劣的后果。这就是规则、法律、社会规范和道德介入的地方。我认为在这里,我们就离开了关于 AI 的纯技术讨论,需要进入关于 AI 的社会讨论。
休伯曼:那我们就谈这个。我了解生物学家和技术人员的一点是,他们喜欢快,因为那令人兴奋,那是下一个前沿。我记得很久以前有一位朋友研究病毒,不是传染病病毒,而是用来在动物体内表达基因的病毒载体,作为实验工具。后来出现了一个机会,可以把一种改造过的狂犬病毒放进果蝇里。
李飞飞:天啊。
休伯曼:在我看来,如果你百分之百确定那是一个没有功能的狂犬病毒版本,那没什么问题,因为你可以往里装别的货物,做各种重要的实验,信不信由你,包括关于疾病的实验。可要是只有一只果蝇不知怎么逃了出去,而你手里的是真的狂犬病毒,它就可能和另一只交配,然后找到其他同类。我不知道这是显性还是隐性的情形,但现在你就有了带狂犬病毒的果蝇,那些东西动得非常快。所以有理由不做这个实验。但他们想起来很兴奋,然后被否决了,有很好的理由。我很感激。你去任何一个生物系,都能看到果蝇在飞。顺便说,它们喜欢醋,所以会奔向你的沙拉。但重点是,技术人员喜欢快,喜欢感受下一个边缘。那么,政府、公众、技术人员之间,这里我先把生物学和医学放一边,这场对话怎样才能进行得让每一方都足够满意,又不拖我们的后腿?因为我们据说还处在一场 AI 竞赛之中,这要求更快而不是更慢。你怎么看这个问题?
李飞飞:安德鲁,这就是我八年前从谷歌回到斯坦福、创办以人为本人工智能研究院的原因。这些是我们必须面对的深刻的社会问题。2018 年还没有 ChatGPT,但作为 AI 科学家,我知道这只会加速。所以我去找同事和大学领导说,我们要搭一个框架。但这不只是我的框架或斯坦福的框架,整个社会都需要在方方面面对社会影响觉醒过来,就像人类历史上对汽车、飞机或生物技术所做的那样。它是多维度、多利益方的。有职业规范,比方说你们生物学家不会偷偷溜进实验室往果蝇里放狂犬病毒,因为那是职业规范和你们的伦理训练。有行业规则,比方说 IRB,今天大学校园里每一个人体实验都受伦理审查委员会的监管框架约束。然后还有法律和监管法规,取决于它是用于人还是用于作物之类。AI 必须走同样的路。我们需要职业规范,需要教育。计算机科学家没有受过伦理和社会研究的教育,他们才刚开始,这正是包括斯坦福在内的许多大学正在争分夺秒地把这部分课程加进教育里的原因。这是规范和教育。但我们也应该和政府合作。不同的政府和社会有不同的规范、传统和遗产,要看监管措施应该用在哪里。比如 AI 与生物学交叉的地方,FDA,我认为是一个非常重要的领域,要看 AI 应该怎样用来帮忙,也要设护栏防止伤害。我不愿看到的是,一个人或少数几个来自产业界的人告诉所有人该做什么。我认为那是危险的,因为市场力量不同于社会规范,文化和遗产不同于教育和伦理,这些是多方利益相关者要一起解决的问题。
休伯曼:我喜欢这个回答,这在当下也非常及时。我们谈话的这一部分肯定会随着时间扩展,但你正中靶心。
休伯曼:我想听你谈谈人脑正在怎样被机器塑造,以及机器正在怎样被我们对人脑的理解塑造。先问第一个。很多人,家长和孩子,在想:我的孩子现在什么也学不到了,他们只会在聊天机器人上查。可回看学习的历史,类似的论调曾针对计算器、计算机、打字机,等等。不过这确实是个有趣的问题:我们头里的这套硬件,是为处理世界里的物理事物而进化的,光、声、气味等等。然后它前面加了一块很酷的东西,前额叶皮层,能学习「学习规则」,还能更新这些规则。所以如果说有什么,我们被赋予的是一台学会学习、并更新学习的机器。这就是孩子们能适应并使用大语言模型的原因。我这一代人是伴着个人电脑长大的,我在帕洛阿尔托长大,那时候是「这是 Pong,那是 Apple IIe」,我想,酷,大脑能围着技术成熟起来,和技术协作,我的生活因此大大丰富了。但我认为智能手机,也许是智能手机加摄像头的组合,正如乔纳森·海特(Jonathan Haidt)等人指出的,造成了这样一种局面:大多数人因为方便而喜爱这些技术,但我们现在都多少更清楚了,我们也在放弃一些东西,而且其中有陷阱,尤其是年轻人可能会掉进去。那么在你看来,非常乐观的、中性的和非常悲观的图景各是什么,如果这三种真的存在的话:年轻的大脑会被现有的 AI 丰富、不受影响,还是被伤害?我们就只谈现在有的东西。
李飞飞:好问题,安德鲁。答案几乎从我们前面的谈话里自己掉出来了,因为你用了「动机」这个词,我用的是「主体性」。绝对糟糕的结果是,我们的年轻一代,他们学习和生活的主体性以及人的动机被工具拿走了。无休止地刷屏,被动地看短视频,这些都无助于人的主体性。学习,如果尊重你说的这套硬件,是需要时间、需要努力、有时还需要一点痛苦的。我们的大脑就是这样。不管晶体管怎么动,我们的神经元以某种方式运作,我们的化学、我们的激素以某种方式运作。所以对年轻一代来说,不管社会怎么不同、工作怎么不同,我们的人体都需要经历一个深刻的发育阶段,学习必须在那里发生。而那份学习的主体性、学习的动机不能被任何人拿走,不应该被人拿走,也不应该被机器拿走。这是我的担心:如果 AI 用得不对,主体性和动机被拿走,那我们留下的将是一代又一代没有正确发育出那块砖的人。
李飞飞:另一种危险是,以主体性和动机的名义,把工具从学生手里拿掉,因为我们担心你作弊,担心你只是从 ChatGPT 那里拿到答案。那也很糟。因为有了恰当的主体性、恰当的动机、恰当的使用方式,我们可以用 AI 学得比以往任何时候都深。我刚在想,我当过一段时间医学预科生。天,有机化学太难了。我记得努力去学那些分子和它们的取向,可助教答疑时间太短,或者和我别的课冲了,教授的办公时间也有限。学那门课真是挣扎。如果今天我有一个 AI 伴侣,我会问无数关于有机化学的问题,因为我知道自己卡在哪里。我有学习的动机,我只需要指引。那对我的学习会是多么强大的工具。这是我们不应该拒绝给学生的。所以两件事都让我担心:要么拒绝给工具,要么拿走主体性和动机。当然反过来就很美好:让我们找到办法保住孩子和学生的动机与主体性,找到办法给他们使用这些工具的机会和正确方式。那么这一代、下一代以及未来的许多代人会比我们聪明得多,因为他们被赋予了超能力。
休伯曼:我喜欢这个回答。我对神经可塑性和年轻一代都抱有极大的信心。
李飞飞:也包括我们自己的,我知道我们老了。
休伯曼:没那么老。给自己一点肯定,可塑性贯穿一生。
李飞飞:我们自己的神经可塑性也是。我发现 AI 是我学习的好工具。
休伯曼:对我来说,发现它能做什么是一次了不起的经历。不过我倾向于在对某件事一无所知时以消费者的姿态去用它,在对所问的事有一些知识储备时以创造者的姿态去用它。
李飞飞:我还有另一层体会,是去年一位斯坦福本科生教我的。我意识到在 ChatGPT 之前,我有时候会偷懒:有问题就问身边我觉得聪明的人。现在我意识到,我不应该问懒问题,因为在占用别人的时间去问一个太懒的问题之前,获取信息已经容易得多了。AI 在逼我别太懒。
休伯曼:提示词的具体程度,对从 AI 那里得到最好的信息有多关键?
李飞飞:提示(prompting)非常重要。
休伯曼:而那是一项技能,对吧?
李飞飞:那是一项技能。这就是为什么公众教育如此重要,教育如此重要。我很希望看到我们的中小学教提示。我出一道小测验:谁是人类史上最好的提示者?
休伯曼:这道题我要挂了。
李飞飞:苏格拉底,如果他还活着。因为那就是提示的方法。想想看,苏格拉底的方法是什么?就是提示,就是通过提问来寻求真理。我们应该回过头去教孩子这个。
休伯曼:而且要边散步边讨论。
李飞飞:对。
休伯曼:这或许正好可以过渡到具身 AI 这个话题。把一张会说话的脸和听到的话连在一起,是完全不同的世界。我的一位童年好友,希望你们很快能见面,因为你们俩的对话会让彼此受益,我只想做墙上的一只苍蝇。埃迪·张(Eddie Chang)博士,神经外科主任,生物工程师,研究言语和语言。他和其他人搞清楚了从神经活动到喉与咽控制的转换,把人从闭锁综合征里带了出来,让他们能说话。
李飞飞:哇。
休伯曼:十年来第一次,他有一位不幸瘫痪的患者能通过计算机说话。他还有很多这样的例子。但不可思议的是,当他开始在这位患者,尤其是一位坐轮椅的女士旁边放一台 iPad 时,他们有她婚礼上的视频,所以知道她的声音,知道她的情感表达模式,也知道一些她身体动作的习惯。现在她通过一台放在她那张冻住的真实面孔旁边的 iPad 说话,可以和世界互动,世界也可以和她互动,深度完全不同于只有一个麦克风,那种斯蒂芬·霍金式的东西。而且这套系统在通过机器学习不断更新,现在还会注意她在和谁说话、对方的反应。这就是具身。
李飞飞:是的。
休伯曼:虽然是在一块平面的二维屏幕上,但比起单纯的机器声音,甚至比起仅仅准确的声音,这是指数级的跃升。
李飞飞:这不只是人的具身,具身 AI 还延伸到机器人。我一直在说,AI 的下一个前沿在语言之外,因为人类是先在前语言阶段发展的,进化用了五亿年,没有语言交流。而且如果走对了路,有机器人帮助人类,世界会好得多。
休伯曼:能举些例子吗?我喜欢这个想法,但我意识到自己可能在技术的兔子洞里钻得太深了,这大概会吓到一些人。机器人,我们有自动驾驶汽车。Waymo 总是为我和我的小狗停下,我那只漂亮的六个月大的小狗。它想过马路,你怎么能不停呢?很多人不停,早上差点把我们撞倒。Waymo 非常有礼貌。
李飞飞:Waymo 必须学规则。
休伯曼:正是。那里有一种善意,人类身上并不总有。你觉得这会首先出现在哪里?如果我们把视野拉到十二个月以后,会是什么样?
李飞飞:对机器人来说十二个月有点太快了。
休伯曼:两年,三年。
李飞飞:我会说拉到三十年。
休伯曼:三十年。
李飞飞:我不是说机器人三十年后才第一次上街,我们已经有机器人汽车了。我只是说,涉及硬件的技术要真正落地需要更久。但我会说,希望在你我有生之年,我很想看到机器人成为社会的一部分,帮助我们。比方说,我是独生女,成年后要照顾两位年事很高、病得很重的父母,他们也恰好不说英语。我做的工作量是惊人的。我很希望有帮手。这不会拿走家庭的责任,不会拿走爱,不会拿走必要的沟通,但体力劳动的某些部分,我真的很想有人帮忙。我们住在加州,我们都经历的一件事是什么?
休伯曼:堵车。高税。
李飞飞:加州有些地方不堵车,但有野火。谁在扑灭这些野火?让人在自然灾害救援中冒险不是好主意。我的家庭和父母恰好有足够的条件,但我在想一个独居的老人怎么去买菜、怎么去拿药?现在我们开始看到一些配送,可要是他们想出去走走、想去公园呢?有太多事情。顺便说,你在医学院,我们的护理人员不是过剩而是短缺。我们的护士极度疲劳、过度劳累。过去一个月我一直在医院陪我父亲,看着护士做的那些事。我们知道一个班次里护士要走好几英里去取东西、拿药。太多了。你能想象机器人来帮忙吗?我们的社会有太多方式可以从这种帮助中受益。
休伯曼:我喜欢这些例子,听你描述,脑子里一下子蹦出好多。比如护送学生过马路的人。你可以想象,通过视频,一个因年龄或疾病困在家里的人可以自己「走」到商店,从货架上挑东西。不必脱节到只是编好程序、东西送回来,虽然那也可以是一个选项。我们得修正对这幅图景的想象,因为我认为机器人和计算机有几样东西让人害怕。一是它们物理上的坚硬。我们和它们共享空间的方式,与和其他东西共享空间的方式很不一样。当然,我不是想着和机器人拥抱,虽然有些人可能这么想,那不是我的心态。但我在想,如果我有一个能叠衣服、吸尘、浇花、喂鱼的机器人。不过我喜欢自己喂鱼,我真的喜欢看它们吃,喜欢触碰,和它们真正地接触,它们会从我手里吃东西。
李飞飞:你的小狗喜欢你的鱼吗?
休伯曼:喜欢,它有自己的鱼缸,我刚给它买了些热带鱼,就放在它的小窝前面。
李飞飞:它在照顾它们。
休伯曼:它只是看着。我想它还没能力照顾它们,很遗憾,它的前额叶皮层不够多。它很善良,但它是一只斗牛犬杂交,不是最聪明的品种。
李飞飞:它们只有几条学习规则,但非常善良。
休伯曼:要是你想要一只能照顾鱼缸的狗,大概得要西高地白梗之类,前额叶皮层更多。
李飞飞:带走它吧。
休伯曼:但我的意思是,如果一个机器人干一件事,另一个机器人干另一件,我的生活里就有一大堆硬件。我想人们大概就是这种感觉。
李飞飞:但你可以想象一个多形态的机器人。你知道大白(Baymax)吗?
休伯曼:不知道。
李飞飞:迪士尼大概十年、十五年前的机器人,搜一下图片。是一个白色的医疗机器人,一个医护机器人,不是毛茸茸的,是海绵状的,像一个大气球。
休伯曼:那你可能会喜欢。更多曲线。
李飞飞:对。
休伯曼:同一个机器人能多任务,那样的世界我能更快适应,比想象我的世界塞满机器人要好。
李飞飞:是的。安德鲁,当我们想象未来、谈论我们怎样想象未来时,我总是回到「主体性」这个词。人类应该有主体性来决定我们怎样想象这件事。不能只由一家公司或者某个投资者决定世界应该布满金属机器人。我们的社会应该集体地、主动地去想象。在这场 AI 话语里,我担心的一点是,公众被放在一个被动反应的位置上,感觉像是有些人在替大家做决定,而多方利益相关者没有参与共同设计未来。
休伯曼:就像你父亲手术的例子,把机器人和医生交叉起来。如果我们遇到一个问题,其中有一个漏洞,而机器人明显��让事情变好,图景就朝正确的方向改变了。我想到几个例子。我想大多数人会同意,如果孩子能自己走去上学、走回家,那很好,但你担心安全。可要是有个机器人是孩子真正的好守护者,好到能报警,甚至能在身体上保护你的孩子,那太棒了,给他们在世界里更多的主体性。再想想网上那些阴暗但确实存在的猎食行为。家长对孩子行为的监督只能到一定程度,孩子对正在发生的事的察觉也只能到一定程度。但你可以想象一个化身和你一起在里面,真正为你着想,能识别出问题,把猎食者挡在外面。
李飞飞:这是一个很好的创业点子。
休伯曼:那会很酷。但对我来说,这幅图景里还缺了一样东西。我记得看见过一个了不起的人,我知道有人说他有点尖刻,但那是个了不起的人。我做博士后时,以及小时候在帕洛阿尔托玩具与运动用品店打工时,看见他在帕洛阿尔托市中心走来走去,那是史蒂夫·乔布斯。不穿鞋,看着像个嬉皮士。是的,他在公司里对人大吼,人力资源部门现在大概不会对他有好脸色。但他明白,我们叫作计算机的这些东西需要有圆润的边角,需要能贴合地放进口袋,需要在登录页放上鲍勃·迪伦或者别的什么,好软化人与技术的关系。有人会说这走得太远了,是特洛伊木马。但我不这么认为。需要一个真正懂人性的人,来让机器人与人类之间这些显然会是善意的协作得以发生。因为正如你指出的,我对建造 AI 的技术人员和做出惊人科学的科学家怀有全然的敬意,但不论是他们呈现自己的方式还是他们能分享的东西,都有一种坚硬,成了真正的隔阂。
李飞飞:是的。
休伯曼:我不是心理治疗师,但如果我能揽住他们的肩膀,我会说:听着,各位,你们是屋里最聪明的人,男的女的都算,公平地说,你们是屋里最聪明的人。但人们不喜欢你们,因为不理解你们。也许你们需要一个合作者,帮你们用一种不让媒体钻空子的方式分享愿景。因为媒体在制造这道鸿沟上是有罪的,它们说的是「这些技术人员来抓我们了」。我认为这完全是媒体的把戏,只是为了往自己口袋里装钱。现在的局面很复杂。那么,谁是那个史蒂夫·乔布斯,或者史黛西·谁谁,可以是男人也可以是女人,一个真正理解人的人?
李飞飞:很多。有很多这样的人。斯坦福创办了以人为本人工智能研究院。
休伯曼:有你。有你在。
李飞飞:好,但还有很多。有很多创业者在做出色的 AI 创业,AI 药物发现、AI 医疗、AI 老龄化、AI 心理健康,这些人关心 AI。有很多设计师和产品经理在努力。我确实认为,扬声器过多地对准了那些拍着胸脯、用某种特定方式谈技术的人。所以即便是这个播客,我希望,也在做出积极的改变,把人的角度、圆润的人的角度、人的视角、人的未来放进这些对话里。我不觉得绝望,安德鲁。我是教育者,是建设者,是技术人员。我看到身边很多人,包括我整个创业公司,这些杰出的年轻技术人员可以加入任何他们想去的创业公司或大公司,但他们来 World Labs,因为他们想赋能于人。所以我看到很多人。但你说得对,我不认为现在的公共话语是平衡的,极端言论太多。要么是极端的末日论、缺乏安全,把人吓坏;要么是极端的乌托邦,好像技术不会出任何差错,这是不诚实的,人们会说,好吧,你们是既得利益者,当然这么说。所以我认为我们应该回到中间,谈这项技术是什么、怎么用、我们怎样集体地拥有那份主体性去引导未来。
休伯曼:一位播客同行向我指出过一件本该显而易见却被我忽略的事,而这显然是你所体现的诸多东西之一:人们其实不想听关于机器的故事,但人们喜欢听某个人治好了自家狗的癌症,或者孩子出现了莫名其妙的症状,医生们毫无头绪,而指尖上的 AI 解决了问题。这些故事才真正需要放大,因为我们能与之共鸣,它们是美好的故事,不可思议的故事,可它们得到的关注远不及别的那些。
李飞飞:是的,这是个挑战。
休伯曼:传统媒体并不真正关心事情的长弧,它们的周期是十二到二十四小时。有没有别的名字,那些真正在谈 AI 善意使用、我们应该了解的这类协作的人?
李飞飞:斯坦福 HAI 的通讯、我们的网站、我们的研讨会,推介了很多这样的工作。
休伯曼:我很想多了解你的创业公司,因为你选项目从不随意。这个项目是什么?目标是什么?
李飞飞:我和另外几位联合创始人创办的公司叫 World Labs,2024 年初成立。对我来说,它确实是我毕生工作的一种延续。你知道,我们都出身视觉,而认识到语言之外还有更多的智能,正是促使我认真思考 AI 前沿下一章的动力。我们认识到,解锁空间智能和物理智能是下一章。这不是排斥语言,语言技术当然了不起,而是我们可以投入更多时间去构建模型,最终构建产品,来解锁空间智能方面的能力,比如生成三维、四维的世界,对创作者、机器人训练、建筑设计都极其有用,或者用来打造那些可交互的环境。不论是医疗、教育、机器人还是工业用途,这些能力都超出了语言本身。World Labs 就是基于这个前提创办的。我们还是一家年轻的公司,很大程度上是一家以模型为中心的公司,在构建基础模型,创始团队里有很多博士,但现在我们开始做产品了。这还只是开始,非常令人兴奋。作为技术人员,我内心深处觉得自己是一个建设者。也许因为我也是移民,卷起袖子,和极其聪明的年轻一代一起从零开始造一样东西,实在太让人兴奋了。
休伯曼:我记得十五、二十年前,有汽车在街上跑着拍图像。
李飞飞:现在还在跑。
休伯曼:还在跑着拍。当然也有航拍。但你可以想象小小的无人机,就像那种可以穿过一个神经元把一切看遍的东西,打个比方,或者无人机去采集挪威峡湾每一个角落的信息。有人做过这种事来绘制三维世界吗?
李飞飞:首先,别把它说得像无人机要闯进人们的家和地产那么可怕。捕捉世界影像的能力确实在飞速进步。我们的手机是不可思议的传感器,它们不是无人机,但人们拍很多照片,摄像头技术当然也进步了。World Labs 做的不只是拍摄现实世界的图像,我们让人们想象自己心眼里的东西。只要你能打一句话,或者给一张图、一张草图,描述你想象的东西,我们就试着把它变成世界和环境。为什么有用?因为娱乐业会用,设计业会用,机器人行业会大量用在训练环境上,等等。把捕捉现实世界和捕捉你想象中的世界结合起来,是新的前沿。
休伯曼:如果你不介意,我想再花几分钟谈谈从想象到某个实物的过程。因为这里是洛杉矶,我想到很多人写剧本,然后试图把电影拍出来。但有了 AI,理论上你可以把剧本交给 AI,它就能把电影做出来,从文字到画面到视频,也许在需要的地方稍微剪一剪。有人做过吗?有没有一部成功的电影从头到尾用 AI 做出来?
李飞飞:这是一个非常微妙的话题。这也是人们对 AI 和创造力感到不安的地方,如果不小心,听起来就像我们要拿走讲故事的人和创作者的工作。所以我们先把工作的话题和技术的话题稍微分开,尽管它们是纠缠在一起的。技术已经进步到这样的程度:拿剧本生成镜头、生成视频镜头,做得越来越好了。我们已经看到短片,甚至接近正片长度的电影,是用 AI 工具组装出来的。有很多公司,美国的、亚洲的,在做这种技术。但依然深深属于人、而且重要的是,讲故事和创作故事的每一个部分背后都是人,带着他们独特的情感、故事、技巧、看世界的方式、运镜的方式、刻画人物的方式。好莱坞和小说写作很大一部分就是这个。所以怎样用现代工具满足人类讲故事的需要和渴望,实际上是一个挑战。因为好莱坞有一种很强的恐惧,怕 AI 接管,怕讲故事的人、演员、编剧的工作受到冲击。我认为确实有冲击,但是怎样冲击的?我们在做什么?谁在以建设性的方式工作?这不是我的行业,但我很希望看到这方面有更多细致的工作,也有更细致的公共讨论。不过我确实认为,就像我们前面谈到 AI 能迅速改变和颠覆医疗的旧做法,AI 也绝对在改变我们讲故事的方式。说到这个,有一个故事:我有一位联合创始人叫本(Ben),本和我见了本·阿弗莱克(Ben Affleck)。我开玩笑说本见本。他在用 AI 工具做电影这件事上想得也很前卫。所以此刻技术人员和讲故事的人或电影人之间的对话至关重要。
休伯曼:我觉得在每一个技术的例子里,都有一个交叉点:当一个真正的圈内人接纳了某项技术,事情就起飞了。比如史蒂文·斯皮尔伯格,或者这可能不是最好的例子,比如乔布斯和沃兹尼亚克的交叉:一个对技术好奇的设计者,和一个真正的计算机科学家,请原谅我引用那部乔布斯电影。这些协作是真正的关键。你需要一个圈内人和一个圈外人才能做对,因为你必须理解两种文化,以及如何把行业里的人包括进来。
李飞飞:所以我真的希望如此。World Labs 也和视觉特效行业合作,对我来说非常重要的是,我们的客户和用户感到被赋能。技术不应该拿走他们的工作,技术应该让他们的工作更好,给他们的创造力超能力。这是我看待这项技术的方式,也是我想与用户和客户合作的方式。
休伯曼:想想真是奇妙。我小时候在帕洛阿尔托的加利福尼亚大道上,有一家店叫 Keeble & Shuchat,就是一家照相馆和相机店。你进去冲胶卷,柜台后面站着一排人,告诉你可以租长焦镜头之类。那些都不存在了,一切都数字化了。但相机店还在。所以行业可以变形,不总是被消灭。
李飞飞:对,它会变形。人也会再技能化、提升技能。我们在和很多用 AI 工具的创作者合作,因为他们看到了技术的走向,想让自己再技能化、提升技能。所以我认为变化的时刻既是机会的时刻,也是失去的时刻,我们需要对此非常审慎。
休伯曼:我最后一个问题是关于年轻一代。他们对 AI 怎么看?
李飞飞:你说的多年轻?
休伯曼:七岁到二十岁之间的孩子。
李飞飞:好,那正好是我的孩子。
休伯曼:所以我问这个问题也许是有原因的。他们怎么看?他们兴奋吗?因为有这样一种现象:计算机来了,你的书法老师就紧张,人们不再手写而是打字了。现在大家都用指尖写字,没人会写字了。这类故事流传很久了,说如果我们不像拥抱未来那样拥抱过去,我们就会溶解成一滩自己的神经元。我愿意认为两者兼顾才重要。但孩子们感觉如何?他们怎么想?
李飞飞:这实际上是我作为教育者和技术人员的心头项目。我走到哪里都试着和学生、家长、老师交谈,因为我认为他们是最被遗忘的群体。我们的政策制定者、技术人员和投资人不谈老师、家长和学生。他们都有看法,都有孩子,但不谈这个。我对孩子总是抱有希望。也许因为我是教育者,我认为人类始终学不会的最大一件事,就是老一代哀叹下一代,好像下一代什么都不懂,他们粗鲁,他们忘了过去。但如果你看人类历史的长弧,总体上我们是在向好的方向前进。我不否认那些暴行,不否认那些倒退,我不否认这些。但从根本上,我对人类是乐观的。这是我的出发点。如果你是彻底的悲观主义者,也许我们从一开始就站错了脚。我看孩子们,他们好奇,这就是为什么他们是孩子,他们好奇。当然他们被这项技术娱乐得不行,但他们也开始使用它了。
李飞飞:我担心的是老师和一部分家长,因为我认为今天的社会,尤其是硅谷,没有为他们做好服务。我们在遗忘他们,在训诫他们,在斥责他们,在看低他们。他们是我们社会里最重要的人。我们应该和他们对话,抬举他们,支持他们,给他们资源。从幼儿园到十二年级,乃至到大学的老师,承担着我们社会最重要、最关键的负担。我讲一个真实的故事。2022 年 11 月,ChatGPT 出来了。显然我在技术上是个圈内人,但我做的第一件事是给我孩子所在小学的校长发邮件,说我想来给你们的学生和老师做一次客座讲座。不是因为我有多特别,而是因为我想让他们实时知道正在发生什么。因为在硅谷没有人,没有投资人,没有几十亿美元的投资公司,没有几百万、几万亿美元的公司,在 ChatGPT 出来时首先想到的是「我们社区里的老师怎么办」。没有人这么想。但我们需要和老师对话,需要给老师展示。当然,他们会问孩子作弊怎么办。没关系,他们问这些问题很正常。我们就展示给他们看,和他们一起工作,赋能他们,让他们自己想出应对的办法。他们也很聪明,他们渴望改变,只是被遗忘了。所以我对孩子有希望,但为了不让这希望变成盲目的希望,我认为我们都应该记得我们的老师,帮助我们的老师和家长,这样才能帮到我们的孩子。
休伯曼:我太喜欢这个回答了,我知道很多听众都有同样的感受。上帝保佑老师们,他们需要帮助、支持和信息。因为现在他们打开播客,不是你的,是大多数播客,只会被吓到。他们听到末日论者,或者听到有人说「别担心,一切都会很美好」。这两种信息都帮不了老师,而老师得不到帮助,孩子就得不到帮助。
李飞飞:完全同意。
休伯曼:飞飞,非常感谢你从极其繁忙的日程里抽出时间。很高兴听到你父亲平安,照顾父母和孩子也是你日程的一部分,而你还来教我们这件不仅重要、而且是我们所处位置和前进方向的重要一块。基于你今天分享的东西,我怀着更大的、带着审慎的乐观。也谢谢你一路教了我们更多的神经科学,因为这些机器受大脑启发,大脑也被这些机器所启发,这就是我们生活的世界。我怀有极大的乐观,很大程度上是因为这个世界上有你。
李飞飞:谢谢你,安德鲁,我非常珍视这次谈话。这是一个文明层面的时刻。
李飞飞以「视觉是智能的基石、数据是现代 AI 的引擎」为主线,主张 AI 应当增强而非取代人的能动性,真正被遗忘的群体是教师与家长,而 AI 的下一章是超越语言的空间与物理智能。

微信公众号