约西·马蒂亚斯
Sínead Bovell谷歌研究院播客(The Google Research Podcast)本期邀请谷歌副总裁、谷歌研究院负责人约西·马蒂亚斯(Yossi Matias)做客,与主持人、未来学家希妮德·博维尔(Sinead Bovell)对谈。马蒂亚斯曾因让人工智能得以规模化的奠基性算法获得哥德尔奖,也是自动补全、谷歌趋势等产品的缔造者。两人从Transformer与生成式界面谈到AI联合科学家、洪水预警、开源医疗模型与量子计算,勾勒出一幅“把不可能变为可能”的研究图景。本文依据现场录音编译整理。
主持人: 谷歌是怎样建造未来的?在谷歌内部,有一群研究者专门探索“可能性的艺术”。他们的使命是推动变革性的突破,这些突破不仅改变谷歌的产品,也帮助人类应对一些最重大的挑战。从发明Transformer(正是这一架构点燃了生成式人工智能时代)的团队,到量子计算,到洪水预警系统,再到加速科学发现的AI,谷歌研究院一直在拓展科学与技术的边界。今天和我坐在一起的,是统领谷歌研究院所有这些工作的人,约西·马蒂亚斯。他不仅是一位高产的研究者,曾因让AI得以规模化的奠基性算法获得哥德尔奖(Gödel Prize),也是一位建造者。你很可能在不知不觉中用过他的成果:从自动补全到谷歌趋势(Google Trends),再到数十亿人使用的各种谷歌搜索体验。今天我想问他:眼下什么事看起来不可能,但很快就不再是了?我是希妮德·博维尔,这里是谷歌研究院播客。约西,欢迎来到节目。
马蒂亚斯: 很高兴来这里,希妮德。
主持人: 在我看来,谷歌研究院是谷歌内部一个特别的地方:未来在这里先被做出原型,然后才进入日常生活。你会怎样描述谷歌研究院做的事?
马蒂亚斯: 我先说一句:现在真的是研究的黄金时代。以前从来没有哪个时刻,我们能像今天这样以如此快的速度、如此大的范围去设想未来,并且把它变成现实。谷歌本身就是从一篇研究论文起家的,而谷歌研究院一直是这样一个团队:我们去找那些真正要紧的问题,想办法解决它们,而且很多时候,就是把不可能变成可能。
我们的范围相当广,因为我们关心的领域很多,只要它能带来改变:怎样推进机器学习,包括基础研究和应用研究;怎样设计新算法来解决一大类问题;怎样构建我们未来真正用得上的计算系统;怎样用AI去应对医疗、气候、教育领域的难题;怎样推动科学、加速科学;当然还有怎样推进生成式AI的基础,它眼下正在彻底改变我们身边的一切。我们也在探索其他范式,比如建造一台量子计算机。
主持人: 我看过你的一次演讲,其中有两页幻灯片展示了你们工作的广度。一页从基础机器学习和算法一直延伸到量子;下一页从整个行星一直延伸到细胞。真的是全部光谱。而你有一种独特的能力,既能看见未来会发生什么,又在同时把它建造出来,而且一次又一次被证明是对的。今天我们都在和AI系统聊天,仿佛这再正常不过;八年前,你做出了谷歌Duplex,那是最早的对话式AI系统之一。谷歌研究院也是现代AI最著名的论文之一《Attention Is All You Need》诞生的地方,它把Transformer带给了世界。你是怎样一边看到方向,一边把它建造出来的?当然,我还得问一句:接下来会发生什么?
马蒂亚斯: 有意思的是,技术发展并不是把已经做过的事往前外推。它的美妙之处在于预判接下来会来什么。谷歌研究院做的一件很重要的事,就是不只看未来三个月、六个月、九个月能做什么,还要看地平线上有什么,拐角处有什么,哪些事情正要变得可能,而我们凭现有的基础能让它们真的成为可能。这里有一种有趣的动态:任何时刻,我们取得的每一项突破,都会成为一层新的地基,让我们在上面再往上走一级。
回到你说的对话式AI和其他技术。到某个时点,关键是识别趋势往哪里走,然后做一个判断:哪些事我们已经处在能做到的边缘,哪怕还不知道具体怎么做。比如十年前,我就很清楚,对话式体验是我们正要触及的东西,因为我们开始看到语音识别在变好,开始看到文本转语音的早期技术。现在这些我们都习以为常了。而对话式交互显然是终极的用户界面,因为人和人之间就是这样交流的。从那以后,我特别兴奋的一个问题就是:怎样用AI,怎样开发这些技术,让对话式体验成为现实?Duplex当然就是这样一个例子。就在几年前,我们已经公布过,借助Duplex技术,比如打电话给商家询问营业时间,商家信息已经被浏览超过一万亿次。
但这不只关乎对话式体验,还关乎打破模态之间的壁垒。比如怎样把内容在文本、图像、视频之间转换,怎样实现多模态的、跨语言的交流,消除语言障碍,怎样用不同的方式消费内容。这些现在也都被视作理所当然了。我在谷歌搜索工作了十多年,人们早已习惯:要找信息,就去谷歌一下。其他技术也一样,一旦它能用了,我们就默认它一直能用。我喜欢把这叫做“环境智能”(ambient intelligence):智能好到你把它当成理所当然,不再操心它,转身去做下一件事。
有句话说,足够先进的技术与魔法无异,我觉得非常对。但同样真实的是,一旦我们体验过几次,它就不再是魔法了,我们干脆假定它就是会发生,假定它就是能用,然后去看下一件事。
主持人: 对,那是阿瑟·克拉克(Arthur C. Clarke)说的:任何足够先进的技术都与魔法无异。太准确了。我们今天用AI做的事,放在几年前会显得非同寻常、不可能、彻底激进,而现在大家只是像用自来水一样在用它。说到我们要去往哪里,你提到了两件事。一是我理解你指的是生成式界面(Generative UI),我读了你和合作者二月份发表的那篇论文;二是环境智能。那么我们可能走向的愿景,是一个我们几乎像用电一样“流式”使用人工智能的世界,没有人再去想它。没有人会想“我的手机能充上电吗”,你就假定电在那里。环境智能的愿景,是不是就是你直接提出一个需要高级智能才能回答的问题,却完全不用想背后投入了什么?
马蒂亚斯: 对,这说到底就是可能性的艺术。所谓在可能性的艺术上工作,是两件事的结合:什么事要紧,以及什么事你真的能做到。生成式界面就是个很好的例子。一支很出色的团队去研究,我们现在能用生成式AI为自己做出什么新体验,结果发现,有了生成式界面,我们不仅能生成神奇地贴合你提示词的内容,还能用它来判断向你呈现内容的最佳方式。你问的是视觉性的东西,就给你看图片;你问的是算法,也许就写一段代码给你看模拟;你问分形,就把生成分形的代码写出来,让你亲手调整各个参数;如果你是个孩子,问二次方程是什么,系统也许会判断,最好的办法是给你看一个人投篮,让你看到投篮角度和二次方程之间的联系。这些都是例子。美妙之处在于,AI既在加速研究本身,也在加速研究成果的部署,所以我们看到它从一个演示,变成了搜索和Gemini应用里的一项功能,给你更有吸引力的呈现。
主持人: 在我看来,这是我们与数字信息交互方式的一次范式转变,因为信息不再只是被展示给你,而是以和你、和你的情境、甚至和你的设备相关的方式展示。我们之前聊天时我在想,有些人搜一家餐厅,想看的是菜单,他们懂吃,知道每道菜的名字;但对另一些人来说,图片才重要。最终会走到这样一步:界面知道这个人是“图片优先”的人,就给他看图片;那个人喜欢精致的菜名,就给他看文字列表。这就是今天已经可能的事,也是生成式界面要去的方向。
马蒂亚斯: 对,而且同样的能力可以带到不同领域。生成式界面之所以非常强大,是因为它用一条提示词就能生成,所以我们才能把它放进搜索。但如果把问题放宽,我们究竟希望呈现是什么样的,怎样不仅适应用户的意图,还适应用户的情境,那还有别的领域值得探索。比如,我们开始问自己:能不能重新想象教育中的教科书?假如你想学重力,与其读一篇配几张图的文字,能不能用AI重新构想它,用适合这个人语言水平的例子来讲?十岁孩子和十八岁的人需要的不一样。能不能再适应兴趣?如果你是个喜欢足球的十岁女孩,也许就用足球里的例子给你讲重力。我们有一个实验就叫“Learn Your Way”(按你的方式学),做的正是这件事,试着重新想象教科书。
我认为,在用技术做这件事上,我们还处在很早的阶段。而且它始终从一个问题出发:我们要解决的是什么,今天的技术能做什么,我们又能建造什么,让未来解决得更好。
主持人: 对,我们能不能超越静态界面、标准化的教科书?每个人学习的方式都不一样,系统最终能不能自己弄明白哪种方式最适合我们?
主持人: 退一步想,要实现这个愿景,让环境智能成为一个我们都在“流式”使用、却不再去想的层,让生成式界面在你所在的地方与你相遇,从技术上讲需要发生什么?因为我们听到业界在大谈规模法则(scaling laws),说预训练正在触碰极限,也许不能再指望扔进更大的数据集、更多的算力就看到进步。而谷歌研究院的任务恰恰包括提出新架构,或者推动效率上的突破来绕过这些限制。那么在架构层面需要发生什么?我们需要一种不同的架构才能抵达那个愿景吗?
马蒂亚斯: 关于今天做的事极限在哪里、我们是否已经到了极限,讨论很多。可这种讨论在某种意义上忽略了一个事实:就在几年前,我们连这个架构都还没有。那凭什么认定这是唯一可能的路?回到第一性原理,我们是怎样通过研究突破来解决问题的?看生成式AI,有好几个领域都需要更多工作、更多研究,我们也都在研究怎样推进。让模型更高效显然是其中之一。还有让它们更符合事实、更值得信赖。顺便说一句,这项研究我们从2021年就开始做了,可以说是在大语言模型的黎明期,而且早在2022年就发布了一个基准,供学术界用来测试大语言模型的事实性和一致性。还有别的领域需要进步,比如怎样让推理更强,怎样解决更难的问题,怎样在多个维度、多种模态上工作,等等。所有这些方面我们都看到了巨大进展。但每次有了进展,它就成了新的基准,问题就变成:从这里往哪儿走?你永远够不到自己想要的,因为总有一个更大的问题在等着,你总想把它用在更多事情上。
说到效率,举个例子。规模法则假定你只用现有的技术,不断往里加数据、加算力。可当然会有新技术、新算法,Transformer本身就是新架构。就在几年前,我们提出了所谓的“推测解码”(speculative decoding),本质上是一种更好的大语言模型推理算法。它表明,推理效率可以提高两倍甚至更多,不管是推理耗时还是所需算力,而且质量没有任何损失。它有很多变体,可以远远超过两倍,如今基于这个范式已经有数百种变体,加速已经被当成理所当然了。但我在等更多的创新,等十倍、百倍,等新的架构。研究最迷人的地方在于,它不只是把已知的东西拉伸到极致。开发技术时你当然总要那样做,但研究也意味着提出这些全新的方法。我还从没见过什么东西能真正证明“这件事做不到”,因为问题只在于我们什么时候能做出下一个突破、下一项创新、下一个转折点。
主持人: 所以一方面,现有架构里还有更多可挖的,我们可以让它们更高效,更符合事实;另一方面,突破还会继续发生,故事没有讲完,架构本身还会有创新。这就是你说的也许十倍、百倍、甚至比今天好一千倍。
马蒂亚斯: 对。而且我们想用技术做的事本身也在不断变化,我们一直在抬高标准,比如把它用到别的地方。我们显然是从语言模型起步的,但我们当然也想知道怎样建立关于世界的模型,我们想要世界模型(world models)。我们发现,在很多情况下,用基础模型仅仅从经验中学习,就能走很远。但如果再结合各种物理模拟,结合对更多材料的理解,我们就能得到更多洞见和更多训练数据,比如分子层面或生物学的数据,从而得到更好的模型,去追问那些今天还问不出口的问题。或者怎样表示世界上各种事实之间的关系,再在上面搭建层层结构。当然,也要用AI来帮助我们取得这些进展。
主持人: 那么在某种意义上,你是不是认为我们在人工智能上仍处在早期?尽管这个领域已经存在了几十年,很多人可能不知道这一点,但它能实现的东西,我们才刚刚开始触及。
马蒂亚斯: 是的,这是一个有意思的两面性。一方面我们看到,等一下,比起几年前,我们已经走了这么远;另一方面,要预测我们会走向哪里相当困难,因为现在我们谈的是用AI本身来加速。AI在加速研究,AI在加速AI的开发。当然,人们已经在谈AI递归式自我改进的那个节点了。我们已经在用AI加速研究本身。所以是的,在很多方面我们还处在早期。有句话说,预测很难,尤其是预测未来。我们的工作就是下这些注、投资这些方向,但我不认为有谁能真正很有把握地说,几年后世界会是什么样,AI和技术会是什么样。有一点是清楚的:我们仍在取得巨大进展,它会影响方方面面。我们要做的,很大一部分就是问对问题:在哪里,研究突破能产生最大的影响,进而转化为对产品、核心技术、科学、社会等一切的影响。
主持人: 我们来谈谈科学,我知道科学是谷歌研究院工作的一大块。这个时刻对科学意味着什么?科学刚刚经历了什么?
马蒂亚斯: 对我来说,眼下最令人兴奋的进展之一,是我们如何加速科学发现本身。不只是用最好的技术去回答具体问题,而是用AI为整个科学方法提供工具。想想科学包含什么,想想一个科学实验室。研究者们在试图解决一个问题,比如:为什么某些细菌比其他细菌更具传染性,为什么它对抗生素有耐药性。这是我们在帝国理工学院的合作伙伴研究了好几年的一个真实例子。然后各个层级的研究者,包括研究生和博士后,先去查文献,看能从中学到什么,再形成假设,然后去验证。我们现在做的,就是看怎样用AI把这一切都加速。
比如我们有一个系统叫“AI联合科学家”(AI Co-Scientist),是一个多智能体系统。它能在全部文献中搜索,然后生成假设,而且能生成很多假设,再去尝试验证这些假设,给它们排序,带回给研究者说:这是一个假设,也许能回答你心里那个研究问题。因为它能通读全部文献,用我们手头的所有数据来核查假设,它可以极大地加速研究。就在这个例子里,我们的合作伙伴花了好几年才提出的假设,AI联合科学家三天就提出来了。它还提出了另一个假设。我们在斯坦福和其他地方的合作伙伴,也在用AI联合科学家探索关于肝纤维化、关于老药新用的假设。
我们在这里看到的是,突然之间,我们可以有一个AI系统,充当一个极其强大的合作者。我问过合作伙伴,和它一起工作的体验如何。他们说,就像和一位能力极强的合作者共事。有意思的是,它不只是聪明,它能读遍所有学科的文献,所以它像一位博学通才(polymath)。就像口袋里装着一位通才。
想象一下这样一个世界:任何研究者、任何学生,都有一个虚拟实验室为自己工作。任何人都可以提出一个研究问题,让系统去梳理文献、生成假设、验证假设,未来很可能还能通过真正的实验室实验来验证,只要有足够的自动化设备,而我们看到整个行业在这方面都有不错的进展。这本质上意味着,每个研究者都会拥有今天只有极少数人,只有资历很深的实验室负责人才拥有的东西。这意味着每个人都能问更大的问题,更快地取得进展。科学里从不缺需要回答的问题,所以我认为这会相当大地加速科学发现。
马蒂亚斯: 这只是方程的一部分。想想科学家,一位生物学家、化学家或材料设计科学家,他们在自己的领域里可以极其出色。可今天,要真正建立模型来检验假设,光这一件事就是大量工作。它可能要花几天、几周、几个月,有时你干脆得雇数据科学家来帮你建模。所以我们有一个系统叫“实证研究助手”(Empirical Research Assistant),同样用生成式AI,对任何定义清晰的问题和任何输入,它都能帮你搜索、找到并建立合适的模型来求解。顺便说一句,AI联合科学家和实证研究助手都在几周前发表在《自然》上。到那时,已经有相当多论文在宇宙学、流行病学、工程学、经济学等一系列领域使用实证研究助手来加速研究本身,解决了以前悬而未决的问题。
再想想把生成假设、文献检索这些结合起来。我们最近通过一个叫“Gemini for Science”的东西把它们开放出来,这是谷歌内部许多组织、许多团队的协作成果,让研究者可以用上。实证研究助手,加上DeepMind开发的另一个系统AlphaEvolve,一起注入我们称之为“计算发现”的东西,还有文献洞察等其他领域。这些都是科学方法中加速研究的组成部分,而且只是其中一部分。因为另一件我们真正应该关心的事是,将来我们要怎样评审科学文献。所以我们也在试验论文助手工具,能帮你对论文给出反馈。展望未来,我设想评审人也会使用AI。事实上,科学方法比以往任何时候都更重要,用AI来辅助科学方法,对于以严谨的方式加速科学发现至关重要,这样我们才能真正搭起一层层科学的积累,去探究下一个研究问题。我们看到的这种加速,是用AI加速科学本身最激动人心的方面之一。
主持人: 对,过去要花几年的事,现在可能几个月、几周甚至几天就能看到。普通人可能没意识到,当你有一个想验证的假设时,光是研究这条路值不值得走,就有多少工作要做。就拿你的例子来说,为什么这种细菌对抗生素产生了耐药性?你得去研究关于这种细菌的所有文献,也许别人已经证明或证伪了某种耐药的原因。光是弄清楚这个假设值不值得追下去,就可能要几个月。然后你提到实证研究助手,假如你是化学家,现在你可能得写一个模型来检验假设,于是要么找来一位计算机科学家,要么自己突然得写代码。现在你身边有了一个虚拟团队,可以开始做所有这些事。
主持人: 我很喜欢你在一次演讲里说的:大多数人不知道,爱迪生身边有大约一百个人和他一起工作。很多顶尖科学家周围都有一整个“工厂”。现在这个工厂本质上被造出来了,就在那里。那么想想所有这些工具,是不是正在出现一道技能鸿沟?因为拥有虚拟实验室是一回事,知道怎么用它是另一回事。前几天我们通话时,你说了一句我觉得很有意思的话:“我们在加速培养科学家、让他们把自己看作架构师这件事上有一道缺口。”科学家作为架构师,你指的是什么?
马蒂亚斯: 首先,确实,爱迪生大概是终极的发明家,他有一座“发明工厂”,他不是一个人在做,他有他的实验室。想想今天我们最敬重、最仰慕的科学家,他们都有一个实验室和他们一起工作。而现在我们正进入一个人人都将拥有自己虚拟实验室的世界。我把这理解为:AI是人类创造力的放大器。研究者的角色会变得比以往任何时候都更重要。有时候会出现这样一种错觉:等等,如果研究生、博士后、初级科学家大量时间原本花在查文献、建模型上,现在这些能免费得到,那还剩下什么可做?关键就在这里:这个角色比以往更重要了。当你手边有一个虚拟实验室,你就可以提问,本质上你能做今天只有非常资深的研究者才在做的事。
所以我把AI看作人类创造力的放大器。但这不是一个预测,而是一个设计目标。想想看,一个初级科学家要像今天手握虚拟实验室那样去工作,需要什么?今天,成长到那个位置要花很多年,你先做比较初级的工作,然后观察、学习。而在一个你可以很早就开始提这些问题的世界里,我们需要填上这道缺口,某种意义上要重新训练研究生。而且我相信这在任何领域都成立,工程、计算机科学、生物医学都是如此,可能医疗工作者也是。
主持人: 法律也是。
马蒂亚斯: 对,有了这些工具都一样。因为AI正在接手这些可以说是入门级的任务,这让每个人都能踏入更高的阶段:问对问题,给出正确的指引,对结果做出判断。因为结果从来不是非此即彼的,不是“这是问题,这是答案”,而永远是“这里有几种可能性,这里有各种权衡,这个好不好,这几个参数怎么比较”。所以判断力很重要,比以往任何时候都重要。
由此有几点观察。第一,我们需要看看怎样调整我们的体系、我们的学业、我们的培养路径,以便训练人们用AI去做这些。我也相当乐观,我们可以用AI来帮忙做这件事,比如在科学方法上,AI可以很早就对论文给出反馈,这是任何研究生导师最耗时的工作之一。第二个观察是,判断力,既是判断什么是重要的问题,这通常会变得更加关键,也是判断一个答案对不对。有时候答案是显而易见的,比如你有一个优化问题,想让某个数字达到最优,你可以核对结果,验证它是不是最好的。有时候它是一个判断,因为你想要的解法要应用在一个复杂的、充满权衡的系统上。这里我想借用一句话。我热爱爵士乐,我最喜欢的一句话来自艾灵顿公爵(Duke Ellington),他谈音乐时说:听起来好,那就是好。这句话相当深刻,因为说到底,判断什么是好的,正是我们会越来越倚重人来做的事。当然,AI系统会学习然后应用,然后我们会问更大的问题,仍然需要这些判断。
主持人: 所以我认为科学教育,有些人觉得会变容易,现在有了这些技术嘛,我倒觉得会变得更难。因为你描述的世界里,过去要花十年、十五年才能建立的能力,我们很快就会要求初级科学家具备。因为他们能问的问题,是别人花了四十年才想明白的,现在你有可能回答这些问题,你就需要建立起相应的判断力。我认为整个社会都在往这个方向走,教育当然也是。
马蒂亚斯: 我还是想说,这是一种错觉,我们以前就见过。当谷歌和维基百科变得像水电一样人人可用时,也有人担心:我们的孩子会不会变笨、变懒?我们过去布置作业,让他们去图书馆收集事实,现在几分钟就能搞定。结果呢,我们适应了。作为一个社会,我们的期望提高了,这些如今被视为理所当然。现在我们当然又在抬高期望和给定的起点。就拿数学来说,我们现在看到那么多消息,研究者甚至有时是孩子在说:嘿,我们用AI解决了这个或那个埃尔德什问题。这是传奇数学家保罗·埃尔德什(Paul Erdős)留下的一个数学问题库,很多问题长期悬而未决。于是有一瞬间会产生某种错觉:所有这些研究问题都要被解决了。并不尽然。当然有些会被解决,很多会被加速,然后我们就能问更大的问题。所以我认为,需要解决的东西从来不会短缺。医疗也一样。我们取得了一些进展,但要真正“解决”医疗,还有太多工作要做:怎样确保没有人被一种疾病“突袭”,怎样做到早期发现,怎样找到癌症的疗法,怎样解决公共卫生问题。这些问题我们都还处在非常早的阶段。所以我们应该拥抱AI,用它来帮助解决这些问题。
主持人: 对,我们需要更多人进入这个领域,而且是被这些技术赋能的人。
主持人: 验证会不会成为瓶颈?你提到AI不像我们这样被限定在某个学科里。每隔几十年我们会出一位能跨学科的通才,但那通常很稀有,一般人学化学、学物理、学生物。而AI有可能发现一种跨学科存在的模式,这种模式在单个学科内部却说不通。如果我们的思维一直是按学科一个个训练出来的,谁有能力判断这个模式说得通?
马蒂亚斯: 让我先从学科和跨学科这个概念说起。在我看来,这恰恰是我们现在用AI加速科学发现所看到的最大机遇之一。科学界的组织方式,确实通常是推着人往特定学科钻。而我一次又一次发现,当你把多个学科放到一起,很多魔法就发生了,你可以借用、看见并连接不同的知识。通常真正跨学科的人不多,而在那些跨学科的人那里,很多好东西才冒出来。现在有了AI,我们真的可以做到这一点。所以我很乐观,它会加速并让我们把多个领域汇聚起来。
同时,你关于验证的问题很关键。在一个AI能生成如此多假设的世界里,核查它们、验证它们、对它们做出正确判断,变得越来越重要。显然,我们也需要用AI来帮忙。而且,在一个我们能跨垂直领域、跨学科取得更多进展的世界里,我认为更宽广的教育也会变得越来越重要。这是我认为未来会看到的一个积极方向,同时也要鼓励人们这么做。当然,在某个领域钻得深和走得宽之间永远有取舍。过去很多时候必须钻得深,因为要把你的问题彻底解决,你得包揽一切,从实验室工作到建模型到证明所有定理。但在一个你手边已经有虚拟实验室的世界里,我们会去调整:你需要训练到什么程度,怎样在自我教育上找到合适的平衡。这不只对科学成立,我相信对技术也会成立。我们过去有软件工程师、产品经理、用户界面设计师等等。而突然之间,我看到我们正走进这样一个世界:有了AI,每个人都可以有一支虚拟工程师团队为自己干活,还有别的各种团队。所以很多职能你都可以自己承担。跨学科的能力会变得极其重要。
主持人: 我喜欢这样说:职位头衔这个概念会越来越站不住,因为现在更重要的是我们所做事情底下的技能,而不是工业时代那套具体的分类法。我们将能够更流畅地移动,比如你做产品,现在也在做工程,甚至在科学里跨学科。那么对于一个不是科学家的人来说,当科学被AI加速,他们会在自己的生活里注意到什么?他们为什么应该在乎?这对他们意味着什么?
马蒂亚斯: 首先,我们现在拥有的AI系统是智能体系统(agentic systems),能够接手今天需要专家才能做的任务。这会为更多的人打开机会,在许多学科里扮演重要角色。比如,已经有从没写过代码的人在开发应用了。我真的听到过,一位在创业公司工作的人告诉我:我负责和客户打交道,他们向我要一个功能,很多时候我根本不用请工程师做任何事,我自己就能把原型做出来。想想看,这相当有力量。同样,如果你是科学家,需要另一个学科的帮助,你不必再花时间去找合适的人脉,可以用AI来帮你。所以这种连接学科的能力会越来越强大。
顺便说一个有意思的点。回想我快二十年前刚进谷歌的时候,我们就一直要求产品经理受过计算机科学教育。即便他们的工作不是写代码,也要懂怎样写代码。我们一直期望研究者能写代码,一直期望工程师能解决研究问题。所以理解不同学科这个理念一直都在。现在我认为,向所有人敞开的机会更大了。更多的人可以开发应用、写代码,更多的人可以成为某个领域的专家,而有了AI,他们能运用正确的研究技能,在科学研究中做出贡献,这在过去是不可想象的。
主持人: 对,我们正处在“氛围编程”(vibe coding)的时代,很快就会走到“氛围药物发现”,普通人也能想出新分子。
主持人: 说到洪水预测,这是不是终于读懂了这颗星球一直在发出的信号?
马蒂亚斯: 让我先从“为什么要做洪水预测”说起。我前面提过,我们总要从“为什么”开始:我们要做的事会产生什么影响?在这件事上,我负责我们称之为“危机应对”或“危机韧性”的工作已经有十年左右了。危机发生时人们会来谷歌,我们就研究怎样在任何危机中给他们可以据以行动的信息,也确实推出了产品,比如“SOS警报”。但我发现一件事:我们能帮多大忙,取决于我们能分享的信息有多好。而事实证明,在最具毁灭性的自然灾害,也就是每年造成数千人死亡的洪水面前,我们帮不上忙。因为帮忙的最好办法,是预测什么将要来临,让人们能采取行动。十年前我问洪水专家,怎样才能做出预测?普遍的共识是,这太难了,因为一个有价值的预测必须是高置信度的,变量太多,等等。我们的想法是:每个人都说太难,但这是一个重要的问题,值得去攻,那就看看能不能取得进展。
我们从一些研究开始。有了足够进展后,我们在印度做了试点,证明在非常严苛的约束下也能做出合理的预测,足以让我感到乐观。事实上,将近八年前,我们就发表了一篇论文,提出一个假设:未来我们能借助机器学习和云计算把它规模化。我当时完全不知道怎么做到,但有足够的迹象表明,我们可以把所有这些变量放进来,用机器学习去处理。这确实需要很多轮循环:从研究到实地试验,到弄清我们能做什么,到与学术界和政府合作,让他们收集数据,我们在上面建机器学习模型,最终推动这方面的科学。我们在《自然》上发表了论文,提出了我们所说的全球水文模型(global hydrologic model)。我们真正展示的是,可以建立一个模型,从数据充足地区的洪水事件中学习,再应用到数据不那么充足的地区。一个当初被引号里称作“不可能”的问题,我们现在不仅推动了它的科学,同一支团队还建成了一个系统,如今能在150个国家提供最长七天的预测,覆盖20亿人。它已经在拯救生命,因为它就在那里,通过我们所说的“洪水中心”(Flood Hub)向应急人员和政府开放。
这就是一个例子:迭代,从问题出发,迈出研究的一步,把它变成现实,再问下一个问题。我喜欢把这叫做“研究的魔法循环”。某种意义上,研究之所以比以往任何时候都更令人兴奋,一个原因就是这个魔法循环比以往加速得更快,而且还在进一步加速。有了AI,我们可以用AI更快地推动研究,再用AI帮助把研究变成现实,影响是巨大的。在这个例子里,是真正在救命。
主持人: 太不可思议了。想象一下,提前七天收到一条通知,说这里将要发生洪水。这真的会改变人的命运。
马蒂亚斯: 几个月前,尼日利亚政府和一个叫GiveDirectly的组织就通过洪水中心的接口,提前向村民发钱,让他们能及时撤离。但故事并没有到此结束,因为在任何时刻,你都会到达某个水平:这是我们能做的,那些是我们还没解决的问题。就洪水而言,我们又撞上了另一堵墙:这些模型都只对所谓的“河流洪水”有效,也就是河水漫出河道。可一些最具毁灭性的洪水其实是山洪暴发(flash floods),它们来得出人意料,而且通常我们没有足够的数据为它们建模。直到大约去年,这还是个没解决的问题。于是下一个创新来了,它来自一个观察:我们关心的这些洪水事件,至少在城市地区,通常都会被新闻报道。想法是用生成式AI,用Gemini去读二十年的新闻,找出新闻里报道的洪水事件,报道通常也会描述它们何时发生。这些都是公开信息,有很多种语言,本质上就建成了一个事件数据库。我们把这项技术叫做Groundsource,本质上是建立了一套“地面真值”数据,好在上面建AI模型。我们用生成式AI找出了260万起山洪事件,然后就能基于它们建立机器学习模型、AI模型。现在城市山洪的预测也在洪水中心上线了。一个一年前实际上还无解的问题,靠生成式AI,加上“可以用这些数据、可以借助代理指标”这个观察,就被解决了。
这个范式本身并不新。多年前我和团队开发了谷歌趋势,我们看到的一个很有用的范式,就是怎样用谷歌趋势,有人称之为“意图数据库”,来识别各种现象:疫情爆发的现象,政治事件的现象,等等,仅仅基于聚合后的趋势。现在有了Groundsource,我们可以把它带到下一个层级,而且也开放给其他人使用。城市山洪就是一个例子:把生成式AI和公开信息结合起来,去解决一个能救命的社会难题。
主持人: 危机韧性这项工作,你的北极星是什么?你们要去哪里?
马蒂亚斯: 好问题。洪水预测显然只是其中一个问题。还有大量研究在改进比如风暴预测。我们在谷歌DeepMind的同事做得非常出色,在推动这方面的研究,并与谷歌研究院合作,推出了我们叫作WeatherNext的天气预测,包括某些极端天气。我们也在研究野火探测,同样是研究怎样用卫星影像来帮助预测野火。我们还和其他伙伴一起发起了一个叫FireSat的项目,要把五十多颗、六十来颗卫星送入轨道,一旦全部就位,就能每二十分钟扫描地球上的每一个点,识别出像这个房间这么大的火情。
主持人: 哇。
马蒂亚斯: 当我想所有这些危机韧性的任务,想我们的目标是什么、要去哪里,北极星非常简单:没有人应该再被一场朝自己袭来的自然灾害“突袭”。这就是我们要解决的问题。怎样用预测让人们有所准备,保护自己和财产的安全,并采取行动。这是我们要去的方向。
而所有这些技术,要问出对的问题,你需要能够就这个世界提问:关于洪水、天气、风暴、高温等等。到了某个时点我们也意识到,其实我们真正想要的,是“星球智能”(planetary intelligence)。如果我们把所有这些地理空间模型汇集起来,把卫星影像带进来,建更多卫星模型,带进数据,再带进一个我们开发的叫“人口动态”(Population Dynamics)的模型,它本质上是一个关于人口流动的基础模型,在新冠期间的分析中就相当重要。如果把这一切合成一个模型家族,我们叫它“谷歌地球AI”(Google Earth AI),并在上面加一层智能体,你就可以就这颗星球提出任何问题。比如在危机韧性的场景下,你不仅可以问洪水或风暴会袭击哪里,还可以问哪些社区最脆弱,撤离他们需要哪些行动,哪些基础设施会受影响,需要提前做什么。再想想公共卫生。我们在西奈山医院、波士顿儿童医院和哈佛的合作伙伴最近发表了一篇论文,讲怎样用地球AI在邮政编码的粒度上分析麻疹疫苗接种情况。公共卫生或流行病学,很大程度上就是把疫情爆发和公共卫生现象与地球、与地点连接起来,与那些地方的经济状况连接起来,与谁接种了、谁没接种这样的聚合层面的因素连接起来。已经有许多伙伴在公共卫生上做了一批工作,包括Cooper/Smith、世界卫生组织等,他们显然在研究怎样用地球AI应对霍乱疫情,或者眼下的埃博拉疫情。所以公共卫生是另一大领域,危机韧性是另一大领域,甚至对企业也是。很多企业都关心从星球视角看正在发生什么。比如一家营销公司,WPP就是我们的合作伙伴,在用地球AI回答商业问题。如果你是物流公司或仓储公司,你也想就这颗星球提问。可以是理解某种现象,可以是公共卫生危机,甚至只是出于科学或教育目的去理解。所以把AI当作平台来获得星球智能,是一个迷人的方式,能把我们做的一切都提升一级。不再是一次只解决一个问题,而是把它们汇聚起来,用AI把一切连接得天衣无缝。
主持人: 如果顺着我们之前谈环境智能的线索往下拉,似乎很多公司在为自己的组织建一个智能层,而谷歌在为这颗星球建一个智能层,你可以和星球、和世界对话。我在论文里读到的一些例子,比如你是一位环保人士,有座城市迫于压力要修一条路,你可以问地球AI:对某个物种来说,A森林还是B森林更关键?或者你是一位卫生专家,可以问:这场霍乱接下来会蔓延到哪里?完全不需要知道或理解背后运转的所有智能、所有不同的模型,流行病学的、地理空间的。这是不是通向环境智能层的一条入口匝道?
马蒂亚斯: 某种意义上是的。因为这正是建平台的美妙之处:你为所有人打下一个新的地基,然后他们可以专注于更高一层。让我再举一个完全不同领域的例子,医疗。在医疗领域你也要建模型,比如语言模型。几年前我们研究过一个问题:能不能让语言模型理解医学信息?我们用的基准,是让语言模型参加美式医学执照考试。事实上,我们第一次证明可以调整一个语言模型,让它达到美国医学执照考试的及格线。等到这项工作在《自然》上发表时,我们已经有了能达到专家水平的模型,85%对比之前的65%,加上多模态则是91%。重要的是,它当时已经被合作伙伴用来测试各种应用。这又是我所说的研究的魔法循环:提出研究问题,应用它,再提出下一个研究问题。
做完这些之后,我们又问自己:怎样把我们加进模型里的这些能力更广泛地开放出来,让其他人在上面建造?为此我们有一个叫HAI-DEF的平台,本质上是一批开放模型,供他人构建。我们还开发了叫MedGemma的东西。Gemma是我们的开源语言模型,是Gemini的开源版本;MedGemma就是在Gemma之上,构建我们能做出的最好的医疗模型,各种类型都有。我们一年多前发布了它,已经有超过500万次下载。在这些下载背后,我们也听说了成千上万个应用。这些应用的起点,是一个已经更懂医学信息的模型,你还可以把它用于各种场景,比如医学术语的语音识别,这就是其中一个模型。我听说有一家创业公司在为疾病建立基础模型,把MedGemma当作起点,这也许为他们省下了几年的大量投入,让他们直接去建自己解决问题需要的东西。最近我还听到一个案例:乌干达一个村庄的一位医疗工作者,遇到一位即将分娩的孕妇,情况很紧张。她没有网络连接,但手机上有一个用MedGemma构建的应用,她靠它得到了关于病情的建议。这是第三方基于MedGemma开发的应用,可能同时救了母亲和婴儿。
主持人: 哇。
马蒂亚斯: 而这只是众多案例中的一个,很多我们大概根本不知道。这就是平台的力量,就是把模型开放出来、让别人使用的力量。顺便说一句,就在几天前,我们把洪水预测模型也开源了,其他人也可以在上面建造。
主持人: 对,人工智能不是天花板,而是新的地板,科学家和整个社会从这块地板上起跳。所有人都站在AI之上往上走。
马蒂亚斯: 对,这当然只是一个方向。说到医疗,这是AI显然会对社会、对人产生巨大影响的领域之一。在语言理解能力的基础上,我们也开始问自己:怎样把它在各个层面融入工作流程?有一些是传统层面的,传统AI意义上的。比如我们对糖尿病视网膜病变做过研究,这种病症的筛查能让人免于失明。这项研究已经有十年了,但这些年我们和印度、泰国的合作伙伴把它变成了现实,到现在已经完成了超过一百万次筛查,可以让成千上万的人免于失明。我们最近还与英国国家医疗服务体系(NHS)发表了研究,讲怎样用机器学习辅助乳腺X线筛查,看它怎样融入工作流程。两篇论文都发表在《自然》上,表明AI能把漏诊减少25%,为放射科医生省回40%的时间。这些都是研究走向现实的步骤。
另一个方向是,想想医学诊断的体验,很大一部分其实就是与医生、与从业者的对话。既然我们现在有了能提供可信医学信息的语言模型,那我们研究的问题是:能不能把它用作诊断的一部分,帮助推动这场对话?为了检验这条路的可行性,我们在《自然》和其他刊物上发表了一系列论文,表明它在多项指标上都能起到辅助作用,顺便说一句,包括有用性,甚至包括共情。就在最近,我们宣布与Included Health合作,在实际场景中测试它对从业者是否真的有用、有帮助。我们采取的是一种非常审慎的方法:严格测试,公开发表,确保我们衡量得对,然后以尽可能好的方式去试,再在此基础上往前推。同样,最近我们发布了谷歌健康应用(Google Health app),根据手表上的传感器数据向人们提供关于自身健康的信息。它很大程度上基于一系列研究,研究的是在个性化场景下使用大语言模型,怎样把这些信息转化为对人有帮助的洞见,并通过研究严格检验,再变成现实。所有这些都是研究魔法循环的体现:提出问题,做研究,应用到现实,再提出下一个问题,如此迭代。
主持人: 往前看的话,你认为哪些科学问题会定义谷歌的下一个十年,也定义世界的下一个十年?
马蒂亚斯: 当我想科学问题的时候,再说一次,在我能想到的几乎每一个领域,我们在解锁所需知识这件事上都还处在非常早的阶段。尽管我们为研究突破感到兴奋,但想想,我们对大脑如何工作的理解到了哪一步?药物设计到了哪一步?材料设计到了哪一步?对这颗星球的理解,到了能够预测的程度了吗?我们为什么还会被“突袭”?为什么不能确切知道将要发生什么,然后照此规划?这会影响我们的生活。粮食安全呢?每一个领域都有大量工作要做。还有能源,我们谈了很多能源问题,怎么解决。我很有把握,随着科学突破,我们在能源、资源、效率上也会看到突破。当你想到我们生活中、日常里、彼此交往中的所有大问题时,都是如此。
我们前面谈到教育。对我来说,教育也许是任何社会最重要的一件事,它就是未来。如果我们能让每个人按自己的天赋成长,然后掌握未来的AI技术和各种技术去解决其他问题,那潜力是巨大的,这里的提升空间也是巨大的。而且,教师的角色会比以往任何时候都更重要。我们每个人都受过老师的启发,我相信,正是他们帮助定义了我们是谁、我们在人生中做出什么选择。希望这能让更多的老师去启发学生,借助AI加速我们能学到的东西,还让它更有趣。这些都是我们方方面面都有的大机遇。
还有一个我特别关注的领域,是看我们究竟怎样帮助创造力。这会不断演变,因为AI正在成为一种工具,更多的人将能够表达自己,各个学科都会发生一些变化。我认为创造力、人性,是我们生活中最重要的部分。所以看我们怎样在技术上建造,去放大它,是我非常想看到的事。
主持人: 量子在这一切中处于什么位置?当我们想下一个十年的时候,看量子的时间线,过去几十年是在证明这套物理能以可扩展的方式运转。我试着给不懂量子的人解释一下,请你纠正我的科学。量子比特(qubit)是量子计算机的基本单元,它们脆弱得令人沮丧。但要建造一台能解决我们想让它解决的重大问题的量子计算机,比如模拟一个分子或一个复杂系统,你必须能往系统里加更多的量子比特。历史上这一直非常困难,所以Willow才是这么大的里程碑,它证明了你可以建更大的量子计算机,而且它随着时间还能变得更可靠。那么,要真正实现量子计算的愿景,还剩下什么要做?剩下的阶段比过去更难、更容易,还是完全不同类型的挑战?
马蒂亚斯: 在量子领域,纠错这个概念一直被认为是我们必须突破的障碍之一。去年我们凭Willow芯片在这方面取得了不错的进展。量子是那种魔法循环转得更慢的领域,如果可以这么说的话。事实上,我们量子AI实验室所建造的东西,其理论基础的一些工作可以追溯到上世纪八十年代,是米歇尔·德沃雷(Michel Devoret)、约翰·马丁尼斯(John Martinis)和约翰·克拉克(John Clarke)的工作,他们今年刚获得了诺贝尔物理学奖。顺便说一句,米歇尔现在是我们硬件团队的首席科学家。
量子计算机的前提是我们已经知道,因为它是一种不同的范式,因为量子比特与经典计算机的本质不同,有某些问题量子计算机能比经典计算机快得多地解决。我们有过一个例子,一个问题比经典计算机快10的25次方年,一后面25个零。最近我们又展示了所谓“可验证的优势”,用回声算法(Quantum Echoes)解决一个可以用其他方式验证的问题,量子计算机比经典计算机快13000倍。量子计算对密码学显然也有影响,九十年代的肖尔算法(Shor's algorithm)就表明,量子计算机能解决一个被认为经典计算机无法解决的问题。重要的是,我们已经知道有几十种应用,量子计算机会有优势,而且它还能生成大量知识,供AI在分子层面构建AI模型,如果可以这么说的话。我特别兴奋的一件事是,随着我们越来越接近实用的量子计算机,我相当有把握会看到更多聪明人投入进来,发掘量子计算能带来的许多新机遇。这是一个新范式,新范式会创造新能力,其中很多,我相信,会比我们今天用现有技术能做的有相当戏剧性的改进。
主持人: 那下一个范式更多是硬件的事吗?你看到时间表了吗?我们说的是五年吗?
马蒂亚斯: 我们确实相信,几年之内我们会更接近实用的量子计算。至于它是什么,我认为我们在技术上一次又一次看到的,是各个层次之间的扩散。硬件通常是基础,在它之上你当然要开发软件或应用,但很多时候,正是从“能做到什么”里得到的洞见,反过来告诉你想要建造什么。肖尔算法就是一个推动因素,它促使人们去建更多东西,去问“我们需要什么才能支持它”,这又成了一个动力,去看为此需要解决哪些问题。所以我认为,我们会看到各层次之间这种美妙的互动:我们衡量的问题,解决它们的技术,以及从算法、软件、硬件等角度看解决它们需要什么。这正是未来多年创新的燃料之一。
主持人: 对,一旦量子计算机成为现实,我们就能解决今天不可能的问题。而解决了那些问题,正如你说的魔法循环,又会打开一整轮新的问题、新的创新。
主持人: 显然你做的是好几个长达数十年的项目。能遇到一个只做一个这种项目的人就很难得了,而你同时做好几个。当有些项目还涉及把确实不可能的事变成技术上可能的事时,你怎样带领团队、设定里程碑、定义进展?
马蒂亚斯: 我认为,探索创新和研究最令人兴奋的地方,就在于一直问这些问题:首先,什么事要紧?我们应该在哪里取得进展,而且我们有条件取得这样的进展?然后找到合适的时机把问题拔高一级。我总爱问一个问题:在这个领域,你能解决的更大的问题会是什么?我们怎样迈出一个跃迁式的台阶?顺便说,这绝非易事,因为在创新和研究中,你做的每件事都总有下一个令人兴奋的问题可以问,所以要问出“下一个大台阶是什么”并不简单。学术研究也是如此。你要问下一个大问题,而且是你真能有所作为的问题,随机地提问是没有意义的。所以就是在我们的每一个领域里不断追问:什么会带来改变?然后,我们能做什么,才能去问这个下一个大问题?
谷歌研究院拥有世界上最好的一批人才,出色的科学家和工程师,有机会去做一些最令人兴奋的问题。谷歌有八款产品的月活跃用户超过20亿。我们的使命也包括产生社会影响,与学术伙伴、政府和其他各方合作,我们还拥有惊人的基础设施,这也是一份福气,还有真正触达所有人的应用。所有这些要素,都能帮助我们问出对的问题,再把手头的任何研究突破拿去应用,和谷歌各处出色的伙伴一起把它变成现实。真正持续不变的问题是:下一批能带来改变、能产生研究突破的大问题是什么?
就我个人而言,我一次又一次发现,产生创新最快的办法,是朝着一个非常大的目标,不断迈出相对小的步子。回到洪水预测,它就是一次次迭代,每一步都相对于此前的成果再跃迁一级,很多时候需要一次研究突破才能到达。医疗也一样,几年前被视为既定的东西,现在我们在问更大的问题,试图再往上推一级。这就是研究、创新和技术开发令人兴奋的地方。对我来说,最令人兴奋的是,我们和团队有机会既做最前沿的研究问题,取得可以发表在最受尊敬的刊物上、从《自然》到NeurIPS的研究突破,又把它们变成现实,看到它们真正影响产品、科学和社会。
主持人: 那如果第一步在今天看来就是不可能的,你告诉研究团队:“这是你们的第一个里程碑,可能需要六个月到十年才能走到第一步。”你怎样给不可能设定基准?
马蒂亚斯: 首先,我们问的问题并不都属于“不可能”那一类,很多时候你能看到:哦,我在这里能有所作为,在那里也能。其次,我们一直在抬高标准,因为在某种意义上,现在人人都在用AI解决问题,所以我们真正要聚焦的,是那些在已知范围内更难解决的领域,那才是研究突破。所以问题始终是,我会称之为“影响驱动”:我们能产生什么影响?为了产生这种影响,应该把资源投在哪里?在哪里能产生最大的影响、最大的突破?通常我认为,对我来说最重要的问题,正是那些会带来跃迁、望向地平线、就在拐角处的问题。从研究的角度看,这些是令人兴奋的问题;而当我们取得研究突破并把它变成现实时,它也会产生最大的影响。
主持人: 约西,这是一次愉快的交谈。非常感谢你。
马蒂亚斯: 谢谢你,谢谢这次对话。
Google Research 负责人 Yossi Matias 在访谈中阐述了他的"研究魔力循环"(提出问题→研究突破→落地应用→提出更大问题)方法论,并以生成式 UI、AI Co-Scientist、洪水预测、MedGemma 和量子计算为例,论证 AI 正从"回答问题的工具"转变为加速科学发现和构建"环境智能/行星智能"平台的新底座。

微信公众号