编者按:这场对谈录制于 World Labs 新一代世界模型 Atlas 发布的次日,三位 World Labs 的创始人同席:李飞飞(联合创始人兼 CEO、斯坦福大学教授)、贾斯汀·约翰逊(联合创始人,Atlas 的技术负责人)、本·米尔登霍尔(联合创始人,NeRF 的作者)。话题从 Atlas 究竟做了什么讲起,一路回到公司成立之初的路线抉择,再谈到创作工具、机器人仿真与「新视角预测是否 AI 完备」这样的根本问题。本文依据现场录音编译整理,只删去口语枝节、寒暄与重复,论点、例子与语气一律保留。
主持人: 昨天是个大日子,你们发布了一个新的前沿模型,反响非常好,而且还在持续发酵。我想这场对话不妨这样安排:先把昨天发布的东西讲清楚,然后再往回走,一步步回到历史。贾斯汀,要不你先讲讲昨天发布的是什么,为什么它重要?
约翰逊: 好。Atlas 是我们新一代的世界模型(world model)。它做三件基本的事:生成世界、重建世界、仿真世界。在这三件事里面,又有几项主要能力。
第一,它的相机条件生成(camera conditioned generation)做得非常好。你可以输入一张图,再配上一条相机轨迹,用这条轨迹去操纵模型,让它沿着你想要的任意视角生成画面。
第二,它非常擅长稀疏三维重建(sparse 3D reconstruction)。你可以输入一帧,也可以输入多帧,最多一百帧真实世界的视图,用它们把真实世界重建出来。重建的结果有两种形态:一种是在空间里穿行的视频,一种是显式的三维重建。
第三,它可以用来做仿真。这一块我们展示了两样东西,一样是那些「子弹时间」的视频,在网上引起了很多关注,另一样是机器人仿真。
主持人: 什么叫子弹时间视频?
约翰逊: 这个说法来自《黑客帝国》。第一部里有个著名的镜头,尼奥往后仰倒。
主持人: 对,想起来了。
约翰逊: 就是那个。他往后倒下去,画面是慢动作,镜头绕着他整整转一圈。他们当年拍这个镜头的办法,是架一圈相机,几百台。人在摄影棚里绿幕前倒下去,几百台相机同时从各自的角度拍,再用这几百台相机的素材合成出《黑客帝国》里那个著名的镜头。
现在用 Atlas,我们最少只要三台相机就能做同样的事。不用摄影棚、不用绿幕、不用昂贵的标定。我们就是把三台 iPhone 架在三个三脚架上,拍一段正在发生的事,比如有人投篮,有人把一颗草莓丢进一碗牛奶里。然后从这三段 iPhone 视频出发,我们可以重新取景,把时间冻住,让镜头在牛奶溅起来的那一刻飞进去,拿到那种时间凝固的惊人画面。就用这么几台相机。
主持人: 能不能用最简单的话说清楚 Atlas 到底做什么?输入是什么,输出是什么?
约翰逊: 可以。Atlas 最核心、最根本的一条原则是:它做的是新视角预测(new view prediction)。这是一个非常根本的原语(primitive),我们认为它对基础模型来说是全新的东西,此前没有人做过。
我们知道,大语言模型建立在下一个词元预测(next token prediction)之上;我们也见过视频模型,它们建立在下一帧预测(next frame prediction)之上。Atlas 是真正意义上的新视角预测。你给它若干张某个场景的视图,或者一段对场景的描述,这些东西进入我们所说的「空间上下文」(spatial context),它隐含地描述了我们要谈论的是哪一个世界。然后你可以把一台虚拟相机指向时空中的任意一点,Atlas 会知道,从那个时空位置看过去,这个世界应该长什么样。
主持人: 现在外面有成千上万的视频模型,个个都自称世界模型,个个都说自己能出新视角。你能不能更具体地把 Atlas 和它们区分开?
米尔登霍尔: 我觉得贾斯汀刚才说的空间上下文那一点,在这里极其关键。视频模型有很多,其中不少是靠单图输入,或者靠首帧到尾帧的插值出名的。现在我们也开始看到一些模型能做那种「全参考」,一次塞进二三十张、五十张图。
但 Atlas 的关键在于,你放进去的每一帧,对模型来说都有一个空间上被锚定的含义。它不是一张任由模型自己去解读的图片,也不是那种你只能在文字提示里跟它反复掰扯、争取它照你说的做的东西。在 Atlas 里,每一张图都带着一个与之对应的三维相机位姿(camera pose),这意味着你可以以极高的精度完成重建这件事。
比如我们有这个房间四个角落各一张照片,把它们放进模型,你会得到这个房间里所有东西的精确复现。它不会去猜另一个角落有什么,也不会去猜物体之间的关系,它就是把你给它的东西原样再现出来。
这件事也可以用在创作和想象的方向上。你拿两张照片,一张来自某次 AI 生成,一张来自真实地点,你可以把它们摆放、布置到你要的位置上,从而搭出一段带明确导演意图的穿行镜头,镜头怎么看、怎么走,完全由你放内容的确切位置来决定。这跟视频模型那种只有较高层级的文字控制、只能一遍遍重抽的老虎机式体验,我认为是非常不同的。
主持人: 这算是把传统视频模型放大之后的自然结果吗,还是一套新的架构?
约翰逊: 我觉得它是相当新的东西,有几个原因。
我们常讲的一点是,它在同一个模型里同时做生成和重建。就像本刚才说的,这东西能拿这个房间的几张视图,把房间里的一切按你看到的样子重建出来。而历史上,重建一直是计算机视觉里自成一体的子领域,有自己的专门任务、自己的专门模型。生成则是所有文生视频模型擅长的事,是这几年那些大扩散模型擅长的事,它们在创作类应用上很好用:我想象一个从来不存在的东西。现在有了 Atlas,我们第一次把视觉智能的这两个部分放进了同一个模型,它能在一套架构里同时做三维重建和生成。
为了做到这一点,我们改了几件事。一是必须从一开始就让它多模态。这东西原生支持文本、原生支持图像、原生支持视频,也原生支持相机位姿作为模型的输入,我认为此前没有人在预训练阶段这么做过。此外,它把三维当作一种原生模态来处理。所以这个模型从最开始就是按原生多模态设计的,据我所知没有别人这样做。
主持人: 打断一下,我对这个领域不算太熟。三维指的是深度,还是模型之类的,这具体是什么意思?
约翰逊: 我们目前采用的形式是深度图(depth map)。也就是说,一帧画面带着一台虚拟相机,告诉你它在三维空间中的位置,相机位置和相机参数是模型的原生输入。挂在这个相机位置上的,既可以是 RGB,告诉你那个位置看过去是什么样子,也可以是一张深度图,告诉你那个位置在三维空间里的结构是什么样子。所以文本、图像、视频、三维相机,这些模态是它以多模态方式一起处理的。
李飞飞: 我想补一句,因为贾斯汀刚才说的,还有本说的,其实特别重要,而且被严重低估了。这是我们第一次让像素生成和像素重建统一起来。
在计算机视觉的世界里,这个领域已经存在半个多世纪了。我在这个领域待了几十年,真的无法告诉你有多少篇博士论文是写重建或者新视角合成的。而且我们这个领域传统上是分轨的,你去参加一次计算机视觉会议,会看到像素生成一轨、识别一轨、三维重建又一轨。而这是一个优雅的模型,它通过锚定视角、锚定视角估计,把重建和生成这两个问题合到了一起,这股力量之大,怎么说都不为过。
主持人: 我们退一步。公司刚成立的时候,我记得你说你们要解决的是空间智能(spatial intelligence)。现在有了这个新模型。以一个外行的眼光看,我觉得它非常通用:那边有下一个词元预测,这边有新视角预测,你从一组视图里得到一个新视图。你能不能勾勒一下,这一步对空间智能这个大问题究竟意味着什么?也许可以先说说空间智能到底指什么。
李飞飞: 空间智能最终必须让我们能够做三件事:生成这个空间,在其中进行推理,以及在其中编辑和交互。
我们可以争论它是三维还是四维。归根到底,加上时间维度,它是四维的。但哪怕只是三维,这些也是一个人,或者说空间智能,必须能够胜任的基本任务。在此基础上我们才谈得上渲染、仿真、以及规划行动。而要做到这些,有一个必须先解决的根本问题:理解空间的几何、结构和物理。
我确实认为 Atlas 是一次实质性的推进,因为现在对每一帧画面,你都能生成、估计出一条关键信息,也就是视角、相机位姿。这是关于空间几何最要紧的信息。正是它带来了我们在模型下游看到的那些涌现行为,我们在博客里展示了这些。
所以在通往空间智能的路上,生成像素当然是早期的一步,你所说的那无数模型都做到了。但生成真正具备空间上下文、真正被空间锚定的像素,绝对是另一个重大台阶。这一步很难,而 Atlas 迈出去了。
我们当然可以继续往下走。还有第四个维度,时间,它会带来动态性。还有更高保真的仿真,以及对空间更精细的刻画。这些都是空间智能路线图的一部分。
主持人: 好,我很想深挖它要去哪里。但先聊聊你们是怎么走到这一步的。World Labs 成立多久了?
李飞飞: 两年半。
主持人: 而且你们之前已经发布过模型。为什么当初不直接做 Atlas?
李飞飞: 好问题。贾斯汀的团队需要很多芯片。
约翰逊: 对,把这东西的规模拉起来,需要大量 GPU。去年我们发布了 Marble 世界模型,那是我们推出的第一个真正意义上的大型世界模型,现在的 Marble 产品就跑在它上面。Marble 很棒,它能接受图片、视频、文字提示,用这些生成三维世界。
Marble 和 Atlas 最大的差别之一,恰恰在输出模态上。Marble 的输出高度集中在高斯泼溅(Gaussian splat)这一种表示上,不管你输入什么,它输出的都是一个用高斯泼溅表示的三维世界。高斯泼溅确实很有用,它很好,容易渲染,在移动设备和 VR 设备上渲染效率高,能和游戏引擎、仿真引擎互通,优点不少。但我认为在上一代 Marble 模型里,它成了一个瓶颈。
所以做 Atlas 的时候,我们把这件事重新设计了一遍。我们意识到,这些模态需要在更早的阶段就分岔出来,让它们在模型内部以更统一的方式运转。于是在 Atlas 里,最根本的原语不再是「生成一个高斯泼溅世界」,而是我们刚才说的新视角预测。这个原语既能生成 RGB 画面,也能生成三维;需要的时候,我们照样可以用它做出漂亮的高斯泼溅世界。但当我们不需要的时候,就不必让所有输出都从高斯泼溅这个口子里挤出去。要弄清楚这几种表示各自的利弊,真的付出了很多血汗。这是一方面。
另一方面,你得一级一级爬缩放的梯子。你得先做小实验、训小模型,去建立自己的判断:什么东西行得通,什么东西能扩上去。如果你能立刻知道哪条路能扩,那你当然应该直接去做那条路。但我们创办公司的时候,世界完全是另一个样子,技术也完全是另一个样子。空间智能根本没有缩放定律。我们对它该走到哪里有很多野心,但还是花了几轮迭代,才碰到这套我们认为「就是它了」的表述方式。这一套是能扩上去的。
主持人: 本,你是 NeRF 的作者,做过大量三维和重建的工作。对我来说,有了多张视图就能得到一个三维的东西,这件事并不显然,但你的职业生涯基本就是在把东西变成三维。能不能讲讲这一步?
米尔登霍尔: 是的,我职业生涯里绝大部分时间都在做从图像生成三维的事。公司早期我们其实反复讨论过这个问题:三维到底该怎么来?是先合成多个视角再从中构建三维,还是直接奔着三维去?领域里对这两条路哪条会胜出、哪条能更早收获成果,一直有很多不确定。
但我当时就很笃定,原因是我看到了那种近乎蛮力的扩展的力量。我说的不是真正意义上的模型扩展,是很小很小的、婴儿级别的扩展,就是过去三年里稠密重建(dense reconstruction)上发生的那种扩展。
主持人: 为什么叫「稠密」?因为我知道后面要谈稀疏,我想确保大家明白稠密和稀疏分别是什么。
米尔登霍尔: 好。我觉得这一点在商业化那一面也是根本性的挑战之一,就是三维重建技术很难做成产品。
一般人的直觉是这样的:我拍了这个物体三张照片,或者拍了这个房间六张照片,我自己看这些照片,脑子里就能把它们拼起来,能把空缺补上,能明白这是什么。但在那种数据驱动的先验,和蛮力式的稠密重建之间,一直没有真正的调和。稠密重建更接近科学成像或者医学成像:你必须说,凡是我希望出现在重建结果里的每一样东西,我都需要至少三到四个视角。
你想想看,就在这个房间里,麦克风底下、桌子底下、每一道缝隙和夹角、植物的叶片之间,要真拿到一张覆盖到每一个角落的图像,那是一件极其枯燥、极其耗时的活,你得绕着房间一点点走。你们都见过我在各种地方跑来跑去做采集。对训练有素的人来说,也许几分钟;但如果你把一台普通手机或者采集设备交给一个第一次做这件事的普通消费者,哪怕是专业人士,大概要花一个小时。我见过有人第一次扫描一个多房间的空间,走了两个小时才拿到足够的覆盖。这就是一个极其累人、极其乏味的循环。
所以我们说稠密,真的就是字面意义上的稠密。这个房间我要拍一百张、两百张、三百张照片才能采下来。而我们想做的,是把它降到三张。
主持人: 三张。
米尔登霍尔: 我们说的是五十倍到一百倍的降幅。到了那个量级,什么样的采集可以拿来重建,这笔账整个就翻过来了。你可以回头去用你已有的影像,可以用你在网上找到的素材去搭场景,可以用随手拍的视频,把过去你根本不会当成「可重建素材」的镜头挖出来,重新变成三维。这件事我们用 Atlas 玩了很多。我拿过一堆自己以前根本跑不通的采集,丢进这个系统,第一次看到了重建结果;或者拿旧采集,把其中百分之九十五的照片扔掉,再去想象一些角度,那是传统 NeRF 或者泼溅方式永远给不了我的。
李飞飞: 网站上那些演示里有一个被低估了,就是斯坦福那个。本用三到二十五张图片,把整个斯坦福方庭重建了出来。但关键在于,我们得从空中视角展示它,而每一张输入图片,都是本站在地面上、从地面拍的。所以你看到的一切都是生成出来的,但它们遵守重建的法则。这真的很神奇。
约翰逊: 而这正是生成和重建必须以一种根本的方式互相配合的地方。
在本刚才说的那种经典重建里,你之所以需要那么多视图,是因为我需要多张图像,把三维空间里的这个点三角化出来,从多个视角看到它。传统方案里这是刚性要求。反过来,凡是没有被这些视图拍到的东西,凡是没有在任何一张输入视图里出现过的像素,在三维重建里都会是一个洞。因为一样东西既然没有在输入里出现过,你就得去想象它,把空缺补上。而这从根本上说是一个生成过程。
所以哪怕在这个房间里,哪怕我们放本拿着单反去拍几百张视图,这位做稠密采集的世界级专家,也照样会漏掉一些地方。他不可能拍到所有麦克风的底下、所有桌子的底下,或者所有椅子腿之间的缝隙。不管你拍多少视图,总会漏掉点什么。这就是模型里必须有生成这条机制的原因,因为你永远不可能拍全。你需要模型有生成的能力去想象:根据我看到的东西,先把能三角化的部分三角化出来,然后把那些注定没被拍到的地方补上。
米尔登霍尔: 这里还有件特别有意思的事:大语言模型早就把这个道理吃透了。头几年有过一场上下文长度的军备竞赛,一路从 12.8 万到 25.6 万到 51.2 万,再到一百万。现在人人都非常具体地明白上下文的价值,你用编程模型的时候会把上下文拉满,这是个硬问题,大家都有体感。
可是在图像和视频模型这一侧,从来没有人以同样有原则的方式去推这件事。没有人去把一段一小时的视频塞进模型,再做「大海捞针」式的检索,比如把第三十七分钟的那一帧找出来。而在重建和生成这里,事情完全同构:重建其实就是上下文非常长的生成,你往里面塞了很多东西。这才是真正能把这两件事连成一条连续谱的办法。
Atlas 让我们能做到以前用 Marble 永远做不到的事。Marble 有个根本性的卡点,老实说你塞不进几张图。而在 Atlas 里,我可以拿一次六十四张图的采集,做一整栋房子的穿行,所有东西都是被锚定的,要么是拍到过的,要么是几乎拍到过的,要么是从已有内容里稍作外推的。我把过去用两千张图做的多房间采集,压到三四十张输入,穿行的效果基本一样。这在以前完全不可想象,而它全靠这个能优雅扩展、可以往里面随便倒东西的上下文窗口。
主持人: 所以可以这样理解吗:稀疏的部分是你实际拍下来的那些照片,Atlas 这个模型把其余的视图造出来,然后你再用经典的重建方法去处理。大致是这样?
约翰逊: 某种意义上是的。Atlas 的妙处在于,不管你手上有多少输入,哪怕只有一张视图,你都可以一直把 Atlas 当成渲染引擎,用它产生你想要的任何别的东西。你可以像操纵一台虚拟相机那样在里面移动:我这里有一张图,我还想要那里一张、那里一张、那里一张。你先造出几张,然后再说,好,现在给我一段稠密的穿行。你可以分步骤地做,因为它是一个自回归模型。生成的过程中,往上下文里交互式地加什么、不加什么,由你来挑。
主持人: 让我真正想不通的是这一点。我的心智模型很简单:我有四张照片,模型得在它们之间做外推,而且外推出来的东西在重建时还必须对得上,它必须是三维的。我一直觉得扩散模型这类东西是视觉上很好看但不准确。我甚至不确定这里有没有一个问题,但房间怎么就对得上了?它凭什么是三维一致的?就靠数据多吗?
约翰逊: 部分是因为我们相信缩放假设。
主持人: 顺便我必须问一句,你们着手做这件事的时候,知道它会成吗?
约翰逊: 我相当确定。
主持人: 你确定吗?
李飞飞: 我们三个人对缩放定律都有绝对的信念,这一点我觉得是有的。但具体的架构选择和数据配比,魔鬼就藏在这些细节里。我看着贾斯汀和他的团队,从「我们真的不知道这要多久」,到「好像有点生命迹象了」,再到「哇,这个要成了」。没有人做过这件事,但我们主要是对两个假设有信念:一个是缩放定律假设,另一个是下一视角预测。
约翰逊: 我确实非常笃定它会成。我不确定的是它会成得这么好、这么快。我当时想,也许我们有机会一次做成,但一个新架构、新范式的模型,第一轮预训练就直接跑通,这种事本身就很离谱。所以我估计有一定概率,我们得再转几轮预训练,才能到我们想要的质量水平。
主持人: 那现在这套架构的缩放是不是快到头了?还需要下一次突破,还是说?
约翰逊: 不不,我们处在起点。
主持人: 真的?
约翰逊: 对。
主持人: 架构不用变?
约翰逊: 对,我们基本上处在起点,而且当下的限制主要来自算力。数据当然重要,飞飞老是强调这一点,但任何事情都有瓶颈,我认为继续把这东西扩上去的主要瓶颈其实是训练算力。
开发过程中我们训了一串模型,博客里也提到了一些,就是爬缩放梯子最开始的几轮。每一次我们把模型做得更大,每一次我们训得更久,每一次我们把它放到更多芯片上,它都会明显变好。我们在博客里展示的,当然是训过的最大最好的那个,但真正卡住它的不是规模,不是数据,也不是别的什么,而是我们定了一个发布的截止日期,所以只能倒推:在这个期限之前,我们负担得起训到什么程度。
李飞飞: 这里有个内部的小故事。贾斯汀和团队从小模型往稍大的模型训,一路有路线图。今年初夏的某一天,那个模型还不是现在 Atlas 的尺寸,比它小。本和贾斯汀把数据喂进去做视角生成。你们记得那张著名的桌子吧,NeRF 论文和后来很多论文里那张花园里的桌子。那天夜里我收到一条 Slack,我们都看到了本发的那条:我们的相机从桌子底下飞过去了。
米尔登霍尔: 还有那颗足球。
李飞飞: 对,还有那颗足球。
主持人: 那颗球是涌现出来的,还是原来照片里就有?
李飞飞: 是真实存在的。
主持人: 好。
李飞飞: 那天早上我们三个人对视了一眼,说,就是它了,我们要把这个做出来。这个决定我们五秒钟就下了。因为这个结果从来没有人见过。
主持人: 本,你能不能更具体地讲讲应用场景?World Labs 一直有很多做创意的用户,他们用它来保持二维图像、电影、三维、游戏等等的一致性。这次的模型是怎么拓展了这些场景,或者更好地服务了已有的场景?之后我想聊机器人。
米尔登霍尔: 好。其实挺有意思的,我们看到人们使用 Marble 的主要方式之一,恰恰就落在新视角预测这个场景上。
主持人: Marble 是你们上一代的产品。
米尔登霍尔: 对,是我们上一代产品。很多人拿这个产品,放一张图进去,得到一个完整的三维场景,是高斯泼溅形式的,然后从不同视角截几张图,就走了。我们看着就想,那我们直接把这些图做出来不就行了,这就是生成式 AI,挺好的。而且那个过程里有不少画质损耗,大家会说,这个泼溅其实可以更好看。那好,如果我们干脆用生成的方式去建模那些视角,同时保留那种模态的控制力呢?
所以哪怕只是视图合成这个核心能力,它作为一个学术问题已经存在很久了,但那是在「你要做一次非常稠密的采集」这个前提下的。生成式的视图合成,其实是个相当新的问题。
我们看到非常多的人在创作流水线里工作。大家的工作流是多阶段的,我不认为有哪一个人是用一个大一统的模型,哪怕是 Seedance 之类,去完成整件事的。人们会先从自己偏爱的那几个图像模型里拉出一堆故事板和情绪板,然后去不同的视频工具里,把这些图当关键帧接起来,之后再去剪辑、修改。所以我们看到 Marble 有一个很小众但非常明确的用途:给你一份「理智感」,让你的生成结果能落在某个三维一致的世界里。
我自己跟各种图像模型较过劲,想让它们给我同一个房间的不同视角,每次你一看就知道,东西的位置变了,它不稳定。哪怕就这一颗用例的种子,也说明水面之下藏着价值。人们已经和持久的三维状态打了几十年交道,在虚拟环境里模拟现实中的操作,有舞台、有道具、有各种元素,无论是为了一部电影、一档节目、一张营销图,还是搭一个游戏场景。
这种有状态、可持久的特性,对人们思考空间、随时间推进地打磨一个环境,是极其关键的。人们不会用那种转瞬即逝的方式思考:生成一个,再生成一个,扔掉,只留下我的文字提示。人们想要的是攒下一批资产,用这种方式去建构一个世界。
所以我们在做的事,是通过空间上下文这套机制,以及别的一些东西,把这个层级的控制力和精度交给用户,并且让他们能调整不同模态的输入,先从相机位姿和图像开始。往前走,我们希望给人更多控制力:对场景中元素的控制、编辑、交互等等。我认为这不仅能在我们已经看到的那些领域里打开更多用途,还会扩展到任何人们需要为一个真实空间做虚拟复现,或者做一次「预想象」的地方,比如建筑和施工。
我有一次跟一个给展会搭展位的人聊天。世界上有太多东西,你平时根本不会想到它们需要被制造出来,而这里面每一样,基本上都要经过一个相当磨人的虚拟设计阶段。在这个流程里,进到三维软件的那一段,是当下最费力、最耗人工的部分。比如你从创意总监、设计总监或者建筑师那里拿到一段口头意见、一张草图、一点很随手的东西,把它映射回三维表示里,这件事占掉了百分之九十五的工作量。你开完一个会拿到反馈,回去就是一周的修改。原因就在于我们的软件已经是几十年前的东西了,它从来没有变得像玩乐高、像捏陶、像用手直接摆弄、像用铅笔画草图那样自然。
这才是 AI 真正能为人们的工作流程释放巨大价值的地方,不管是创作类的应用,还是更偏工业、偏设计的场景。这也是真正驱动我去做各种不同口味的模型、去服务这些人的原因。
主持人: 我能理解它怎么帮到创作者,因为 Marble 已经在做了,也能理解它怎么延伸到设计和建筑。你们还收购了一家机器人公司。这个聊得比较少,尤其是放在 Atlas 的语境里,它和机器人是怎么对应上的?麻烦你们展开讲讲。
李飞飞: Atlas 其实是这块拼图的关键一环。我们收购了一家公司,原来叫 Synnex。它的核心技术是什么?现在它的核心技术是一套从真实到仿真、再从仿真回到真实的系统。
在机器人的场景里这意味着什么?假设你想训练一条机械臂,让它学会在工业环境里理线。首先你需要一大堆数据,去训练一个能完成理线动作的机器人策略。然后你要评估这个策略做得好不好。最后你把机器人部署到真实的理线环境里。
为了完成训练,这家公司,也就是现在我们的机器人团队,过去做的正是本刚才说的稠密重建:你去拍一个场景的照片,然后试着把那个环境重建出来。这个过程痛苦得要命,耗时、费力,严重拖慢了机器人从真实到仿真的速度。所以 Atlas 正是这件事的下一代技术。
而且这不只关乎理线或者别的某个任务。我们应该把视野拉开,认识到机器人现在最大的问题其实是数据。总有一天会是芯片,但眼下是数据。因为要采集机器人在真实世界里运转的数据太难了。而且你不只需要采集理线、洗碗这类具体情境的数据,还有一个非常重要的步骤叫随机化:你必须把同一个环境的条件随机化。线缆不能只按这一种方式弯折,它得能以别的方式弯;盒子可以有不同的尺寸、不同的颜色、不同的盖子;东西也可以出现在场景的不同位置。所以除了能从互联网上拿到的其他数据之外,你还得走一遍真实到仿真的流程,才能凑够这类数据。这个真实到仿真的环节,会被 Atlas 极大地改善。
这只是第一部分,也就是用现有技术去满足机器人的需求,因为我们还没有一个足够稳健、能用于机器人的前沿基础模型。但 Atlas 是一个全能模型,一个多模态模型,它接受不同种类的输入,也产生不同种类的输出。你完全可以想象,下一步是让 Atlas 吃进带动态的数据,那就真的能开始弥合动作规划和机器人与 Atlas 输出之间的鸿沟。这就是大致的路线。
约翰逊: 我想说的是,训练一个机器人策略,跟我们此前见过的任何 AI 应用都有根本性的不同。
如果你在生成一段代码、生成一张图、生成一段视频,模型本质上是在造一件成品。而这类成品,你可以在网上或者别的什么地方大量收集到。你想生成图像,世界上有大量图像;你想生成视频,有大量视频;你想生成一个代码库,也有大量代码库可以学。
机器人策略是另一回事。它产出的不是一个静态的东西,而是一个要走进世界、做出动作、试图达成目标的策略。而世界并不总是按你预期的方式回应你,意料之外的事一定会发生。所以机器人策略从根本上是一个身处真实世界、与真实世界互动的智能体,而事情总会出状况。因此关键在于,这些策略在训练时必须被暴露在部署过程中可能出岔子的每一种情况面前。仿真对机器人之所以关键,原因就在这里。
这里有两条路。一条是经典仿真:你去用自己喜欢的物理引擎,作为人类设计者去发挥想象,把完成这个任务时可能出现的所有场景想一遍,然后写出显式的代码把它们都建模出来。这是一条路,而且在有了编程智能体之后,这条路其实也被大大加速了。
另一条路是更数据驱动的仿真。我们能不能有一个学出来的模型,它理解环境、理解世界会如何回应动作,而且有时候世界的回应可能出人意料?我们能不能用尽可能多的数据训出这样的神经仿真器,再把这些学出来的神经仿真器当成训练床,去训练机器人策略?这是 Atlas 一个非常有意思的未来方向。
但事情不会止步于此。一旦你有了这样一个学出来的仿真器,它在自己的「脑子」里其实已经懂得这个世界,懂得世界会如何回应动作。那为什么仿真器本身不能成为规划器?这正是我们围绕世界模型及其通用性所持的核心论点:有一批核心的东西是模型应当理解的,包括生成世界、仿真世界、理解世界在不同情境下呈现的样子;而理解世界将如何回应一个动作,与想象「我该采取什么动作才能让世界以某种方式回应」,这两件事高度相关。
主持人: 顺便恭喜发布。反响压倒性地好,我觉得这大概是今年最重要的一次模型发布,所有人都在说好话。不过我给一位这个领域的专家发过消息问他怎么看,这位很不错的人说:非常棒,很惊艳,但还需要更多的动态性。至少在机器人这边,甚至一般而言,能有一个会动的世界似乎才是理想状态。能不能聊聊这个,以及你们愿意分享、又值得一谈的其他未来方向?
约翰逊: 动态性显然会来。其实……
李飞飞: 我们已经有婴儿版的动态性了。
约翰逊: 我们确实已经有了婴儿版的动态性。这一点我觉得大家没太注意到,我们在博客里也没重点讲。上一代 Marble 世界模型从根本上是静态的,那个模型完全处理不了任何动态,这是烙进模型架构、烙进训练方式里的,整个东西从根上就是静态的。
Marble 之后我们就知道这是个大问题,而且在 Atlas 里已经修掉了。Atlas 的架构从根本上就支持动态,Atlas 的训练数据从根本上就包含动态。如果你仔细看我们发出来的一些视频……
主持人: 确实有。
约翰逊: 你看出来了。
主持人: 对,水面的波浪。
约翰逊: 对,有些例子里水面有波浪,有些生成的航拍视角里有小汽车在跑。所以动态其实已经在这个模型里了。
主持人: 不过顺便问一句,如果你要从多个视图重建三维,动态在我看来是很麻烦的事。这两者是不是有冲突?
约翰逊: 我们这里的一个论点恰恰是:如果你要做的是纯粹的三维重建,你其实希望没有动态,你希望能在时间被冻结的前提下精确地建模场景的视图。但这正是我们之前 Marble 路线的一个问题:你可以去找完全静态的数据,可这类数据很难扩量,也很难拿到更多。
我们意识到的是,哪怕你最终想要的是静态的输出,得到它最好的办法反而是让模型见识动态。你有多少动态素材就喂多少,有多少静态素材就喂多少,然后让模型自己学会把动态的部分剥离出去。
所以在 Atlas 的预训练里,模型已经见过海量的动态。而我们针对这次发布的这个检查点所做的后训练,重心更多放在静态上,更多放在空间移动而不是时间上。但我们已经有了,我相当确定这个预训练检查点里已经潜藏了大量动态。这也是我们接下来会大幅改进的方向。
主持人: 那么本,这是不是意味着我们会有四维视频?我可以走进去逛?
米尔登霍尔: 我觉得……
主持人: 看他们脸上的笑就知道了。
主持人: 我其实觉得,就算你们现在停下来,只是做得更大、更快、更好,也足以撑起一整个产业。它像是一个非常横向的原语。那么除了「更大更快」之外,还有什么让你们兴奋的东西?尤其是在你关注的那些应用上,也就是偏内容创作、偏三维的这一侧。
米尔登霍尔: 我非常想推进的是多模态那一面。我认为不同的控制方式在这里极其关键。给这些模型加上控制条件,把里面的东西「取」出来,这件事有多重要被严重低估了,尤其是在学术圈。老实说这……
主持人: 不好意思,我完全不懂这几个词是什么意思。
米尔登霍尔: 翻译成大白话就是可编辑性。我认为可编辑性才是关键。
我们在单图模型上看到过这种东西,今年开始在视频模型上也被解锁了一部分:多轮对话式的编辑,或者说非常符合直觉地理解「我想要这个人、这个物体、这件事发生」,然后把它们拼成一幅完整的画面,而不需要你在系统里做大量手工活。它就是能理解你的意思。前沿图像模型在编辑这件事上基本已经到位了。
但我们还没看到这种能力同样有力地传导到视频,再传导到世界模型上。我们看到的是一些相当玩具化的例子,比如在那种实时模型里输入一句话,然后冒出来一只恐龙。我想把这件事做到真正的工业强度。因为这里的诀窍在于,你得加上控制,同时不能牺牲模型的质量,否则它就只是个party trick。不会有人认真考虑放弃自己正在用的前沿视频模型,换成你这个多给几个旋钮、画质却变差的模型。
所以这真的是一场博弈:如何守住我们在当前模型输出上立下的那条高线,同时把人们会向我们提出的各种有意思的东西加进来,比如我想和场景交互、控制布局、控制画面里物体和事物的身份,或者控制时间。我觉得这是一个能打开大量有趣产品和交互设计工作的维度。你在这里加的复杂度和丰富度越多,就越有可能几乎从零开始重新设计人们在计算机里与有状态的三维世界打交道的方式。这才是最终目标,就是把搭起那样一套系统所需要的全部能力都拿到手。
主持人: 很好。你这边呢?有没有什么不只是「更大更好」的新功能是你期待的?
李飞飞: 对我来说,还是回到智能的第一性原理。当涉及空间、涉及物理空间时,智能不是坐在那里不动,只是看到什么、解释什么。它真正的内核是把「看」「体验」和「交互」这个回路闭合起来。所以顺着这个阶梯往上走,正是本刚才说的那件事。
主持人: 很好。我觉得这里有一个有意思的概念,叫 AI 完备(AI completeness)。你听过吗?
李飞飞: 听过。
主持人: 顺便说,我听到的 AI 完备是在大语言模型的语境里,意思大概是:你得是最聪明的那个大语言模型,才能回答最聪明的大语言模型需要回答的问题,或者说你必须先解决通用智能。
约翰逊: 不是,它其实是跟图灵完备类比来的。在经典复杂性理论里,一个任务是图灵完备的,意思是我可以把这一类里的任何问题都归约到这一个问题上。3SAT 是经典例子,你可以把任何 NP 难问题归约成 3SAT,因此你可以用 3SAT 去解任何问题。
那么 AI 完备的宽松定义就是:存在这样一个根本性的原语,它本身是一个 AI 任务,但如果我能在它最广义、最完整的意义上解决这个任务,我就解决了任何智能问题。大语言模型这边的经典例子是,下一个词元预测是 AI 完备的。我记得伊利亚讲过那个著名的例子:有一本推理小说,模型得把整本读完,而小说的最后一句是「凶手就是……」,预测下一个词元。
所以你基本上可以把任何智能任务都改写成这种形式。显然,很多人相信下一个词元预测是 AI 完备的。但我们逐渐意识到一件事,本今天早些时候也在说,就是新视角预测,我们在 Atlas 里拿到的这个原语,尤其是生成式的新视角预测,它同样是 AI 完备的。
主持人: 你可以拿一部电影,把所有帧都给它,然后凶手走出来,你要预测走出来的到底是谁。
约翰逊: 正是如此。不止如此,我还可以说,我要一个世界,里面的你正在黑板上写下黎曼猜想的证明。
李飞飞: 那我们换一个演化的视角来看。新视角预测,恰恰是演化通过让动物动起来而必须解决的问题。自然给了动物眼睛,却没有给树眼睛。为什么?因为当你移动的时候,你就会看到一个新的视角。这件事,无论你把它叫作 AI 完备还是智能完备,我们都非常强烈地相信,下一视角预测就等价于下一词元预测。
主持人: 太精彩了。那就在此祝贺各位这次出色的模型发布,我们非常期待你们接下来的模型,谢谢各位前来。
李飞飞: 谢谢。
World Labs 的李飞飞、Justin Johnson 与 Ben Mildenhall 解读其新一代世界模型 Atlas:它把"新视角预测"确立为与"下一个 token 预测"同级的基础范式,首次在同一个模型里统一了三维重建与像素生成,并把空间智能的落地路径从创作工具延伸到机器人仿真。
动态是公认的下一个缺口,但模型里已经有"婴儿版动态"。 有专家反馈"需要更多 dynamics"。Marble 从架构到训练数据都是彻底静态的,Atlas 已在架构和预训练数据层面原生支持动态——已发布的视频里能看到水波和空中俯瞰中移动的小车。本次发布的 checkpoint 之所以显得偏静态,是因为后训练刻意侧重空间移动而非时间维度;团队相信预训练权重里已藏有大量"潜在动态"。
一个反直觉的训练洞见:想要静态输出,反而要喂动态数据。 纯做三维重建理论上最好完全没有动态(要的是精确冻结时间的视角),Marble 的思路就是去找完全静态的数据,但这类数据难以规模化。团队的发现是——把尽可能多的动态与静态数据都喂进去,让模型自己学会把动态因素分离出来。
空间智能的完整定义包含三件事:生成空间、在其中推理、以及编辑与交互。 李飞飞强调最终是含时间维度的 4D,而要做到渲染、仿真与行动规划,必须先理解空间的几何、结构与物理;相机位姿正是关于几何最关键的那条信息。Ben 的补充是产品侧的落点:控制条件(control conditioning)与可编辑性才是关键,且加控制旋钮绝不能牺牲输出质量,否则只是"派对把戏"。
被低估的市场洞察来自用户的真实行为。 不少 Marble 用户的用法是:输入一张图 → 得到一个 splat 三维场景 → 从几个角度截图 → 走人。这直接说明"生成式新视角合成"本身就是需求。没有人用单一模型完成整条工作流,创作者是在多个图像模型、视频工具、剪辑工具之间串联的——Marble 提供的稀缺价值是"让生成结果锚定在三维一致的世界里"。这一需求延伸至任何需要先做虚拟设计的行业:建筑、施工,甚至展会展位搭建;在这些流程中,把口头意见或草图改回三维模型占了约 95% 的工作量,一次评审反馈往往意味着一周返工,因为三维软件的交互方式几十年未变,从未像捏陶土或用铅笔画草图那样直觉。
李飞飞用进化论给这套范式做了收尾论证: 自然给动物眼睛却没给树眼睛,因为只有移动才会产生新视角——新视角预测是演化本身必须求解的问题,也因此可被视作与 next token prediction 等价的"智能完备"原语。

微信公众号