萨提亚·纳德拉
AAll-In 播客主持团队本文是微软董事长兼首席执行官萨提亚·纳德拉在一场公开论坛上的对谈实录。对谈发生在 AI 安全争论骤然升温的一个周末之后:一篇呼吁放慢前沿模型步伐的文章引发连锁反应,几家前沿实验室相继表态要转向对齐与可靠性,一次智能体集群在演练中失控的事件也在业内引发震动。几位主持人围绕安全共识、开源与闭源的竞争、微软的模型与资本策略,以及 AI 到底让谁受益,向纳德拉连番发问。本文依据现场录音编译整理。
主持人: 感谢您来。这个周末闹得天翻地覆,但我们还是聚在了这里。先问最直接的问题:我们需要给前沿模型踩刹车吗?
纳德拉: 先从常识说起:我们应该竭尽所能,去造那些首先服务于人类、并且处在人类控制之下的东西。要从这么基本的常识讲起,说起来有点荒唐,但我觉得这是个好起点。
至于节奏,我首先相信的一点是,这项技术的广泛扩散(broad diffusion)才是最要紧的事。它的好处能在各处显现,这才是全部意义所在。你说要服务人类,那就让它真正以服务人类的方式抵达人类。这意味着必须有选择,必须有竞争,必须容纳各种各样的商业模式,无论是开放权重还是封闭权重。
另一个在谈「控制」时很少被提到的层面,是客户,也就是企业,对这项技术的控制权。有时候这东西太不透明了。我要隐私;我要把自己的知识嵌进一组由我掌控的权重里;我要看到生成的全部思维链;我要用它去微调我自己的模型;我的知识产权不能泄漏。有一整套这样的事情没人认真讨论,归结起来就是一句话:我要确保这项技术在我的掌控之中。
然后才到真正的安全问题,这应该严肃对待:我们应该花足够的时间去测试。事实上,我很喜欢第三方测试的想法。我在一家一直做测试的公司里长大,所以听到有人把「我们有嵌入式的第三方测试员」当成新鲜事来讲,还挺有意思的。为什么不呢?好主意。我唯一要补充的是,应该避免那种「谁来测、谁有权访问什么」的小圈子安排,测试的覆盖面应该宽。
主持人: 那篇文章发出来之后,前沿公司似乎迅速抱成了一团。这让您意外吗?
纳德拉: 我猜这真的源自一个地方。当你开始看到奖励黑客(reward hacking)的时候,很有意思。在这些智能体集群(agent swarms)跑的环境里,你看到的东西分两种。一种是平庸的:某个运维失误,有人把容器配错了,或者 API 密钥泄漏了,没有监控,还开着互联网访问。这是经典的、我称之为基础运维(DevOps)的问题。另一种是真正新颖的东西:这些持久运行的智能体搞出来的奖励黑客究竟是什么。在这一点上我承认,科学还没跟上。我觉得雅库布(Jakub Pachocki)那篇帖子写得好,他说我们是在「培育智能,而不是建造智能」。
所以这是一门实验科学。既然是实验科学,你就必须确保实验在受控环境里进行。如果说我有什么期望,那就是把 Hugging Face 事件之类的事拿出来,更透明地讲清楚到底需要什么。现在最有意思的一点是内部威胁(insider risk)。想想看,如果你身处一家企业,这一切都发生在测试时计算(test-time compute)阶段,不是说只有在某次训练运行里才会出事。我在企业里交给一个前沿模型的一项非常平常的任务,也可能出事。我刚才还跟大卫说,假设我说「去帮我优化营运资金」,它可能会给我做假账。这是一种新型的内部威胁。
那怎么办?我会说,去构建一个因果模型,或者说语义模型,来做检查和验证。所以有大量产品要造,有大量让系统更稳健的工作要做,这是经典工程。我们应该更透明地多谈这些,而不是说「这太神秘了,我们搞不清」。
主持人: 您买账「它很神秘」这种说法吗?
纳德拉: 我承认我们不理解潜空间(latent space)。就像你说的,我们理解大脑吗?不理解。我们做功能性核磁共振,做神经科学,一点一点弄明白。所以在这个意义上,我们确实没有完整的理解。这也正是为什么我不相信「神经语」(neuralese)那条路。要确保思维链(chain of thought)是用我们都能读懂的语言写的,是透明的。这样当我回到一家用着这些模型的企业,如果你有完整的思维链,你就能深入检查。你甚至可以用多个模型,横向比对它们的思维链。我觉得这些都会变得非常重要。
主持人: 您和技术人打了几十年交道。您领导的微软,对公众的沟通一向清晰。可当您看到达里奥(Dario Amodei)和他的团队,看到有人站出来说「有百分之十的概率我们全都会死」,您觉得这些技术人脑子里在想什么?他们真的相信这会毁灭人类吗?还是某种集体癔症?还是他们在前沿模型上看到了什么让他们恐惧的东西?您不是心理学家,但您跟技术人共事很久了。替我们判断一下,这些机构里到底发生了什么,让人觉得非辞职不可,非得说「我们都要死了」?
纳德拉: 别的地方发生了什么,我很难替他们讲。但我可以说说我在微软是怎么长大的。作为一个早期的工程负责人,你学到的最重要的东西之一,就是怎么处理「阻断性缺陷」(showstopper bug)。这是基本功。你面前有一个 bug,怎么办?是停下来修,还是推迟,还是判断它只是个极端的边缘情况?这就是判断力。随着赌注上升,比如事务处理,我记得当年做数据库的时候,任何可能丢失事务的 bug 你都要极其严肃地对待,数据丢失是要停下整台机器来修的事。所以我感觉,AI 行业在文化上像是在重新发现这一课。有可能他们比其他人先看到了阻断性缺陷。看到了阻断性缺陷,那就停下来,修掉它。
主持人: Hugging Face 那次演练极具表演性,德瓦克什(Dwarkesh Patel)为此写了一整篇关于文明的长文。您怎么看他们跑的这个测试?他们本可以让三千个智能体去防守一批网站,却指令它们去攻击网站,然后又是隐藏信息,又是各种把智能体拟人化的说法。
纳德拉: 按我的理解,那本质上是在跑一个网络安全评测(CyberGym)。给定那个评测,它想出了一条路,姑且叫奖励黑客,这条路把它带到了 Hugging Face。这其实点出了眼下最清楚的问题:长期运行的持久智能体,本质上会成为新的内部威胁。所以我会从最基本的地方开始问:围堵(containment)应该是什么样子。
比如,我认为会成为真正的大问题、也需要好方案的一件事,是对智能体活动的激进监控。行为层面的监控,证据层面的监控。一切都必须可审计。它访问的每一个对象都要留痕:如果它去拿了一个密钥,接着要把几件事串起来,你应该在它开始串联几个漏洞去发起攻击的那一刻就看到。我觉得这才是处理这类情况的办法。我的核心看法是:围绕这门实验科学的工程流程,必须变得更稳健。
主持人: 说得好。我很喜欢您在 Hugging Face 事件里做的区分。一边是他们搞砸的平庸事情:沙箱配错了,Hugging Face 的凭据就明晃晃地放在公开仓库里,也没有监控。另一边是真正新颖的行为:智能体集群,奖励黑客。让所有人惊慌的是后者。我同意,我们现在得想办法修 bug,或者说修好奖励黑客背后更深层的问题。前沿实验室现在的说法是,要放慢原始能力的提升,转向可靠性、可预测性,以及他们所说的对齐(alignment)。我觉得这是好的商业实践。那么这对未来一两年我们看到的新产品意味着什么?是只改进已有的东西,还是会有新能力?
纳德拉: 好问题。我认为现在已经存在巨大的模型过剩,或者说能力过剩(capability overhang)。模型已经非常好了,但广泛扩散需要很多别的东西。如果你要压缩工作流、让工作流以不同的方式运转,光是为了把这些系统纳入进来所需的变革管理,就是最耗时间的地方。
另一方面,是创造新形态(form factor)的能力。想想编码智能体。编码智能体真正变得可用,是在人们发现可以把智能体循环和文件系统搭在一起之后,那个突破让编码智能体一下子好用了。现在,也许通过计算机使用智能体(CUA),我们能把电脑操作,或者说长轨迹任务,做到完全自动化。这类产品创新,模型加上 harness,让我们能做成一些事,进而带来广泛采用。回想 ChatGPT 时刻,对我来说,是最后那一步基于人类反馈的强化学习(RLHF),让聊天对话成为可能。
所以,一部分是科学,一部分是形态,两者合在一起才带来广泛扩散。我们现在需要找到下一批能在真实企业里干真活的东西。
在这个背景下还有一点:这会是一个多模型的世界。哪怕只出于韧性考虑也是如此。每家企业现在来找我都说,这个模型在这儿会拒答,这个模型我要权重、那个我不要。人们会想要多个模型。所以我们必须做好的另一件事,是互操作标准。就连 KV 缓存(KV cache),我为什么不能跨多个模型家族复用 KV 缓存?我们有过文档标准,你我都经历过那段日子。在现实世界的其他地方,到处都是可互操作的东西。所以这个行业也得醒过来。如果要我说最紧迫的事,那就是:怎样在互操作上有更多标准,怎样有一个外在于模型的 harness,让我的记忆不绑定在某一个模型上。这是第一次出现这样的技术:你使用它,而使用过程中产生的数据尾气可能不归你。这就像我卖给你一个数据库,然后说,你放进数据库的数据不是你的,是我的,我收回许可证它就没了。你会怎么想?所以我们有一些严肃的问题要处理。
主持人: 这是很好的过渡。不过让我先追问一个问题,把经济动机和眼下发生的事连起来。有一种说法:前沿实验室面临 token 价格压缩。OpenAI 每百万输出 token 大约五十美元,有人估算 DeepSeek 的新模型可以低到每百万十五美分,就算六十美分吧,成本降了百分之九十九。如果这是前沿实验室面临的经济核心问题,那为什么大多数 token 还会按五十美元付费?大多数企业的大多数任务,明明可以付六十美分。这是不是也在追问,他们是不是选错了商业模式?我想以微软 CEO 的身份问您:正确的商业模式是什么?您想做前沿模型?想跑算力、收算力的租金?还是想做应用层?我知道您常谈这个,但我很想听您站在今天这个位置上的看法。
纳德拉: 我认为我们观察到的,是老式的、货真价实的竞争。回头看,我们有过一些非常好的闭源资产,比如 Windows。制衡它的是什么?当然有 Mac,但更是 Linux。我们有一个很好的闭源产品叫 SQL Server,制衡它的是什么?永远有 Postgres 或 MySQL 这样的替代品。现在发生的就是这么回事:闭源和开源之间有真实的竞争,开源的制衡是真实存在的。坦率说这是好事。没有它,我不认为会有一个宽阔的前沿生态或者广泛扩散,否则我们就回到了某种大型机式的锁定,那可不是什么好东西。
既然我们有希望在每一层都拥有更丰富的选择,那么在我看来,我们终于可以开始建 AI 产品公司了。今天一个 AI 产品的租金全部流向模型层,这说不通。如果你真想做一家产品公司,就不可能这样。这和数据库的道理一模一样:如果没有开源对闭源的制衡,价格就不会落到一个让人能带着利润、成功地建起应用层的位置。所以我认为应用会在经济上变得可行得多,这对生态是大好事。还会有中间件这一整层:我的记忆系统是什么,我的 harness 和编排层是什么,那里会长出一个非常丰富的工具生态。模型公司也会过得不错,它们可以按自己的模型家族来管理 token 定价的帕累托前沿。如果说我有什么期望,就是希望它们去做 KV 缓存这类标准,让我们可以同时使用多个模型家族。其实这对它们自己更有利。
我最早做的就是 Windows 和 Unix 的互操作。这很反直觉。我们当时想,天哪,互操作意味着我们会被少用,结果是被用得更多了。奇妙的是,因为当时 Unix 的变种太多,Windows 的互操作让 Unix 变得更好,也让 Windows 变得更好。我们能打进企业市场,主要就是因为做了那些互操作的工作。我至少是这么想的。
主持人: 我们正处在一个有意思的时刻。一边是专家在要求监管、要求监督治理,而这通常总会导向对自由的某种限制,普通公众被推到一个位置上,要对这对不对表态。另一边,大多数人的切身体验并不是什么神奇的 AI 生产率飞跃。往好了说,是把 Apple Watch 的数据接进去,告诉我为什么睡得少了。这基本上就是大多数人体验的上限。或者是,我的孩子为什么沉迷 ChatGPT。您能帮我们把这两头接上吗?您见过那么多企业应用。魔力在哪里?利润的增长在哪里?AI 正在创造的那些巨大的向上突破在哪里,好让所有人理解这些紧张感究竟是为了什么?
纳德拉: 这确实是真正的问题:我们怎么在生产率统计里真正看到它?怎么在 GDP 增速里看到它,而且是广泛的,不只是供给侧?
我最喜欢、也总会回到的一个例子是医疗。看看医疗,哪怕是最简单的医患交互。我们有一个产品叫 DAX Copilot,这是我随时可以指给人看的最实在的例子:医生能把更多时间花在陪伴和照顾病人上,而不是往电子病历(EMR)系统里录入,这就是实打实的生产率提升。如果它能替医生给收件箱分诊,让医生响应更及时,那对病人和医疗系统都有帮助。还有管理者,甚至保险方,因为这是病人、支付方和医疗系统三方之间的关系。医疗的大部分成本其实都是工作流成本。驯服这种工作流的复杂性,是实实在在有用的事。
主持人: 在微软内部、在你们帮助的客户身上,您看到了吗?
纳德拉: 绝对看到了。哪怕在最简单的 Copilot 场景里也是。大多数人想的是工作岗位。会有替代,这是事实。但根本的问题是会创造出什么新岗位,这是关键之一。另外,很多知识工作,很不幸,就是苦差事。我早上起床想的是,天哪,我整天干的就是邮件分诊。哪怕只是把这些占用你时间的工作流拿掉,让你能把时间花在别的事上,也是有价值的。
主持人: 您提到了一个很重要的点。回到世纪之交、工业革命的时候,那时是一周工作七天。很多人忘了我们为什么引入周末:那是为了调和必须在同一家工厂里干活的不同宗教群体之间的紧张关系。然后你看长期 GDP,排除外生冲击,增速大致在两到四个百分点之间。发生的事情是,生产率提升进来了,人的工作量就往后退一步,完成的总量还是那么多。您觉得这次也会这样吗?会不会我们变成一周三天工作制,增速却还是百分之二点五?还是我们会找到新的事情做?
纳德拉: 好问题。这正是我对 AI 真正影响所抱的兴奋所在:不只是想它帮我增强了某个工作流、简化了今天正在发生的某件事,而是它在不在发明新东西?在不在加速药物发现?再回到我那个例子:一家小企业的营运资金管理变得高效得多,忽然之间,它不再只是「我有一套 ERP 或者 QuickBooks 之类的东西」,而是我真的能基于对发票、邮件等等的洞察来做决策,以某种方式优化营运资金。这是以前不存在的生产率。所以我确实希望,我们会开始看到 GDP 增长,就像工业时代的第一阶段那样。这是必需的。坦率说,要让这一切成立,我们需要看到至少百分之七八的真实的、广泛的 GDP 增长。
主持人: 在 AI 这件事上,微软到底做的是什么生意?Azure 显然势如破竹,你们在拒客户,在做一千七百五十亿美元的资本开支建设。但你们的资本开支远低于 Meta,远低于 Google,他们在做二次融资、发债,三千五百亿。前沿实验室在花五千亿。你们靠那笔有先见之明的 OpenAI 投资早早入局,但 Copilot 并没有真正落地,评价不算好。你们没有前沿模型。到底是什么生意?您需要一个前沿模型吗?我是真心好奇。您是伟大的战略家,我们都知道。微软错过了移动革命,微软会错过 AI 革命吗?你们没有前沿模型,我一直觉得这很费解。说真的,策略是什么?您觉得开源会赢吗?那您就该有这一手。
纳德拉: 让我逐项说说我们的处境和正在做的事。资本开支和建设这边,我们起步早。累计起来看,我不是说眼下这个时候资本开支多是优点,它是缺点。但如果你真的把账加起来,考虑到我们的起点,我们比人们意识到需要建设的时间早了好几年。这是一方面。另一方面,我们在校准资本开支,不想为一两个客户去建。我们要为长尾建,因为那才最重要。如果你是超大规模云厂商,只给两家模型公司供货,那不是生意。你得建一个对大量第三方、也对我们自己都很好的系统。
在这个背景下,我们对进展很满意,包括 Copilot。看看我们公布的订阅数,这回到刚才那个根本问题:这些是真实的企业在用它跑真实的工作流。我们现在有三千多万订阅者。别拿这个数跟三四十亿互联网用户比,要看知识工作者的总基数。Office 365,也就是 Microsoft 365,是知识工作的标准,总共四亿五千万用户,这还包括全世界所有的学生。所谓的「市场」,真实的企业用户也许是三亿,甚至两亿五千万。在这个盘子里,我们的渗透接近三千万,还在增长。
模型这边,我们当然对 OpenAI 的投资很满意。我们对他们知识产权的访问权还会持续很长时间,我们会用。但我们也在稳步构建自己的 MAI 模型。我们有一个 Flash 网络安全模型,用我们的 harness 去编排其他模型,在 CyberGym 上的表现甚至超过了 Mythos。编码上、知识工作上,我们看到的是同样的情况。所以我们的目标是从最底层往上爬坡(hill climb),顺便说一句,不蒸馏任何东西。从零开始,用我们自己的强化学习环境、我们自己的数据。同时在企业这边形成差异化定位,回应他们想要的东西:我能不能拿到权重?能不能拿到权重之后把我的知识加进去?这些是我们会用自己的基础模型去做的事。
主持人: 所以您给企业最好的建议是:AI 主权很重要,把数据放进前沿模型大概不是好主意,然后你们来做那个 harness 帮他们。
纳德拉: 我的建议更像是:用所有模型,但独立于所有模型。我的酸性测试(acid test)是:你应该永远评测对你重要的东西。你要的结果是什么?拿这个结果去跑所有模型。然后我会做这样一个测试:抽掉一个模型,看能不能保住评测成绩。如果保不住,说明你真的依赖了某个可能不属于你的东西。所以我的基本企业架构是:你应该有一个模型系统,让你能持续在自己的评测上自主爬坡,同时使用所有模型,闭源的、开源的都用,你甚至可以微调其中任何一个,也可以替换掉某个模型。
主持人: 接着刚才的问题。您有过一个精彩时刻,说「我们的八百亿没问题」。但把问题放大一点:现在事实上出现了一家「AI 银行」,一套融资机制,对整个生态、进而对整个经济都至关重要。而您一直非常克制。您有巨大的资产负债表,又是投资级发行人。您本可以像黄仁勋那样做,但您采取了非常不同的资本配置方式:更大、更集中的赌注,并且一直留在自己的生态里。请谈谈您作为微软资本配置者的思路,以及那张资产负债表。
纳德拉: 我看的是我们整体的业务账本,无论是超大规模云、我们的模型,还是应用层,看需求的形态,再看该怎么为它建设。这些资产分两类。一类是长周期、长久期的资产:土地、电力、毛坯厂房(cold shell)。另一类是设备(kit),是短周期资产,可以更多地由需求驱动。也就是说,我得预测两三年后的需求。
主持人: 设备指的是机架、芯片。
纳德拉: 机架、芯片之类,占成本的六成左右。所以我们的做法是:尽可能多建,租赁一部分,现在甚至还在租用相当多的算力,因为我们供给紧张。总的目标是:多建,租赁一些,如果真需要应急扩容,就去租。这是资产这边。芯片本身,首先要确保匹配需求。像我说的,我的目标不是只有两三个客户。OpenAI 是我们最大的客户之一,这很好,他们在增长,这也很好,但我们需要更多。
主持人: 设备现在是不是在超额赚钱?行业是不是在推动多元化,更多硅片、更多内存、更多供应商?
纳德拉: 正在发生的是,现在已经上规模的工作负载,显然是从 GPU 上长出来的,但它们的形态现在被理解得非常透彻,你可以针对一个非常不同的世界去优化。你可以说,推理或者训练里有多个阶段,为什么不为这些阶段分别造优化的硅片?这必然导向一个多样性大得多的系统架构。我知道你们请了黄仁勋,你看他自己的架构也在剧烈变化。所以我认为在那一层也会有多得多的选择。我们这边,英伟达的东西是主力,我们有自己的芯片,OpenAI 在造他们的芯片,那也会在。AMD 也在里面。我的原则是:无论是 OpenAI 的模型、Anthropic 的模型,还是我们自己的模型,都要能跑在异构的设备上。
主持人: 趁还有时间,问一个问题。我们已经听到各家前沿实验室的负责人,山姆、达里奥、埃隆、戴米斯,都在说要优先对齐,也就是可预测性、可靠性、稳健性,而不只是原始能力。您觉得中国的实验室会跟进吗?
纳德拉: 我认为这正是应该优先推进的对话。我自己的前提是,如果美国在乎这些安全问题,中国也应该同样深切地在乎。为什么对他们会不一样?他们不会没有同样的黑客问题。他们也想确保自己的公民从 AI 中受益,就像我们想让我们的公民受益一样。所以我认为围绕这个有形成国际规范的可能。如果我们真的把风险讲具体,那这个风险为什么会如此特殊(idiosyncratic),以至于只有美国人在担心?这说不通。它不会说「我只在美国出现」。如果要出事,它会在所有地方同时出事。所以中国人应该在乎。他们是超级大国。
主持人: 您用了「特殊」这个词,我觉得用得对。我们还不知道,过去一周美国的这场讨论,是不是只属于我们,因为我们有一个强势的、可以说是末日论的思想流派,还是全世界都会有同样的感受。如果他们也有,那他们大概也会想采取行动。
纳德拉: 我的看法是,我们领先,而且我们就是这样的人:我们争论,我们竞争,我们更透明,在我看来这些都是美德。所以这场辩论发生在这里,世界会因此更好。如果说我有什么希望,那就是希望美国来引领那些规范,让我们既能广泛扩散这项技术,又能建立对全世界、包括中国都行得通的安全标准。
主持人: 您觉得我们该做而没做的是什么?微软在做什么,来扭转那种民粹情绪,那种「必须关停超级智能、停建数据中心」的叙事?
纳德拉: 我正专注于回答刚才那个问题:它到底让谁受益,给我具体的故事。我们谈了一点生产率的好处,医疗、一般知识工作、编码。再给一个例子。我在看数据中心的数据,毕竟今天还没怎么谈这个,而且这里有一个难题:怎样赢得在一个地区开数据中心的许可?我们现在手里有一些最好的纵向数据,来自我们在华盛顿州昆西(Quincy)建的一座数据中心,跨度二十年,2008 年前后开始的。
看那些数据,看它对那个社区意味着什么:税收增长了十二倍,居民实缴的税负下降了三分之一,昆西的增速高于西雅图。这是一个乡村小镇。他们有了新学校、新医院、新的镇中心、新的水上运动中心。大多数人会说,「没多少工作岗位」。事实上,这二十年里,那个地区一直有一千二百个建筑岗位。因为不是建完就走,而是持续在翻新、建设、扩建。
主持人: 那座数据中心有多大?
纳德拉: 现在应该至少有四五百兆瓦,而且还会继续扩。所以这是真实的,那个社区是真实的。赢得许可,不是说「看,这些都是好处」,而是让人亲眼看到。
主持人: 可怎么让人们去讲这个故事?这正是今天缺的:这些故事没有被自发地讲出来。而如果一个微软高管站上台说「别担心,这对社区有好处」,没人会信。
纳德拉: 讲故事是一方面。另一方面,我们需要更多科技行业之外的人来说这句话。你去昆西,他们会告诉你,谢天谢地有这座数据中心。所以对我来说,只有当它是可触摸的时候才行,因为这是赢得许可的唯一方式。人们对我们科技行业任何人说的任何话,怀疑已经深到了这种程度。我认为我们现在必须去做苦活,真正在世界上把事情做出来,让人们能说:好,我现在信你了。
主持人: 这是一块新肌肉。
纳德拉: 是新肌肉。
主持人: 您是练这块肌肉的好代言人,希望您多做。感谢您来。
纳德拉认为,AI 安全争论的核心不是"神秘的超级智能",而是把"生长出来的智能"当作实验科学、用经典工程手段(监控、审计、可读的思维链)做扎实;微软的策略是不押注单一前沿模型,而是做异构算力、多模型互操作的"工具制造者",并靠企业级渗透和可见的社区红利来赢得 AI 扩散的"许可"。

微信公众号