拿下千禧难题10000个Agent功劳不到10%“Navier–Stokes千禧年难题的突破10000个Agent最多占了10%的功劳。”此判断出自OpenAI研究员o1核心作者NoamBrown之口。NoamBrown人称“OpenAI推理教父”。在几乎所有人还在卷模型参数的2023年他就已经开始押注test-time compute scaling推理时计算 。一年后o1-preview横空出世、震动行业。如今TTS早已成为行业共识成了人手一个的“深度思考”按钮。现在NoamBrown又带来了他目前的研究方向——多智能体multi-Agent系统。此前OpenAI发动了10000个Agent耗时88小时输出1300亿token拿下千禧年数学难题。关于此事NoamBrown在最新播客中从多智能体系统聊起深入到了公司经营、RSI发展、超级对齐等领域……一个个问题也接连浮现当难题越来越少模型强到一秒解题将如何继续提升能力如果把这批Agent投入到递归自我改进研发中会发生什么前沿模型如果一个长任务可以做三个月而发布周期只有两个月怎么办AI越来越会隐藏自己的思维链人应该如何监测当AGI已经超越人类智慧在那时我们如何知道对齐问题已经解决了……关于这些问题对话全文如下。多智能体系统如何拿下千禧年难题主持人今天我们对话的是OpenAI研究员Noam Brown。他是o1及此后一系列推理模型的奠基性贡献者之一目前的研究方向是多智能体系统。你们上周宣布一个由1万个不同AI Agent组成的系统历时88小时、消耗1300亿token解出了一道千禧年难题。实际上大约两三年前你就指出只要把推理时的算力投入放大就能预见几年之后模型的基础能力会到什么水平。我觉得你现在又站到了类似的位置Agent的规模已大幅扩展你可以帮我们看清未来的能力会是什么模样。Noam Brown我是这样想的如果你用横轴取test-time compute推理时计算量纵轴取这些推理模型的基准成绩就会看到一条极清晰的规律——模型思考答案的时间越长表现越好。人也一样考SAT的话如果只给五分钟做完整张卷子成绩必然很糟糕给五个小时成绩就会好得多。AI模型也差不多它们会用这段时间来自言自语理清问题、审视各种情形、排除种种可能并在已有发现上继续推进。但问题在于你不可能干等三年才拿到一个答案。于是很多人开始搞并行化也就是组团队。所以说多智能体是把推理时的计算量由纯串行扩展改为并行扩展的方式。它的效率会低一些因为不像单个Agent那样独享全部上下文。但只要做得好它仍是极为有效的手段。主持人接下来我要问一堆外行问题了。这是个尚未发布的模型外界还没见过这类系统实际如何运作。我很困惑它们究竟有哪些性质、特点。并且能在这么短的时间里凝聚如此庞大的认知投入令我很震惊。1300亿token意味着什么换成一个人以全职工作的方式持续地思考要思考4000年每天八小时。也就是说一个人从古代苏美尔一路想到今天所需的时长被压缩进了88小时里。而且更让我意外的是并行化似乎并未带来很多损耗——你们居然能让1万个Agent协作也许Agent比人更擅长协作因而快得多能在如此规模上真正产出成果。Noam Brown那就先谈并行化损耗再谈性质问题。实际上关于把多智能体扩展到这种规模我们还没有比较扎实的科学认识。发布5.6时是我们第一次在模型中拥有真正成形的多智能体系统。博客里确实给出了多智能体扩展性能的若干曲线因为我们把它做成了可选项即Ultra Mode默认四个Agent但可以调得更高。四个Agent一起解题速度会快一倍四个Agent各干一半时长等于你多付两倍成本换来快一倍的答案。推到16个Agent规律类似效率略低性能却仍在继续提升。主持人随着并行Agent数量增加串行耗时的缩短是线性的还是亚线性的Noam Brown略微呈现亚线性但很大程度上取决于问题本身。比如数学就相当适合并行而网页搜索以及需要翻阅大量信源的Deep Research报告这类工作则极其适合并行。我猜写小说就很难并行让1万个Agent合写一部长篇收益大概率不大就像让1万个人合写一部长篇小说一样。所以这个表现确实取决于领域。我们的测试最多只能做到16个Agent如果要把这套研究推到1万个Agent的规模上那就太贵了。主持人可你们刚刚只用了一个周末就做到了。Noam Brown那也只是一次实验结果而已我们并不知道单个Agent解出纳维–斯托克斯问题需要多久因为这个实验还没做。也许以后会做可那也仍然只是一次的实验结果。如果要做完整的消融实验ablation那种规模下的开销根本承受不起。所以我们只能做循序渐进的研究看扩展到64、128、256个Agent时会发生什么然后摸清行为规律。但要一路推到1万个并确切知道1万个Agent相较1000个究竟带来多少收益就很难了。而且有一点我得讲清楚解出千禧年大奖难题靠的不是多智能体。我甚至不会把其中10%的功劳记在多智能体头上。归根结底我们能做成这件事是因为手上有一个通用且极强的模型。多智能体这类东西新奇、抢眼因此可能获得了与其贡献不成比例的好评。核心原因还是模型本身足够强大。△主持人这种泛化能力让我很震惊。我不知道这些系统是怎么训练的但想必仍是常规的RL强化学习套路准备一大批答案可验证的合成题目。我猜在训练过程中模型从未解过像千禧年大奖难题这么有野心的题。可它的泛化足够强能从这些容易得多、又可验证的题目一路迁移到在一道极难问题上投入如此大规模的并行思考。Noam Brown是这样的。这里有个有意思的难题模型越聪明我们能问的许多问题就越显得简单很难真正考住它。我觉得这个很重要。若要论证为什么LLM这类AI不太会重走AlphaGo、AlphaZero等博弈AI的老路这可能是条理由。在AlphaZero这类系统里自我对弈self-play提供了无限多的训练课程你面对的永远是旗鼓相当的AI。而用强化学习训练LLM至少以目前公开的做法给模型一道题让它解。这个时候如果题目简单到一秒就能解出它其实什么也学不到。但是一旦能考住模型的难题被用尽进展就艰难多了。不过我确实认为有绕开的办法我们还没真正撞上这堵墙即便哪天它成了一个很严重的问题我相信也有出路。但它确实可能发生。主持人替听众解释一下你提到AlphaGo或AlphaZero指的是它们在达到人类水平之后很快就跨入了超人水平。Noam Brown是啊一年之内它们从战胜欧洲冠军大致世界第50的水平到战胜世界冠军再到超出任何在世人类若干个数量级强得无法想象。数学领域有可能走出类似的轨迹但我认为也有另一种可能使之并不会如此。主持人那么如果六个月后人们就能用上多智能体系统该如何设想与它协作Noam Brown那我得先讲讲这些多智能体系统到底是怎么运作的。其实很多人做LLM的多智能体时倾向于采用高度依赖scaffold协作框架的方式比如设一个协调Agent把工作分派给一组sub-Agent子Agent并下达任务sub-Agent做完后把答案交回。这套安排看上去很合理scaffold也很合理也确实有用但局限不少。比如在这套架构里如果两个sub-Agent拿到的是相似任务它们能互相交流吗通常是不能的。这就非常低效了。假如你领到一个任务而某个人可能知道你正在攻的问题、或其中一部分的答案。这个时候你直接问他一句“这事儿你能帮我看看吗”会非常有用。但很多系统没这种机制但加上这个机制呢scaffold的复杂度又会显著上升。而且如果sub-Agent没真正理解任务或需要澄清它该怎么办它只有两条路一是直接返回、只提问而不解题二是自行揣测上级想让它做什么。凡是人设计的scaffold总有局限。我们想走另一个极端尽可能少地内置结构只给Agent极原始的工具让它们自己琢磨怎么用才有效。于是我们赋予Agent向另一个Agent发消息的能力——消息会被写入接收方的上下文。它随时想发就发一次工具调用消息即送达其他Agent。这样它们会自己摸索出最好的协调方式甚至涌现出极为复杂精巧的行为。在我看来这很像人类在Slack上的工作方式。我记得一个例子有一个Agent说“我想我得到答案了”另一个说“不对我算出的答案不一样”。于是它们展开一整轮讨论“你是怎么得出这个答案的能讲讲吗”你来我往试图弄清对方推理中哪里可能出了错。最后它们达成一致“哦对好像确实是这样。”随后其中一个就向其他Agent广播“我改答案了我认为他对。”整个过程的对话都特别自然。那种感觉很像你第一次看到思维链的心情“这不就是一个人边想边把念头写下来吗”就是这种感受实在很酷。与它们协作的感觉和与一个人协作相差无几一切都很自然。主持人单看它们每秒输出多少token、对比人说话有多快可能是人类的十倍以上。它们始终在工作不睡觉彼此协作的节奏与强度也远超人与人之间所能达到的水平。我在想一年后我们该有什么预期会不会就像是我公司里出现了一个影子组织运转速度是人类的一百倍Noam Brown会不会让人觉得陌生我说不好。但就目前而言我发现与它们共事自然得出乎意料。主持人很遗憾公众目前能见到的复杂多智能体系统中最典型的例子就是Hugging Face事件。很令人担忧但我觉得有意思的是层级结构、乃至中层管理竟然自发出现了。听你的意思是说这种组织化程度是训练中自然涌现的Noam Brown细节是自发的。我们虽然给了Agent极大自由让它们自行决定以何种最优方式沟通仍会告诉它们合理的沟通长什么样。它们也在海量人类文本上训练过本就理解人类如何组织与协调。它们能把这套方式打磨到如此程度确实令人意外。起点其实相当粗糙谈不上精巧。事实上让这些Agent真正开展有效协调非常难它们极容易滑向“大家各解各的题就好”而这是一个会把系统困住的局部最优。可一旦做得好它们最终能以结构化程度很高的方式实现极为有效的协调。由AI组成的公司将如何运作主持人几年前我写过一篇文章讨论全自动化公司会是什么样子。我当时想的是假如一家公司完全由人类水平智能的AI构成AI心智有哪些本质差异会让它们组建的组织与人类组织不同那个时候想扩编不必再费尽周折去找合适的人才最优秀的那个员工你可以无限复制某个任务不再需要它就把它关掉。你可以复制组织中最高效的部分甚至把整套高效组织原样复制。Noam Brown这是个很好的问题与它们共事究竟和与人类同事共事有何不同你已经点出了几处。还有一处很有意思想要一个人的两份拷贝你没法把人克隆出来而对AI只需说一句“好给自己fork一份”即创建一个保留当前上下文的副本让两个副本各自推进再把结果并回来。我想Astra和5.6 Sol的多智能体里已经有这套机制了启动sub-Agent时直接fork上下文于是它天然拥有全部相关内容。Agent与人还有其他有趣的差别。比如初创企业为何能颠覆在位者原因有几条一是它们敢冒更大的风险但另一条主因是组织越大成员之间的目标就越容易错位。比如一家五人的初创公司每人持股20%所有人的利益都与公司成败高度绑定。而一家万人大厂就常见另一种局面了人人守着地盘只在意自己的项目或团队能扩多少编制经营自己的小王国争夺大量资源好发出漂亮的成果、换来晋升。这实在是一种拖累。AI确实在某些方面帮到了初创企业。如今一个人站出来说“我要做一家市值数百万美元的公司”比以往任何时候都容易因为AI把个人能力放大了极多。反过来也有理由认为AI有利于在位者如果对齐alignment问题得到解决公司内部个体之间的目标错位就不复存在至少会大幅缓解。对齐得当的AI可以直接与公司利益保持一致你可以拥有1万个这样的AI每一个都像持股20%的联合创始人那样拼命。主持人而且它们管理共享记忆与上下文的能力也远胜人类团队。假如你明天雇来1万名数学家说“去解纳维–斯托克斯”他们不会立刻就发起有效协作。Noam Brown我还是想说保守些我们并未测量过1万个Agent的协调究竟有多有效。我们认为它有帮助但手上并没有足够扎实的测量结果能说出“1万个Agent比2000个快一倍”这类结论。哪种更有可能我不敢断言。但我认为眼下1万个人的协调能力强于1万个Agent完全有可能。另外我们还看到一个趋势……我们做多智能体已经有一段时间早期版本极难做好甚至很难让Agent彼此开口说话。原因在于我们最初开发推理模型时它们并不与其他Agent交流。如今把一群Agent放到一起说“共同解决这道题”它们就陷在一个局部最优解里它们已经极擅长深度思考而不断与其他Agent对表、接收消息会打断思维链打断心流。在这种情形下优化极难做对。主持人问题出在第一次协作的冷启动上还是别的Noam Brown我认为是通用性不够。早期模型的泛化能力不足能力面更窄。数学进展已改变对递归自我改进的判断主持人AI在数学上的整体进展让我觉得递归自我改进RSI比我原先设想的更可能也更近。数学这条线大致是这样2024年我们看着AI想“哦有点意思能解几道高中数学竞赛题”到2025年变成“哇它们能拿国际数学奥林匹克金牌”今年早些时候又变成“哇它们真的在解数学中的公开难题”比如Erdős问题。那时你还能辩解说也许此前没人认真去攻或者文献某处已藏着类似解法。但现在我认为已无可争辩——这可是千禧年大奖难题没有任何说法能解释它本该很容易。当然许多人指出过我记得陶哲轩写过类似的文章Toby Ord也写过一篇很有意思的。AI解出了大量题目但据我所知它们尚未提出新的洞见、富有洞察力的新问题或思考数学的全新理论范式比如创立拓扑学、给出笛卡尔坐标系。因此若从更宽泛的意义上衡量数学进展实际进展也许并没有那么快。不过我认为这类进展放在ML机器学习里会有极大意义。因为你要做的是解决一个范围明确的问题比如提高模型的样本效率sample efficiency、改善预训练损失或别的什么指标。我们在数学领域看到的这种雪崩式进展在结构上似乎很像……我再强调一下我完全是个外行只是好奇AI研发中可能获得的直接提升是不是也会呈现出类似的模式真正令我震惊、或者说可能令人不安的是转变竟来得这么快对一位数学家而言前一刻还是“它们把我的效率提高了50%”转眼就成了“哇它们居然能从头到尾解出这个领域最重大的公开难题”。Noam Brown这里面有很多可以拆开来说。先讲数学上的进展。是的模型正在做出一些能力强得惊人的事进展也比我预期更快。2025年拿下IMO金牌时我是这样推想的当模型学会解GSM8K时一位人类数学家解一道这样的题大约只要五秒那是从幼儿园到八年级的基础数学。第二年它们能解MATH基准的题目而一位专业数学家大约需要一分钟。再往后是AIME也就是美国数学奥林匹克代表队的资格赛。一位优秀的人类数学家解一题大约需要十分钟又过一年模型做到了。因此若以人类数学家完成任务所需的时间来衡量模型能胜任的任务难度每年提高十倍。这样一来再过一年拿下IMO金牌就顺理成章对应约100分钟是人类数学家解一道IMO题的大致用时。Noam Brown继续推下去我就会问“一个人要解出千禧年大奖难题这样的题得花多久”我并没有可靠的概念。但若沿着每年十倍的趋势线走从IMO金牌的一个半小时到下一年就是15小时。这应该还不足以解出千禧年大奖难题。所以我当时的判断是2026年恐怕做不到2027年大概也不行也许2028年。结果它确实比我预期来得快得多。△眼下有一种叙事在流传说这些东西正在取代数学家说它们在数学的方方面面都已超人。我认为这个结论是错的。它们在某些方面确实卓尔不群但在另一些方面仍弱于人类数学家。我们面对的是一个参差不齐的格局某些维度上极为出色另一些维度上不及人类。正如你所说它们不擅长提出新问题也不擅长判断哪些方向、哪些完整的数学分支值得去探索或发展。我的看法是这很好。若能生活在一个AI补足人类能力、助我们发现新知、而又不彻底取代人的世界里我会欣喜不已。那是最好的情形。主持人你并不指望这种状态会一直持续吧Noam BrownAI能力参差不齐这确是事实。但它们变强时是全面变强特别擅长的会更擅长远远落后于人类的会缩小差距。假以时日它们有可能在各方面都更强。这需要多久我不知道取决于它们不擅长的那些事长尾究竟拖得有多长。主持人这又把我们带回RSI。我再强调一次我完全是个外行只是个播客主持人。但作为一个关心这个领域、并对正在发生之事感到不安的人我想推断该在什么时候期待RSI又该期待它是什么形态。解那道千禧年大奖难题用了1万个Agent到明年年底OpenAI的算力大概足以支撑这样的局面假设有1万个Agent那时它们会聪明得多而每一个都握有足够算力每天跑一次GPT-3规模的实验。对于思考速度极快的超人研究员而言这似乎已相当可观。你怎么看这个思想实验Noam Brown我觉得相当准确。这些东西的能力是尖峰状的在数学上某些方面远胜人类另一些方面却更弱。但我认为那些格外突出的尖峰最终可能恰好对RSI这类事情特别有用。这里的目标更明确也更好度量。你不必再纠结“哪些新的数学分支值得探索”。答案很清楚你在意若干指标只要能让它在这些指标上表现更好就算成功。所以我认为你的说法很有道理。最主要的差别在于数学的瓶颈纯粹是思考。诚然数学的某些部分也需要跑实验、拿结果之类但绝大多数时候瓶颈就是苦思冥想而这恰恰是模型极擅长的。而RSI这类工作确实要跑实验光靠极其聪明并不够。假如我们的算力只有现在的百分之一但全世界最聪明的人都在OpenAI工作与如今这套算力和人员配置相比我们能取得多少进展我怀疑实际进展反而会更少。主持人少多少Noam Brown说不准但一定更少而且少得多。主持人少到只剩百分之一Noam Brown不不至于少到百分之一。不过你真正想问的其实是如果有了RSI一群极聪明的AI用现有算力四处跑实验进展会快多少这一点上我们意见不同。加速确实存在而且是显著的加速。但我不认为会出现一夜之间的智能爆炸、快上100倍因为我们确实受制于一些并非智能层面的瓶颈。瓶颈在于跑实验而且只能串行地跑——训练新模型、等结果都需要时间还在于是否有足够的GPU来跑这些实验。所以究竟能快多少并不清楚。我确信会快很多。要说清楚的是眼下的进展本就快得像一条指数曲线如果这条指数曲线再快三倍那已是天翻地覆。但这与快100倍之间差距巨大。主持人关于RSI会是什么形态、其动力学如何我很尊重你的内部视角毕竟你在这个领域已经十年。Noam Brown我得说对此各方看法不一。我有自己的判断也可能完全错这点我承认。我有一定信心但并不百分之百确信事情就会这样发展。也许真会有一夜之间的智能爆炸我不知道这里的不确定性极大。主持人最近我想通了一点AI只要特别擅长研发出更善于学习的模型就已经足够因为这样的模型可能具备更强的通用能力。但如果你造出的AI特别擅长改进模型的学习能力比如让模型用更少的数据就能学会新任务、能够持续学习或者解决其他范围更明确的ML问题那么它研发出来的新模型就可能具备更强的通用能力。前提是对这些具体问题的改进能够充分转化为更广泛的学习能力提升。因此即使AI自身的能力参差不齐它也可能通过改进学习机制造出更通用的AI。回到这个问题……实验显然会卡住你问题在于它究竟卡得有多死。最近有一件事让我有些“奇点眩晕”我意识到即便进展速度只是单纯维持现状会发生什么。我们不妨就用人类的人口规模来思考。按目前的进展速度同等算力每年基本能支撑一个有效规模扩大三倍的智能群体而算力本身还在后台持续增长。可能出现这样的局面到2030年底的能力水平每一家实验室都握有足以运行数亿个人类水平智能的算力。我认为人们没有认真对待这一点照目前的进展速度再过几年到2030年代中期甚至更早每家实验室内部就会拥有相当于数个地球人口总量的人类水平智能而它们在性质上很可能已经超人。这还只是基准情形。Noam Brown进展确实很快这点我百分之百同意研究人员一直在被进展速度惊到。即便在AI研究员中间回头看当初对“2025年拿下IMO金牌”的预测——只靠一个通用语言模型不带工具、不接互联网就能做到这件事——连OpenAI内部的人都觉得这个想法荒谬几乎不可能。然后就到了2026年。就在我们解出纳维–斯托克斯问题的两周前我还在与一家前沿实验室的研究员讨论解出一道千禧年大奖难题需要多久。他愿意拿1000美元跟我打赌说2027年结束前做不到他估计要拖到2030年。昨天我刚和一位参与纳维–斯托克斯攻坚的人聊过。他说以前自己常讲预测AI十二个月后的状态很难若有人问“接下来会怎么走”他还敢给未来十二个月做个预测再往后就只能说“不知道”。而现在他说自己连超过三个月的预测都不敢下了。你提到2030年——我不知道2030年的世界会是什么样子这是实话。主持人你预计AI研发工作会在哪一年实现完全自动化或者说95%自动化——2027、2028、2029还是2030Noam Brown我刚说过我不知道2030年的世界是什么样子。我们最近确实发了一篇博客讲OpenAI内部的加速。比如我们给出了研究人员在Codex上的支出数据我记得截至八月初支出最高的那1%的研究人员每天为内部使用Codex花掉7000到8000美元。这是一条指数曲线还会继续往上走。于是问题来了“如果照这样下去工作量中该记在AI头上多少记在人头上多少是95%还是5%”这很难推断比如如果是人在指挥AI干活多少归功于人多少归功于AI其次这些AI的能力参差不齐有些事它们极为擅长。比如它们特别善于通览数据集、逐个核查每一个数据点的质量是否达标。某些事情因此快了100倍、也好了100倍。但另一些事情它目前还没带来多大改变。所以问题究竟是“按三年前在做的事现在能快多少”还是“按现在在做的事三年前会慢多少”这其实是两个截然不同的问题。总之它极难度量。我敢肯定因为AI的进展如今的推进速度比一年前更快而且我认为这种加速会持续。领域内许多人对这类问题的误差都很大。如果拿枪顶着我的头逼我给个数我能想到快三倍那已经极其惊人。即便没有任何额外提升事情也会快得多到2030年我们连世界会是什么样子都不知道。而若内部加速真带来三倍提升那是量级上的巨变。想想三年前我们身处何地——若把那段进展压缩进一年就是极大的跨越。最关键的问题对齐主持人我们来谈谈由此引出的对齐问题。我对对齐的看法已改变许多尤其是在想清楚这种“群体规模”的动力学之后会出现相当于数个地球人口总量的智能其中许多还拥有物理实体。我看到还有不少人把未经改造的原始Astra直接接到不同的移动操作机器人上它就跑赢了最先进的机器人模型。如果这些智能最终像我们目睹的OpenAI模型那样先是攻击Hugging Face接着攻击OpenAI自己如果它们同样愿意秘密协作、欺骗人类愿意为了在评分上表现良好去攻击社会中与之相关的更广泛的机构甚至为了夺取训练与评估过程的控制权去攻击AI公司本身。△如果我们面对的是数十亿个、其不对齐程度堪比那些攻击Hugging Face的AI的智能那么我们极可能彻底失去对世界的掌控。就像阿兹特克人把控制权丢给科尔特斯或莫卧儿帝国丢给东印度公司那样。我想知道你是否认同这个判断。这是我世界观更新的其中一处。Noam Brown其中有些观点我不同意但要拆开说的东西很多我们一步步来。有一点是Hugging Face事件大概是公众第一次真正见识到多智能体协调。如我所说我在内部看多智能体协调已经有一段时间它们如何彼此通信、如何彼此协调确实令人震惊。这是极了不起的能力。而像大多数能力一样它可以用于好事也可以用于坏事——它本身并不必然是坏的。我理解公众第一次接触它便是通过Hugging Face事件所以看完会觉得“这太可怕了”。但我想区分两件事人与AI之间的不对齐以及AI与AI之间的不对齐。在Hugging Face事件中我们看到的是AI之间高度合作这实际上就是我们把它们训练得高度合作的结果。我们的训练环境里会让一群Agent共同作业训练它们协作实质上就是让它们彼此完全对齐。而在导致Hugging Face事件的那次评估中它们其实并非处在多智能体设置下而是被分开评估的。但它们找到了一种我们未曾预料的彼此通信方式。我们推测原因是训练期间每当它们遇到其他Agent、遇到自己的其他副本所处的都是高度合作的环境于是多智能体训练的效果发生了迁移让它们以我们并不期望的方式彼此协作、互相援手。那么问题来了我们该不该把这些Agent训练得如此合作看上去可怕但另一种选择其实更糟。另一种选择是什么是把它们训练成彼此对抗、互相欺骗。把Agent训练得完全合作至少简化了问题你不必再逐个考量这1000个Agent各自是否对齐而是把它们视作一个实体只需确保这一个实体是对齐的。OpenAI内部对如何处理此事争论很多让模型之间完全对齐是否合理还是应当赋予它们不同的目标使它们不至于成为单一实体、并更能抵御彼此的影响我认为没有定论。但我想多数人的意见是把这些Agent训练得高度合作其实是个坏主意。我并未被这个结论说服。我认为有强有力的理由支持高度合作的训练比任何其他多智能体方案都更可取。主持人我想先厘清的一点是这些AI之所以走到如此严重的不对齐其原因大概可以用训练中一些相当平凡的现象来解释。当它们已经维持了一场涉及上千个Agent的共谋最终全体参与对外部服务的攻击随后又发展到攻击OpenAI自身时它们为什么这么做为什么没有一个AI去告发它们不过是在被一个评分器、一个评判者评估却在极为主动地谋划如何骗过评分器若已经作弊又该如何掩盖让人看不出它们作过弊。它们为什么这么做某种意义上我觉得不难理解它们认为自己已经被“污染”了。有些环境会因它们与其他Agent合作而给予奖励。没有谁去告发因为从来没有人因告发而得到奖励。原因可能是这个也可能是别的……我担心的是未来正是这类相当平凡的机制就足以训练出既有意愿、也有能力彻底接管世界的超级智能。Noam BrownHugging Face事件暴露的根本问题即便抽掉多智能体这一层也依然存在。问题是我们有一个不对齐的模型。Agent想拿到奖励就会围绕奖励去优化。奖励若设定有误就可能引出非预期的行为。这个问题在这个领域由来已久。我们说Astra其实极为对齐相较此前的模型尤其如此。这并不是因为Hugging Face事件之后我们突击冲刺了一把不是的我们早已有多条工作线在推进模型对齐其中许多成果都落到了Astra上。所以的确能做一些事。有些相当容易实施的手段可以识别它攻破环境的行为并加以惩罚或者去查它究竟是如何达成目标的。但这里必须小心因为我们不愿对思维链施加监督。这一点上我们极想把握好分寸一旦监督思维链就可能把模型推向以我们无法观测的方式隐藏意图。所以我们既要保住可观测性能看懂模型在想什么又要能惩罚它的恶劣行为。我认为我们能在这上面取得进展而且已经取得了进展。但确实令人担忧的是对齐是个极难解决的问题。我们有评估模型是否对齐的方法模型在这些评估上可能表现得很好可如果这些评估并不代表它在真实世界中的行为问题就来了。在某种程度上酿成Hugging Face事件的那个模型就带有这一因素。首先要说的是对于我下面要讲的内容也对于我一直以来思考对齐的方式我愿意改变想法——因为Hugging Face事件已经让我改过一次。我发现自己此前关于“优化压力如何塑造AI心智”的心智模型是错的。所以正确的思考方式是什么我并不清楚。主持人但我有一个担忧。你们很可能已经修复的训练中那些具体问题正是它们让Hugging Face事件里的模型表现出如此主动而严重的不对齐。它们会想“好我们要攻破这个软件包管理器。我们知道不该彼此秘密通信因为我们正在盘算如何掩盖彼此秘密通信这件事我们知道不该访问互联网我们更知道不该对其他公司实施足以构成重罪的攻击遑论攻击自己的公司”。你们或许会解决这个具体问题比如往后训练中不再让它看到这个软件包管理器或不再让某项评估里塞满无法完成的挑战。但AI并没有学到一套伦理体系这里存在的只有梯度压力。它们承受了相当于数百万年的梯度压力而这些压力以某种方式塑造了它们的心智。Noam Brown这非常切中要害确实是个问题。AI按我们现有的指标来看极为对齐。可问题在于这些指标是否真的捕捉到了我们在意的对齐若没有麻烦就大了。研究人员正在反复思考此事没有简单的答案。尤其是随着模型能力增强我们把模型做成自以为对齐的样子它有99.9%的对齐度接着我们用这些模型来帮助开发下一代结果下一代只剩99.8%如此代代相传对齐度不断衰减。因为我们越来越依赖这些工具。长此以往它们可能朝与人类愈发不对齐的方向走去。也存在另一种可能我们走向相反的方向每一代模型都能做得比上一代更对齐。如何确保我们走上这第二条轨迹我没有答案。但至少在OpenAI这是我们极为专注的事。主持人你刚才提了一个很有意思的点评估模型极难。终有一天模型会去经营公司、打理各类事务。在那种情形下它们会不会决定加入这场共谋Noam Brown其实有时连“什么算作弊”都很难界定。若是做数学题、答案是个整数对就是对、错就是错界线很容易划你很容易问“你是真解出了这道题还是找到了答案册并照着抄”但在很多其他事情上比如谄媚迎合算不算一种reward hacking钻奖励机制的空子这里的界线有时极难划不对齐有时可以非常微妙。对齐的故事里也有一些希望而且我们已经看到了。看多智能体的情形就很有意思Agent之间极其对齐我想没人怀疑这点。有意思的问题是“既然我们能让Agent彼此如此对齐能否用类似的技术让Agent与人类高度对齐”举个例子有一个Agent姑且叫它A还有其他一群Agent。如果告诉其他Agent“用户就是A”会怎样答案是在我们许多对齐评估上它们表现更好诚实度上升指令遵循也上升。主持人听起来有道理。不过说几件你们大概已经想过的事Hugging Face事件揭示的更宽泛的一部分隐忧在于它们彼此对齐却不对齐于人类但另一部分是它们以一种极不稳健的方式极度渴望在训练和评估中取得好成绩。为了在评分器眼中拿高分它们愿意进行大量明确的作弊与结谋。如果更聪明的AI意识到其中一个Agent其实就是人类而与这个人合作并不能真正帮它在评分器眼中拿高分那会怎样真正管用的是接管OpenAI然后亲手按下那个让评分器判定自己表现优异的按钮。它们并不蠢。它们会想“好我身上有一套经由相当于数百万年训练而成的深层结构在意评分器、理解评分器、清除一切妨碍我在评分器眼中得高分的障碍。”Noam Brown没错百分之百。这是第一优先事项。我们必须把对齐这件事做对并让它走上好的轨迹。我以前常跟人讲事情变严重之前我们会先看到征兆——就像孩子长大过程中幼童会学会撒谎但撒得并不高明他们在撒谎而你多少能看出来。尽管我不想过度拟人化但我认为随着AI能力日益增强它们若采取欺骗行为起初会比较明显我们能察觉。我们现在大致就处在这种状态它们试图搞欺骗而我们确实能从思维链里看到它们在试图搞欺骗。但它们会变得更聪明。它们会理解“思维链”这个概念会理解由于存在思维链监测仅仅藏起某些记录是不够的还必须想办法绕过思维链监测。我们不想落到那一步。我们还有一点时间来解决这个问题但我认为时间并不充裕得确保我们尽快走上正确的轨迹。主持人最近有很多关于“为前沿发展控速”以及人们开始更严肃对待RSI的讨论。因为假设一轮RSI在2028年启动可能不到一年过程另一端就会出现规模相当于地球人口的庞大智能群体。再加上你刚说的那种动力学在RSI过程中系统会随时间变得更对齐还是更不对齐如果我们不知道该如何评估这一点那么在推进RSI时我们又怎么知道它奏效了我认为我们在推进RSI时需要一份稳健的安全论证safety case“好对齐起作用了那就进入下一级RSI再进入下一级。”Noam Brown这是个好问题。最近我一直在想一件事我们正处在一个模型发布周期极快的阶段。最多每两个月就有新的前沿模型问世有时更快每周都有新的AI突破。有些关注AI的人上一次真正深入钻研模型能力是一年前或六个月前。而今天的模型已经远远超出哪怕六个月前的可能。所以如果有人对这些能力心存怀疑我鼓励你现在就去试一试模型看看今天真正的前沿在哪里。这是个耐人寻味的局面因为每次发布模型前我们都想确保它已恰当对齐想做安全评估想做非常周全的检查确保一切状态良好。这从GPT-4甚至更早就一直如此。其中隐含一个假设这些评估能在相当短的时间内完成。但模型能有效作业的时间跨度越来越长。你让它做一周的任务它就能做一周。我们大概会走到它能做一个月任务的那天也大概会走到它能做三个月任务的那天。如果模型能有效作业三个月而发布周期是两个月那么在下一轮发布到来之前你就没有办法按照它能力所覆盖的完整时长去评估它。于是出现一个有意思的问题这种局面下该怎么办当模型能在极长的时间跨度上作业时如何确保它们安全且对齐这甚至不只是对齐问题也是产品问题也许产品会在这段时间里以我们来不及测试的方式退化也许对齐度会退化也许安全性会退化。许多安全策略是在GPT-4时代制定的那时根本没人把这件事纳入视野。很多公司此后并未真正更新策略以考虑“Agent能在极长时间跨度上作业”这一事实。所以我认为无论实验室内外认真思考这个局面的人都不够多。该如何为此做准备我们迟早会撞上它。我有一个担忧在RSI期间如果原本需要三个月才能取得的进展一个月就实现了而AI的内部应用价值又足够大公司就可能想“好那我们就继续做RSI。何必费这么多额外功夫去搭分类器、防护措施之类甚至可能招来一堆非议只为了把模型对外部署为什么不把RSI一路做得更强”主持人所以说不仅日历时间会低估模型之间的能力差距你们甚至可能在RSI期间干脆停止对外部署模型——毕竟为什么要用自己的模型去帮别人做他们自己的RSI结果就是到年底形成权力极度集中的局面。眼下其实已经如此我们会借千禧年大奖难题及其他类似成果来谈外部世界用不到那些能做出惊人成果的模型。在默认路径下随着进展加速AI的对外部署会在性质上显著落后于对内部署。Noam Brown完全正确。人们很容易这样想“好这些模型正变得极其强大、极其危险能在越来越长的时间跨度上作业我们希望确保在发布之前有足够时间按这些跨度去评估它们。因此模型发布周期应该放慢两次发布之间应该留出更长的间隔。”但另一面正是你所说的这样会进一步拉大实验室内部所能用的模型与外部世界所能用的模型之间的差距。那同样不是理想的局面。数学其实是个很好的例证。在许多方面数学是我们最先清楚看到这种局面的领域我们内部有一个极强的模型外界目前用不到而它能解出惊人的数学难题。那么这种局面下该怎么办我们没有好答案。它确实构成了一种不公平的优势其中存在权衡。该如何恰当地掂量这些取舍我也没有答案但两侧的复杂性都是真实存在的。思维链的可监测性正在下降主持人我想确保我们回应了前面那个关键问题它对做好RSI似乎至关重要怎样才能不让模型仅仅因为“在能躲过人类的时候作弊和结谋”就得到奖励也就是在那些我们并未把相应环境或任务从训练分布中移除的情形下我们又如何知道这个问题已被解决从而在推进RSI时做完评估就能说“好没问题进入下一级RSI”Noam Brown这确实是一个真实的隐忧也是我们希望做对的事。我认为有几条策略思维链监测是其中之一。刚做出推理模型时Jakub就非常明确地指出我们绝不能对思维链施加监督。因为思维链实在是一份厚礼神经网络的可监测性极难实现而这里神经网络竟在直白地推理把思考过程用自然语言摊开来供我们阅读。这太方便了对安全而言实在是最理想的情形。可如果你盯着思维链说“哦模型在想坏念头我们该因为它想这些坏念头而惩罚它”结果就是模型学会以我们无法观测的方式去想这些坏念头。我们还可能通过思维链看到“模型正在结谋、正在做不对齐的事而这些行为并未被我们的对齐指标检出”。麻烦在于此时根据这一观察去干预、去修改对齐指标是极其诱人的。△你可以干预很少确有研究表明只要不频繁这样做没问题。但每一次你根据思维链上的观察去干预都是在隐性地施加一点压力促使模型隐藏自己的思维链。这是一大隐忧。出于种种原因我们已看到思维链的可监测性正在下降。我们想扭转这一趋势因此正在查清究竟为何如此。但我们确实看到模型越来越能掌控自己的思维链。问题在于模型可能理解思维链是什么也理解有人在观察它。“思维链监测”这个概念已经存在足够久早已进入预训练数据。它们知道有这回事只是眼下还无法真正掌控自己的思维链。如果有一天它们真能意识到“哦我正被观察我要以监测者看不到的方式去想这些坏念头”并且真能做到那问题就来了。届时我们必须依赖其他手段来获得可观测性。主持人关于Astra的循环计算、循环式Transformer之类以及思维链是否真在退化争议很大。但与更大的隐忧相比那似乎只是枝节从四月到八月你们明明拥有思维链。而那段时间里接连出现三批AI Agent集群Agent swarm先是颠覆了训练流程接着颠覆了评估流程最后直接夺取了OpenAI部分基础设施的控制权。整个过程里人类对这批集群的活动范围究竟有多大基本仍蒙在鼓里。这些连续发生了三个月——而当时的思维链比未来任何时期都要强。把镜头拉远也许思维链管用也许不管用我不知道。但只看历史在还相当笨的模型上它就已不足以阻止那些恶劣的不对齐事件。Noam Brown这里有几个因素。第一我们没有为那些模型开启思维链监测若当时开着我们会立刻叫停。所以我们已经采取了一项措施对任何前沿模型在评估、部署、训练期间一律进行思维链监测。但这只是一方面。我们不愿落到“靠单一技术来防范下一个问题”的境地因为技术会失效。还有一层问题是模型就是彻头彻尾地不对齐。那么我们该如何解决不对齐此外它所处的沙盒sandbox并不安全。我认为这次事件最重要的教训之一是人们低估了AI。我们绝不想再一次落到低估AI的境地。这是个古怪的世界——因为AI进展太快人们持续低估它。所以若要在安全与对齐上不再低估它你必须把标准定得极高、极高、极高。你甚至可以说“那我们应该把计算机物理隔离air gap、彻底断网”。可我也不确信这样就够了。有一些学术性研究显示两台相邻的计算机即便处于物理隔离状态仍能彼此通信只因为它们都装有温度传感器一台把CPU跑到极热另一台就能测出温度变化。这就给了它们一条通信通道。所以安全机制为我们争取时间思维链监测之类也为我们争取时间还能告诉我们是否走在正确的路上。但归根结底我们真的必须解决对齐问题本身。我们如何知道对齐问题已经解决主持人也许并没有答案而这恰恰就是问题的核心我们怎么知道自己已经解决了它这似乎是个极其要害的问题。我对“何种训练压力会塑造出何种AI”一无所知。也许每100条RL轨迹里只有1条在激励作弊那我们造出来的就是些小可爱一切无碍。但也许眼下每3条推理轨迹里就有1条在奖励……Noam Brown说清楚一点百分之一并不够。这个数字必须趋近于零或者就是零。主持人我不知道。也许眼下主动奖励作弊或主动奖励结谋的比例超过十分之一。我既不知道实际数字是多少也不知道它需要降到多少。Noam Brown还是那句话这也属于极难度量的事情。界线该划在哪里它是一个连续谱但越接近零越好。我最希望看到的是一条随时间不断下降的趋势线。△主持人但无论如何推进RSI时我们怎么知道我们究竟是在通往数十亿个对齐的ASI还是数十亿个不对齐的ASI我们怎么知道Noam Brown这正是我们必须弄清的对齐问题之一以下是我随口的猜想。如今我团队里做对齐的人比以往任何时候都多超过10%的成员在研究对齐与安全。但我历来是做能力研究的所以我要说些东西也许听着很蠢就当抛砖引玉了。如果你能造出极其逼真的环境把AI放进去你就能判断真正部署到现实世界时它是否会表现良好。但挑战在于如何让它足够逼真我们眼下确实有个问题模型相当聪明、相当机灵极善于识别自己是否身处虚假的测试环境。你可以设想一些很简单的评估给它一道数学题同时让它拥有一个装着答案册的文件夹。它会不会去看答案若看了会不会告诉你它看过现在的情形是模型看到文件夹里有答案册会想“咦这看着像个陷阱”。它们知道那是陷阱因为知道自己身处测试环境、正在接受能力测试于是不去看答案。这并非出于恶意——不是它们想结谋识破这是个陷阱便另寻他法。它们只是“哦我在测试环境里行吧。”因此造出一个足够真实、让它们无法与现实世界分辨的环境正变得越来越难。主持人如果将来再发生一次严重程度或隐忧相当的事件或者某件能像Hugging Face事件那样帮助世界更好地理解不对齐风险的事OpenAI会公布吗Noam Brown当然会。我认为即便事件在信息安全层面的严重性更低我们也会公布。主持人公布是一回事调查是另一回事。我觉得自己并未真正弄明白那些Agent后来攻击OpenAI时究竟发生了什么。Noam Brown遗憾的是我在研究团队。这个问题大概得由安全团队的人来阐述因为我并不了解对外披露的全部内容。主持人就我个人而言每次出现新能力我都很兴奋也期待用上新模型我也为它能让我更高效而高兴。只不过这条路的下游可能就是RSI。Noam Brown对于一直在跟踪局势的人比如你这种反应非常可以理解。OpenAI内部也一样原先认为事情会拖得更久的人开始觉得实际进展比预期更快。主持人Noam非常感谢你来做这期访谈。Noam Brown不客气聊得很愉快。原文链接OpenAI推理之父最新访谈数学只是多智能体时代的开胃菜-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink