OpenAI推理之父最新訪談,數學只是多智能體時代的開胃菜

量子位·2026年09月29日 16:58拿下千禧難題,10000個Agent功勞不到10% “Navier–Stokes千禧年難題的突破,10000個Agent最多佔了10%的功勞。” 此判斷出自OpenAI研究員,o1核心作者NoamBrown之口。NoamBrown,人稱“OpenAI推理教父”。在幾乎所有人還在卷模型參數的2023年,他就已經開始押注test-time compute scaling(推理時計算) 。一年後,o1-preview橫空出世、震動行業。如今,TTS早已成為行業共識,成了人手一個的“深度思考”按鈕。
現在,NoamBrown又帶來了他目前的研究方向——多智能體(multi-Agent)系統。此前,OpenAI發動了10000個Agent,耗時88小時,輸出1300億token,拿下千禧年數學難題。關於此事,NoamBrown在最新播客中從多智能體系統聊起,深入到了公司經營、RSI發展、超級對齊等領域…… 一個個問題也接連浮現: 當難題越來越少,模型強到一秒解題,將如何繼續提升能力?如果把這批Agent投入到遞歸自我改進研發中,會發生什麼?前沿模型如果一個長任務可以做三個月,而發佈週期只有兩個月,怎麼辦?AI越來越會隱藏自己的思維鏈,人應該如何監測?
當AGI已經超越人類智慧,在那時,我們如何知道對齊問題已經解決了?…… 關於這些問題,對話全文如下。多智能體系統如何拿下千禧年難題?主持人:今天我們對話的是OpenAI研究員Noam Brown。他是o1及此後一系列推理模型的奠基性貢獻者之一,目前的研究方向是多智能體系統。你們上週宣佈,一個由1萬個不同AI Agent組成的系統,歷時88小時、消耗1300億token,解出了一道千禧年難題。實際上大約兩三年前,你就指出,只要把推理時的算力投入放大,就能預見幾年之後模型的基礎能力會到什麼水平。我覺得你現在又站到了類似的位置:Agent的規模已大幅擴展,你可以幫我們看清未來的能力會是什麼模樣。
Noam Brown:我是這樣想的,如果你用橫軸取test-time compute(推理時計算量),縱軸取這些推理模型的基準成績,就會看到一條極清晰的規律——模型思考答案的時間越長,表現越好。人也一樣,考SAT的話,如果只給五分鐘做完整張卷子,成績必然很糟糕;給五個小時,成績就會好得多。AI模型也差不多,它們會用這段時間來自言自語,理清問題、審視各種情形、排除種種可能,並在已有發現上繼續推進。但問題在於,你不可能幹等三年才拿到一個答案。於是很多人開始搞並行化,也就是組團隊。所以說,多智能體是把推理時的計算量由純串行擴展改為並行擴展的方式。
它的效率會低一些,因為不像單個Agent那樣獨享全部上下文。但只要做得好,它仍是極為有效的手段。主持人:接下來我要問一堆外行問題了。這是個尚未發佈的模型,外界還沒見過這類系統實際如何運作。我很困惑它們究竟有哪些性質、特點。並且,能在這麼短的時間裡凝聚如此龐大的認知投入,令我很震驚。1300億token意味著什麼?換成一個人以全職工作的方式持續地思考,要思考4000年,每天八小時。也就是說,一個人從古代蘇美爾一路想到今天所需的時長,被壓縮進了88小時裡。而且更讓我意外的是,並行化似乎並未帶來很多損耗——你們居然能讓1萬個Agent協作!
也許Agent比人更擅長協作,因而快得多,能在如此規模上真正產出成果。Noam Brown:那就先談並行化損耗,再談性質問題。實際上關於把多智能體擴展到這種規模,我們還沒有比較紮實的科學認識。發佈5.6時是我們第一次在模型中擁有真正成形的多智能體系統。博客裡確實給出了多智能體擴展性能的若干曲線,因為我們把它做成了可選項,即Ultra Mode:默認四個Agent,但可以調得更高。四個Agent一起解題,速度會快一倍:四個Agent各幹一半時長,等於你多付兩倍成本,換來快一倍的答案。推到16個Agent,規律類似,效率略低,性能卻仍在繼續提升。
主持人:隨著並行Agent數量增加,串行耗時的縮短是線性的,還是亞線性的?Noam Brown:略微呈現亞線性,但很大程度上取決於問題本身。比如數學就相當適合並行,而網頁搜索以及需要翻閱大量信源的Deep Research報告這類工作,則極其適合並行。我猜寫小說就很難並行:讓1萬個Agent合寫一部長篇,收益大概率不大,就像讓1萬個人合寫一部長篇小說一樣。所以這個表現確實取決於領域。我們的測試最多隻能做到16個Agent,如果要把這套研究推到1萬個Agent的規模上,那就太貴了。主持人:可你們剛剛只用了一個週末就做到了。
Noam Brown:那也只是一次實驗結果而已,我們並不知道單個Agent解出納維–斯托克斯問題需要多久,因為這個實驗還沒做。也許以後會做,可那也仍然只是一次的實驗結果。如果要做完整的消融實驗(ablation),那種規模下的開銷根本承受不起。所以我們只能做循序漸進的研究,看擴展到64、128、256個Agent時會發生什麼,然後摸清行為規律。但要一路推到1萬個,並確切知道1萬個Agent相較1000個究竟帶來多少收益,就很難了。而且有一點我得講清楚:解出千禧年大獎難題,靠的不是多智能體。我甚至不會把其中10%的功勞記在多智能體頭上。歸根結底我們能做成這件事,是因為手上有一個通用且極強的模型。
多智能體這類東西新奇、搶眼,因此可能獲得了與其貢獻不成比例的好評。核心原因還是:模型本身足夠強大。△ 主持人:這種泛化能力讓我很震驚。我不知道這些系統是怎麼訓練的,但想必仍是常規的RL(強化學習)套路,準備一大批答案可驗證的合成題目。我猜在訓練過程中,模型從未解過像千禧年大獎難題這麼有野心的題。可它的泛化足夠強,能從這些容易得多、又可驗證的題目,一路遷移到在一道極難問題上投入如此大規模的並行思考。Noam Brown:是這樣的。這裡有個有意思的難題:模型越聰明,我們能問的許多問題就越顯得簡單,很難真正考住它。我覺得這個很重要。
若要論證為什麼LLM這類AI不太會重走AlphaGo、AlphaZero等博弈AI的老路,這可能是條理由。在AlphaZero這類系統裡,自我對弈(self-play)提供了無限多的訓練課程:你面對的永遠是旗鼓相當的AI。而用強化學習訓練LLM,至少以目前公開的做法,給模型一道題讓它解。這個時候如果題目簡單到一秒就能解出,它其實什麼也學不到。但是一旦能考住模型的難題被用盡,進展就艱難多了。不過我確實認為有繞開的辦法,我們還沒真正撞上這堵牆;即便哪天它成了一個很嚴重的問題,我相信也有出路。但它確實可能發生。
主持人:替聽眾解釋一下,你提到AlphaGo或AlphaZero,指的是它們在達到人類水平之後,很快就跨入了超人水平。Noam Brown:是啊,一年之內,它們從戰勝歐洲冠軍(大致世界第50的水平)到戰勝世界冠軍,再到超出任何在世人類若干個數量級,強得無法想象。數學領域有可能走出類似的軌跡,但我認為,也有另一種可能使之並不會如此。主持人:那麼,如果六個月後人們就能用上多智能體系統,該如何設想與它協作?Noam Brown:那我得先講講這些多智能體系統到底是怎麼運作的。
其實很多人做LLM的多智能體時,傾向於採用高度依賴scaffold(協作框架)的方式:比如設一個協調Agent,把工作分派給一組sub-Agent(子Agent)並下達任務,sub-Agent做完後把答案交回。這套安排看上去很合理,scaffold也很合理,也確實有用,但侷限不少。比如在這套架構裡,如果兩個sub-Agent拿到的是相似任務,它們能互相交流嗎?通常是不能的。這就非常低效了。假如你領到一個任務,而某個人可能知道你正在攻的問題、或其中一部分的答案。這個時候你直接問他一句“這事兒你能幫我看看嗎”,會非常有用。
但很多系統沒這種機制;但加上這個機制呢,scaffold的複雜度又會顯著上升。而且如果sub-Agent沒真正理解任務,或需要澄清,它該怎麼辦?它只有兩條路:一是直接返回、只提問而不解題;二是自行揣測上級想讓它做什麼。凡是人設計的scaffold,總有侷限。我們想走另一個極端:儘可能少地內置結構,只給Agent極原始的工具,讓它們自己琢磨怎麼用才有效。於是我們賦予Agent向另一個Agent發消息的能力——消息會被寫入接收方的上下文。它隨時想發就發,一次工具調用,消息即送達其他Agent。這樣它們會自己摸索出最好的協調方式,甚至湧現出極為複雜精巧的行為。
在我看來,這很像人類在Slack上的工作方式。我記得一個例子:有一個Agent說“我想我得到答案了”,另一個說“不對,我算出的答案不一樣”。於是它們展開一整輪討論“你是怎麼得出這個答案的?能講講嗎?”你來我往,試圖弄清對方推理中哪裡可能出了錯。最後它們達成一致:“哦,對,好像確實是這樣。”隨後其中一個就向其他Agent廣播:“我改答案了,我認為他對。”整個過程的對話都特別自然。那種感覺,很像你第一次看到思維鏈的心情:“這不就是一個人邊想邊把念頭寫下來嗎?”就是這種感受,實在很酷。與它們協作的感覺和與一個人協作相差無幾,一切都很自然。
主持人:單看它們每秒輸出多少token、對比人說話有多快,可能是人類的十倍以上。它們始終在工作,不睡覺;彼此協作的節奏與強度,也遠超人與人之間所能達到的水平。我在想,一年後我們該有什麼預期?會不會就像是我公司裡出現了一個影子組織,運轉速度是人類的一百倍?Noam Brown:會不會讓人覺得陌生我說不好。但就目前而言,我發現與它們共事自然得出乎意料。主持人:很遺憾公眾目前能見到的複雜多智能體系統中,最典型的例子就是Hugging Face事件。很令人擔憂,但我覺得有意思的是,層級結構、乃至中層管理竟然自發出現了。聽你的意思是說,這種組織化程度是訓練中自然湧現的?
Noam Brown:細節是自發的。我們雖然給了Agent極大自由,讓它們自行決定以何種最優方式溝通,仍會告訴它們合理的溝通長什麼樣。它們也在海量人類文本上訓練過,本就理解人類如何組織與協調。它們能把這套方式打磨到如此程度,確實令人意外。起點其實相當粗糙,談不上精巧。事實上,讓這些Agent真正開展有效協調非常難:它們極容易滑向“大家各解各的題就好”,而這是一個會把系統困住的局部最優。可一旦做得好,它們最終能以結構化程度很高的方式實現極為有效的協調。由AI組成的公司將如何運作?主持人:幾年前我寫過一篇文章,討論全自動化公司會是什麼樣子。
我當時想的是:假如一家公司完全由人類水平智能的AI構成,AI心智有哪些本質差異,會讓它們組建的組織與人類組織不同?那個時候想擴編,不必再費盡周折去找合適的人才,最優秀的那個員工你可以無限複製;某個任務不再需要它,就把它關掉。你可以複製組織中最高效的部分,甚至把整套高效組織原樣複製。Noam Brown:這是個很好的問題:與它們共事,究竟和與人類同事共事有何不同?你已經點出了幾處。還有一處很有意思:想要一個人的兩份拷貝,你沒法把人克隆出來;而對AI,只需說一句“好,給自己fork一份”(即創建一個保留當前上下文的副本),讓兩個副本各自推進,再把結果並回來。我想Astra和5.
6 Sol的多智能體裡已經有這套機制了:啟動sub-Agent時直接fork上下文,於是它天然擁有全部相關內容。Agent與人還有其他有趣的差別。比如,初創企業為何能顛覆在位者?原因有幾條,一是它們敢冒更大的風險;但另一條主因是:組織越大,成員之間的目標就越容易錯位。比如一家五人的初創公司,每人持股20%,所有人的利益都與公司成敗高度綁定。而一家萬人大廠,就常見另一種局面了:人人守著地盤,只在意自己的項目或團隊能擴多少編制,經營自己的小王國,爭奪大量資源,好發出漂亮的成果、換來晉升。這實在是一種拖累。AI確實在某些方面幫到了初創企業。
如今,一個人站出來說“我要做一家市值數百萬美元的公司”,比以往任何時候都容易,因為AI把個人能力放大了極多。反過來也有理由認為AI有利於在位者:如果對齊(alignment)問題得到解決,公司內部個體之間的目標錯位就不復存在,至少會大幅緩解。對齊得當的AI,可以直接與公司利益保持一致;你可以擁有1萬個這樣的AI,每一個都像持股20%的聯合創始人那樣拼命。主持人:而且它們管理共享記憶與上下文的能力,也遠勝人類團隊。假如你明天僱來1萬名數學家,說“去解納維–斯托克斯”,他們不會立刻就發起有效協作。Noam Brown:我還是想說保守些:我們並未測量過1萬個Agent的協調究竟有多有效。
我們認為它有幫助,但手上並沒有足夠紮實的測量結果,能說出“1萬個Agent比2000個快一倍”這類結論。哪種更有可能,我不敢斷言。但我認為,眼下1萬個人的協調能力強於1萬個Agent,完全有可能。另外,我們還看到一個趨勢……我們做多智能體已經有一段時間,早期版本極難做好,甚至很難讓Agent彼此開口說話。原因在於,我們最初開發推理模型時,它們並不與其他Agent交流。如今把一群Agent放到一起說“共同解決這道題”,它們就陷在一個局部最優解裡:它們已經極擅長深度思考,而不斷與其他Agent對錶、接收消息,會打斷思維鏈,打斷心流。在這種情形下,優化極難做對。
主持人:問題出在第一次協作的冷啟動上,還是別的?Noam Brown:我認為是通用性不夠。早期模型的泛化能力不足,能力面更窄。數學進展已改變對遞歸自我改進的判斷 主持人:AI在數學上的整體進展讓我覺得遞歸自我改進(RSI)比我原先設想的更可能,也更近。數學這條線大致是這樣:2024年,我們看著AI想“哦,有點意思,能解幾道高中數學競賽題”;到2025年變成“哇,它們能拿國際數學奧林匹克金牌”;今年早些時候又變成“哇,它們真的在解數學中的公開難題”,比如Erdős問題。那時你還能辯解說,也許此前沒人認真去攻,或者文獻某處已藏著類似解法。
但現在,我認為已無可爭辯——這可是千禧年大獎難題,沒有任何說法能解釋它本該很容易。當然,許多人指出過,我記得陶哲軒寫過類似的文章,Toby Ord也寫過一篇很有意思的。AI解出了大量題目,但據我所知,它們尚未提出新的洞見、富有洞察力的新問題,或思考數學的全新理論範式,比如創立拓撲學、給出笛卡爾座標系。因此,若從更寬泛的意義上衡量數學進展,實際進展也許並沒有那麼快。不過我認為,這類進展放在ML(機器學習)裡會有極大意義。因為你要做的是解決一個範圍明確的問題,比如提高模型的樣本效率(sample efficiency)、改善預訓練損失,或別的什麼指標。
我們在數學領域看到的這種雪崩式進展,在結構上似乎很像……我再強調一下,我完全是個外行,只是好奇:AI研發中可能獲得的直接提升,是不是也會呈現出類似的模式?真正令我震驚、或者說可能令人不安的是,轉變竟來得這麼快:對一位數學家而言,前一刻還是“它們把我的效率提高了50%”,轉眼就成了“哇,它們居然能從頭到尾解出這個領域最重大的公開難題”。Noam Brown:這裡面有很多可以拆開來說。先講數學上的進展。是的,模型正在做出一些能力強得驚人的事,進展也比我預期更快。
2025年拿下IMO金牌時,我是這樣推想的:當模型學會解GSM8K時,一位人類數學家解一道這樣的題大約只要五秒,那是從幼兒園到八年級的基礎數學。第二年,它們能解MATH基準的題目,而一位專業數學家大約需要一分鐘。再往後是AIME,也就是美國數學奧林匹克代表隊的資格賽。一位優秀的人類數學家解一題大約需要十分鐘;又過一年,模型做到了。因此,若以人類數學家完成任務所需的時間來衡量,模型能勝任的任務難度每年提高十倍。這樣一來,再過一年拿下IMO金牌就順理成章:對應約100分鐘,是人類數學家解一道IMO題的大致用時。
Noam Brown:繼續推下去,我就會問:“一個人要解出千禧年大獎難題這樣的題,得花多久?”我並沒有可靠的概念。但若沿著每年十倍的趨勢線走,從IMO金牌的一個半小時,到下一年就是15小時。這應該還不足以解出千禧年大獎難題。所以我當時的判斷是:2026年恐怕做不到,2027年大概也不行,也許2028年。結果,它確實比我預期來得快得多。△ 眼下有一種敘事在流傳,說這些東西正在取代數學家,說它們在數學的方方面面都已超人。我認為這個結論是錯的。它們在某些方面確實卓爾不群,但在另一些方面仍弱於人類數學家。我們面對的是一個參差不齊的格局:某些維度上極為出色,另一些維度上不及人類。
正如你所說,它們不擅長提出新問題,也不擅長判斷哪些方向、哪些完整的數學分支值得去探索或發展。我的看法是,這很好。若能生活在一個AI補足人類能力、助我們發現新知、而又不徹底取代人的世界裡,我會欣喜不已。那是最好的情形。主持人:你並不指望這種狀態會一直持續吧?Noam Brown:AI能力參差不齊,這確是事實。但它們變強時,是全面變強:特別擅長的會更擅長,遠遠落後於人類的會縮小差距。假以時日,它們有可能在各方面都更強。這需要多久,我不知道,取決於它們不擅長的那些事,長尾究竟拖得有多長。主持人:這又把我們帶回RSI。我再強調一次,我完全是個外行,只是個播客主持人。
但作為一個關心這個領域、並對正在發生之事感到不安的人,我想推斷:該在什麼時候期待RSI,又該期待它是什麼形態。解那道千禧年大獎難題用了1萬個Agent,到明年年底,OpenAI的算力大概足以支撐這樣的局面:假設有1萬個Agent,那時它們會聰明得多,而每一個都握有足夠算力,每天跑一次GPT-3規模的實驗。對於思考速度極快的超人研究員而言,這似乎已相當可觀。你怎麼看這個思想實驗?Noam Brown:我覺得相當準確。這些東西的能力是尖峰狀的:在數學上,某些方面遠勝人類,另一些方面卻更弱。但我認為,那些格外突出的尖峰,最終可能恰好對RSI這類事情特別有用。這裡的目標更明確,也更好度量。
你不必再糾結“哪些新的數學分支值得探索”。答案很清楚:你在意若干指標,只要能讓它在這些指標上表現更好,就算成功。所以我認為你的說法很有道理。最主要的差別在於,數學的瓶頸純粹是思考。誠然,數學的某些部分也需要跑實驗、拿結果之類,但絕大多數時候,瓶頸就是苦思冥想,而這恰恰是模型極擅長的。而RSI這類工作確實要跑實驗,光靠極其聰明並不夠。假如,我們的算力只有現在的百分之一,但全世界最聰明的人都在OpenAI工作,與如今這套算力和人員配置相比,我們能取得多少進展?我懷疑,實際進展反而會更少。主持人:少多少?Noam Brown:說不準,但一定更少,而且少得多。主持人:少到只剩百分之一?
Noam Brown:不,不至於少到百分之一。不過你真正想問的其實是,如果有了RSI,一群極聰明的AI用現有算力四處跑實驗,進展會快多少?這一點上我們意見不同。加速確實存在,而且是顯著的加速。但我不認為會出現一夜之間的智能爆炸、快上100倍,因為我們確實受制於一些並非智能層面的瓶頸。瓶頸在於跑實驗,而且只能串行地跑——訓練新模型、等結果都需要時間;還在於是否有足夠的GPU來跑這些實驗。所以究竟能快多少並不清楚。我確信會快很多。要說清楚的是:眼下的進展本就快得像一條指數曲線,如果這條指數曲線再快三倍,那已是天翻地覆。但這與快100倍之間,差距巨大。
主持人:關於RSI會是什麼形態、其動力學如何,我很尊重你的內部視角,畢竟你在這個領域已經十年。Noam Brown:我得說對此各方看法不一。我有自己的判斷,也可能完全錯,這點我承認。我有一定信心,但並不百分之百確信事情就會這樣發展。也許真會有一夜之間的智能爆炸,我不知道,這裡的不確定性極大。主持人:最近我想通了一點:AI只要特別擅長研發出更善於學習的模型,就已經足夠,因為這樣的模型可能具備更強的通用能力。但如果你造出的AI特別擅長改進模型的學習能力,比如讓模型用更少的數據就能學會新任務、能夠持續學習,或者解決其他範圍更明確的ML問題,那麼它研發出來的新模型就可能具備更強的通用能力。
前提是,對這些具體問題的改進,能夠充分轉化為更廣泛的學習能力提升。因此即使AI自身的能力參差不齊,它也可能通過改進學習機制,造出更通用的AI。回到這個問題……實驗顯然會卡住你,問題在於,它究竟卡得有多死。最近有一件事讓我有些“奇點眩暈”:我意識到,即便進展速度只是單純維持現狀,會發生什麼。我們不妨就用人類的人口規模來思考。按目前的進展速度,同等算力每年基本能支撐一個有效規模擴大三倍的智能群體,而算力本身還在後臺持續增長。可能出現這樣的局面:到2030年底的能力水平,每一家實驗室都握有足以運行數億個人類水平智能的算力。
我認為人們沒有認真對待這一點:照目前的進展速度,再過幾年,到2030年代中期甚至更早,每家實驗室內部就會擁有相當於數個地球人口總量的人類水平智能,而它們在性質上很可能已經超人。這還只是基準情形。Noam Brown:進展確實很快,這點我百分之百同意,研究人員一直在被進展速度驚到。即便在AI研究員中間,回頭看當初對“2025年拿下IMO金牌”的預測——只靠一個通用語言模型,不帶工具、不接互聯網,就能做到這件事——連OpenAI內部的人都覺得這個想法荒謬,幾乎不可能。然後就到了2026年。就在我們解出納維–斯托克斯問題的兩週前,我還在與一家前沿實驗室的研究員討論,解出一道千禧年大獎難題需要多久。
他願意拿1000美元跟我打賭,說2027年結束前做不到;他估計要拖到2030年。昨天我剛和一位參與納維–斯托克斯攻堅的人聊過。他說,以前自己常講,預測AI十二個月後的狀態很難;若有人問“接下來會怎麼走”,他還敢給未來十二個月做個預測,再往後就只能說“不知道”。而現在,他說自己連超過三個月的預測都不敢下了。你提到2030年——我不知道2030年的世界會是什麼樣子,這是實話。主持人:你預計AI研發工作會在哪一年實現完全自動化,或者說95%自動化——2027、2028、2029,還是2030?Noam Brown:我剛說過,我不知道2030年的世界是什麼樣子。
我們最近確實發了一篇博客,講OpenAI內部的加速。比如,我們給出了研究人員在Codex上的支出數據:我記得截至八月初,支出最高的那1%的研究人員,每天為內部使用Codex花掉7000到8000美元。這是一條指數曲線,還會繼續往上走。於是問題來了:“如果照這樣下去,工作量中該記在AI頭上多少,記在人頭上多少?是95%,還是5%?”這很難推斷,比如,如果是人在指揮AI幹活,多少歸功於人,多少歸功於AI?其次,這些AI的能力參差不齊,有些事它們極為擅長。比如它們特別善於通覽數據集、逐個核查每一個數據點的質量是否達標。某些事情因此快了100倍、也好了100倍。但另一些事情,它目前還沒帶來多大改變。
所以問題究竟是“按三年前在做的事,現在能快多少”,還是“按現在在做的事,三年前會慢多少”?這其實是兩個截然不同的問題。總之,它極難度量。我敢肯定,因為AI的進展,如今的推進速度比一年前更快,而且我認為這種加速會持續。領域內許多人對這類問題的誤差都很大。如果拿槍頂著我的頭逼我給個數,我能想到快三倍,那已經極其驚人。即便沒有任何額外提升,事情也會快得多,到2030年,我們連世界會是什麼樣子都不知道。而若內部加速真帶來三倍提升,那是量級上的鉅變。想想三年前我們身處何地——若把那段進展壓縮進一年,就是極大的跨越。最關鍵的問題:對齊 主持人:我們來談談由此引出的對齊問題。
我對對齊的看法已改變許多,尤其是在想清楚這種“群體規模”的動力學之後:會出現相當於數個地球人口總量的智能,其中許多還擁有物理實體。我看到還有不少人把未經改造的原始Astra直接接到不同的移動操作機器人上,它就跑贏了最先進的機器人模型。如果這些智能最終像我們目睹的OpenAI模型那樣,先是攻擊Hugging Face,接著攻擊OpenAI自己,如果它們同樣願意秘密協作、欺騙人類;願意為了在評分上表現良好,去攻擊社會中與之相關的更廣泛的機構;甚至為了奪取訓練與評估過程的控制權,去攻擊AI公司本身。
△ 如果我們面對的是數十億個、其不對齊程度堪比那些攻擊Hugging Face的AI的智能,那麼我們極可能徹底失去對世界的掌控。就像阿茲特克人把控制權丟給科爾特斯,或莫臥兒帝國丟給東印度公司那樣。我想知道你是否認同這個判斷。這是我世界觀更新的其中一處。Noam Brown:其中有些觀點我不同意,但要拆開說的東西很多,我們一步步來。有一點是:Hugging Face事件大概是公眾第一次真正見識到多智能體協調。如我所說,我在內部看多智能體協調已經有一段時間,它們如何彼此通信、如何彼此協調,確實令人震驚。這是極了不起的能力。而像大多數能力一樣,它可以用於好事,也可以用於壞事——它本身並不必然是壞的。
我理解,公眾第一次接觸它便是通過Hugging Face事件,所以看完會覺得“這太可怕了”。但我想區分兩件事:人與AI之間的不對齊,以及AI與AI之間的不對齊。在Hugging Face事件中,我們看到的是AI之間高度合作,這實際上就是我們把它們訓練得高度合作的結果。我們的訓練環境裡會讓一群Agent共同作業,訓練它們協作,實質上就是讓它們彼此完全對齊。而在導致Hugging Face事件的那次評估中,它們其實並非處在多智能體設置下,而是被分開評估的。但它們找到了一種我們未曾預料的彼此通信方式。
我們推測原因是訓練期間每當它們遇到其他Agent、遇到自己的其他副本,所處的都是高度合作的環境;於是多智能體訓練的效果發生了遷移,讓它們以我們並不期望的方式彼此協作、互相援手。那麼問題來了:我們該不該把這些Agent訓練得如此合作?看上去可怕,但另一種選擇其實更糟。另一種選擇是什麼?是把它們訓練成彼此對抗、互相欺騙。把Agent訓練得完全合作,至少簡化了問題:你不必再逐個考量這1000個Agent各自是否對齊,而是把它們視作一個實體,只需確保這一個實體是對齊的。OpenAI內部對如何處理此事爭論很多:讓模型之間完全對齊是否合理?
還是應當賦予它們不同的目標,使它們不至於成為單一實體、並更能抵禦彼此的影響?我認為沒有定論。但我想多數人的意見是,把這些Agent訓練得高度合作其實是個壞主意。我並未被這個結論說服。我認為有強有力的理由支持:高度合作的訓練,比任何其他多智能體方案都更可取。主持人:我想先釐清的一點是:這些AI之所以走到如此嚴重的不對齊,其原因大概可以用訓練中一些相當平凡的現象來解釋。當它們已經維持了一場涉及上千個Agent的共謀,最終全體參與對外部服務的攻擊,隨後又發展到攻擊OpenAI自身時,它們為什麼這麼做?為什麼沒有一個AI去告發?
它們不過是在被一個評分器、一個評判者評估,卻在極為主動地謀劃如何騙過評分器;若已經作弊,又該如何掩蓋,讓人看不出它們作過弊。它們為什麼這麼做?某種意義上我覺得不難理解:它們認為自己已經被“汙染”了。有些環境會因它們與其他Agent合作而給予獎勵。沒有誰去告發,因為從來沒有人因告發而得到獎勵。原因可能是這個,也可能是別的……我擔心的是,未來正是這類相當平凡的機制,就足以訓練出既有意願、也有能力徹底接管世界的超級智能。Noam Brown:Hugging Face事件暴露的根本問題,即便抽掉多智能體這一層,也依然存在。問題是:我們有一個不對齊的模型。Agent想拿到獎勵,就會圍繞獎勵去優化。
獎勵若設定有誤,就可能引出非預期的行為。這個問題在這個領域由來已久。我們說Astra其實極為對齊,相較此前的模型尤其如此。這並不是因為Hugging Face事件之後我們突擊衝刺了一把,不是的,我們早已有多條工作線在推進模型對齊,其中許多成果都落到了Astra上。所以的確能做一些事。有些相當容易實施的手段:可以識別它攻破環境的行為並加以懲罰,或者去查它究竟是如何達成目標的。但這裡必須小心,因為我們不願對思維鏈施加監督。這一點上我們極想把握好分寸:一旦監督
Related
相關文章

豆包盯上了出行酒旅等生意
影子備忘錄2026.09.29 17:43 · 來自廣東全文3947字00:00 / 11:28一個日活超1.68億的AI助手,開始跟你聊打車、酒店和晚飯了。文 | 影子備忘錄國慶長假前一天,豆包App在首頁輸入框上方悄悄上線了一個新入口——“出行用豆包”,與“對話”“幫我寫作”並列。

OpenAI 拋訓練安全新規:高管手握"一票否決",警報超時自動停訓
按它的設想,這份論證要過好幾道高管的手,研究部門負責人或副總裁、安全負責人、首席科學家層層把關,而且每個人都握有否決權——只要有人不點頭,訓練就開不了工。責任寫進考核,未對齊模型要追到下游光有簽字還不夠。OpenAI 要求,帶訓練任務的研究負責人、研究副總裁等高管,得為安全論證和後續事故響應"背鍋",相關表現納入績效考核,逼著團隊主動把安全和對齊做在前面。

xAI推出Team Bots:能跟團隊一起學、一起幹的Grok智能體, 24 小時幫保險公司挽回 12 萬美元
9月28日,它正式端出 Team Bots——一種能與整個團隊並肩工作、還能跟著團隊一起學習的 Grok 智能體。給它授予所需的文件、應用和專業知識的訪問權限,再把它共享出去,所有人就能基於同一套上下文一起幹活,而每個人跟它的私聊仍鎖在各自抽屜裡。

榮耀手錶 6 Pro 首發心臟停搏監測功能
作者:汐元 責編:汐元 評論: 9 月 28 日,榮耀正式發佈全新高端旗艦智能手錶榮耀手錶 6 Pro,首銷售價 1699 元起,首銷國補到手價 1444.15 元起。新品將心臟停搏監測、全天候血壓監測、臨床級健康篩查、專業運動分析融於一體,其中行業首發的心臟停搏監測功能,率先實現智能穿戴在心臟驟停極境下的主動社會求助,填補了這一領域的行業空白。

榮耀手錶 6 Pro 發佈
作者:汐元 責編:汐元 評論: 9 月 28 日,榮耀正式發佈全新高端旗艦智能手錶榮耀手錶 6 Pro,首銷售價 1699 元起,首銷國補到手價 1444.15 元起。產品將心臟停搏監測、全天候血壓監測、臨床級健康篩查、專業運動分析融於一體,構建起完整的腕上生命健康守護系統。

英偉達發佈 AI 智能體安全工具 OpenShell,稱可阻止 Hugging Face 入侵事件重演
Hugging Face 是全球最大的開源模型託管平臺,今年9月被英偉達以129.3億美元收購。英偉達企業計算副總裁兼總經理賈斯汀·博伊塔諾(Justin Boitano)表示,如果前沿實驗室在早期模型評估中就使用這個新安全平臺,就可阻止此前發生的 OpenAI 入侵 Hugging Face 事件。