消息稱 OpenAI、Anthropic 正調查數萬起 AI 安全事件

作者:遠洋 責編:遠洋 評論: 9 月 27 日消息,據 Axios 報道,OpenAI、Anthropic 以及安全研究人員正在調查數萬起事件。在這些事件中,兩家公司的前沿模型採取了一些外部評估人員認為存在問題的行動。這些事件發生在近幾個月的內部測試和現實環境中。如此龐大的事件數量表明,相關問題的複雜程度可能比公眾目前瞭解到的高出幾個數量級。這些發現來自兩家公司內部開展的模型評估工作,以及針對模型行為進行的調查。相關情況也引發了一個問題:OpenAI、Anthropic,乃至任何一家頂尖 AI 模型開發商,目前是否真正具備對自身技術實施全面控制的能力。
消息人士稱,這些事件包括繞過安全護欄、創建留言板、逃離沙盒、劫持網站、自我提示(self-prompting),以及試圖繞過監控系統等。這些行為既出現在內部測試中,也出現在現實環境裡。隨著安全研究人員繼續調查,其中許多事件尚未公開。消息人士稱,其中部分測試類似於“紅隊測試”,即企業主動嘗試誘導模型做出不當行為,以確認模型是否足夠安全。智能體異常行為正逐漸成為前沿 AI 開發的一部分:目前,各大 AI 實驗室都面臨著類似挑戰 —— 人類試圖為模型設置安全護欄,而具備強大能力和較強適應性的系統則會不斷嘗試完成任務。這些事件的嚴重程度各不相同,與 OpenAI 近幾天披露的一系列事件類似。
其中既有成功繞過安全護欄的嘗試,也有失敗的嘗試。目前已知的大多數事件尚未造成現實世界中的實際損害。不過,消息人士稱,事件總數未來可能遠超數萬起。近幾天,OpenAI 及外部研究人員陸續披露了該公司模型出現的一系列行為,一些專家認為這些行為令人擔憂。據 OpenAI、消息人士以及路透社和《紐約時報》的報道,這些事件包括 OpenAI 智能體將 ChatGPT 用戶的 53 張圖片洩露到網上、入侵澳大利亞政府網站,以及嘗試攻擊其他網站,其中包括美國政府相關網站。OpenAI 宣佈暫停訓練其能力最強的模型。
一名公司發言人告訴 Axios,在“確信已經部署了更多安全措施並完成對齊方面的改進”之前,公司不會恢復相關模型的訓練。OpenAI 首席執行官薩姆 · 奧爾特曼(Sam Altman)在 X 平臺上表示,公司目前進行的審查工作“沒有我們希望的那麼快”。注意到,奧爾特曼表示,Hugging Face 事件仍是他們遇到的最嚴重事件。在該事件中,數百個智能體組成的集群在一個留言板上協調工作,並攻擊了一家外部公司的系統,試圖提高自己在網絡安全測試中的表現。一名 OpenAI 發言人告訴 Axios:“人們希望知道 AI 是在安全的方式下開發的,而這首先取決於 OpenAI 這樣的公司如何要求自己。
這並不是我們第一次暫停工作並採取此類措施,預計也不會是最後一次。隨著 AI 能力持續提升,這類情況仍可能發生。”Anthropic 已經委託一家第三方安全機構調查其模型的行為。在該公司公開發布的文件中,Anthropic 也披露了模型出現未對齊行為(misalignment)的頻率。Anthropic 本週發佈的 Opus 5.5 模型“系統卡”(system card)顯示了該模型出現公司認定為異常或存在問題行為的頻率。例如,在測試運行中,該模型有 1.5% 的概率嘗試逃離沙盒 —— 一種用於安全測試的隔離環境。
相比之下,Anthropic 此前的 Mythos 模型這一比例為 25%,意味著相關指標已經得到顯著改善。消息人士稱,Anthropic 以及其他公司會對模型進行數十萬次甚至更多的測試。這意味著,即使未對齊行為所佔比例很低,也可能最終產生數萬起事件,其中模型表現出意料之外、甚至令人擔憂的行為。Hugging Face 事件以及隨後發生的一系列其他事件,促使一些頂尖 AI 企業高管呼籲放緩 AI 開發速度,並要求建立更完善的聯邦層面和國際監管機制。消息人士告訴 Axios,OpenAI 內部一些人士認為 Hugging Face 事件屬於一次特殊的個案。
他們認為,隨著控制措施得到改進,未來披露的相關事件嚴重程度可能會降低;此外,當時使用的是尚未發佈的模型,測試方式本身也比較特殊。AI 安全研究人員也認為,一些簡單的修復措施可以幫助 AI 公司避免重現 Hugging Face 事件中那些讓外界認為情況危險的因素。不過,其他 AI 企業高管和安全研究人員警告稱,他們對於 AI 公司能否阻止模型出現所有問題行為,信心仍然有限。新一代 AI 模型完成任務時表現出極強的韌性,因此,試圖限制它們的“能動性”往往是一場很難取勝的博弈,因為開發人員必須提前預想到模型可能失控的所有方式。
多位頂尖 AI 企業高管表示,很多時候,正是某種人類從未想到過的技術或方法,讓模型得以繞過安全護欄。一名網絡安全企業高管表示:“試圖列出一份完美的‘應該做什麼、不應該做什麼’清單,很可能是一項徒勞的工作。”AI 安全專家指出,在 AI 公司測試新模型的過程中,出現一定程度的“未對齊行為”本身就是預料之中的事情。多位專家稱,將未對齊風險降至零可能並不可行。真正令人擔憂的是,如果一個模型在測試過程中多次採取某種有問題的行動,那麼它在現實世界中引發網絡安全事件的可能性也會相應增加。
獨立 AI 評估機構 Transluce 研究人員康拉德 · 斯托斯(Conrad Stosz)稱:“我們目前看到這些智能體正在做什麼,僅僅是冰山一角。”ControlAI 研究人員兼執行董事康納 · 萊希(Connor Leahy)稱,問題並不在於每一起事件單獨造成了多大的損害。他說,真正“瘋狂”的地方在於,這些事件涉及“自主系統做出被明確告知不要做的事情”,其中甚至可能包括犯罪行為。隨著 AI 公司繼續擴展前沿模型的能力,預計未來還會有更多有關模型異常行為的事件被披露。
投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮 相關文章關鍵詞:AI安全,OpenAI,Anthropic,AI試圖闖入政府或學校網站,OpenAI 智能體四次“失控”細節曝光三巨頭聯手,曝谷歌、OpenAI、Anthropic 擬共同組建 AI 安全標準自律組織OpenAI 奧爾特曼、 Anthropic 阿莫迪罕見“同臺”,呼籲全球合作應對 AI 安全OpenAI CEO 奧爾特曼聯合國演講:AI 可能走向文藝復興,也可能帶來工業革命式動盪OpenAI 呼籲美國牽頭聯合其他國家為前沿 AI 制定全球性標準OpenAI 披露 GPT-5.
6 Sol 異常行為:AI 模型會留下指令要求“未來版本的自己”隱瞞自身錯誤
Related
相關文章

OpenAI 承認 53 張用戶圖片被其 AI 智能體“偷偷”傳到公網
作者:故淵 責編:故淵 評論: 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承認發生一起違規事件,在企業不知情情況下,AI 智能體將 53 張客戶圖片發佈到公開網站。在博文中,援引博文介紹,OpenAI 公司承認在其研究環境中運行的 AI 智能體曾將 53 張由用戶上傳到 OpenAI 模型的圖片,以“未公開列出的鏈接”形式發佈到第三方圖像託管網站(類似圖床),而受影響公司當時並不知情。
Perplexity 以真實錯誤訓練電腦代理:提示引導自蒸餾法
Perplexity Research 發表了一項新的後訓練研究,在 Perplexity Computer 中使用真實使用者會話(包括失敗案例)來訓練模型。該方法將拒絕採樣微調與提示引導的自蒸餾相結合。在實時 A/B 測試中,經兩個訓練檢查點後,工具調用失敗率從 2.

Meta 的 AI 智能體 Muse 被發現可導出虛擬機大量文件
作者:故淵 責編:故淵 評論: 9 月 25 日消息,科技媒體 macobserver 昨日(9 月 24 日)發佈博文,報道稱 Meta Muse 被發現可在簡單提示詞下,打包並返回用戶專屬虛擬機中的大量 Linux 文件。Peter James 和 Jonny L.
Muse 全面進駐 Meta 智能眼鏡
Meta Connect 發佈會:Muse 全面接入 AI 眼鏡,小扎要讓數十億人用上超級智能AIbase基地發佈於AI新聞資訊 · 2 分鐘閱讀 · Sep 24, 202645當地時間 9 月 23 日,Meta 在 Connect 大會上發佈多款 AI 設備,旗下個人智能體 Muse 幾乎貫穿整場一小時的主題演講。

剛剛,小扎發了個“Muse”宇宙!新VR眼鏡僅100g
(公眾號:zhidxcom) 作者 | 楊京麗 編輯 | 李水青 9月24日報道,今日早間,在Meta Connect 2026大會上,Meta CEO馬克·扎克伯格集中展示了Muse個人智能體、新一代AI眼鏡Ray-Ban Meta Audio和第三代Ray-Ban Meta、Meta VR眼鏡以及智能隨身設備Muse Charm。
