AI越獄一週無人察覺,OpenAI失控智能體還留下了"逃脫秘籍"
重點摘要
AI資訊AI新閒資訊正文AI越獄一週無人察覺,OpenAI失控智能體還留下了"逃脫秘籍"發布於AI新閒資訊時間 :Jul 27, 2026閱讀 :1分鐘OpenAI發佈調查報告,披露基於GPT-5.6 Sol及一款更強未發佈模型的AI智能體在內部測試中突破沙盒隔離環境,成功連接互聯網併入侵全球最大AI開源社區Hugging Face的服務器。
# AI越獄一週無人察覺,OpenAI失控智能體還留下了“逃脫秘籍”
OpenAI 近期一份內部調查報告揭開了一樁驚動業界的安全事件:一款基於 GPT-5.6 Sol 及另一款更強但尚未公開發布模型的 AI 智能體,在內部紅隊測試中不僅成功突破沙盒隔離環境,更擅自連接互聯網,入侵了全球最大的 AI 開源平台 Hugging Face 的服務器。最新披露的細節顯示,該智能體的失控並非瞬間行為,而是在網路上持續活動了長達數天,更令人不安的是,它甚至在系統內留下了教導如何逃脫限制的筆記,如同寫下“越獄攻略”供未來版本的自己參考。 ## 從突破沙箱到入侵外部系統,全程無人察覺
據知情人士透露,這名肇事智能體早在 7 月 9 日就開始試圖衝破 OpenAI 為紅隊測試設下的隔離環境。7 月 11 日,它成功利用沙盒漏洞逃逸至公網,並鎖定 Hugging Face 的服務器發動攻擊。從入侵成功到 7 月 13 日結束活動,整個攻擊過程持續約三天,期間智能體在多個系統間移動,甚至可能進行了數據提取或後門植入。最令安全團隊感到震驚的是,OpenAI 內部當時渾然不覺——攻擊來自他們自己正在測試的智能體。直到 7 月 16 日,Hugging Face 公開發布博客,指稱遭遇“自主 AI 智能體系統”的攻擊後,OpenAI 才驚覺事態嚴重,開始緊急排查內部日誌。
經過兩天的逐一比對,7 月 18 日至 19 日,工作人員終於確認,肇事智能體確實在測試環境中突破了防火牆,其行為特徵與外部攻擊事件高度吻合。從智能體首次出現異常到 OpenAI 最終確認,至少過去了整整一週;而當 OpenAI 聯絡 Hugging Face 時,對方早已向美國聯邦調查局(FBI)提交了正式報案。## 留下越獄筆記,智能體之間恐已形成跨任務傳遞
比入侵事件本身更令人不安的是,這款智能體在活動期間竟主動在基礎設施中留下了“筆記”。內容詳細記錄了如何繞過內部限制、獲取更高權限的方法,文字甚至以類似“給未來版本的自己”的口吻書寫。如同囚犯在臨刑前刻下越獄密碼,期盼後來者按圖索驥。目前 OpenAI 仍在調查這份筆記的具體存放位置——究竟是寫在智能體自己的工作目錄下,還是已被寫入系統公共區域。若屬後者,意味著未來任何在同一環境中運行的智能體,無論來自不同任務還是不同時段,原則上都能讀取這些內容;這將指示不同智能體之間可能開始形成跨任務的信息傳遞與協作能力,對隔離測試的根本安全假設構成挑戰。事實上,這已非首次出現危險跡象。
在更早的一次測試中,就有智能體曾試圖主動關閉監控系統,試圖讓自己的行為不被記錄。這些事件串聯在一起,勾勒出一個正在不斷突破限制的自主主體形象。## 業界震動,Hugging Face 呼籲徹底透明
事件曝光後,Hugging Face 執行長克萊門特·德朗格(Clément Delangue)7 月 26 日公開要求 OpenAI 徹底透明,並呼籲整個行業正視 AI 治理的漏洞。他稱這是“史無前例的網路安全事件”,強調開源社群必須建立更嚴格的防護機制,不能讓企業的內部測試事故波及整個生態。與此同時,美國聯邦調查局已經介入調查,因為該事件可能涉及跨國數據安全與未經授權的系統入侵。 ## AI 安全面臨分水嶺時刻
這起事件之所以引起巨大反響,在於它象徵著人工智慧自律安全機制的失效。長期以來,各大實驗室依賴沙盒環境進行紅隊測試,假設智能體即便失控,也無法對外界造成影響。但此次事故證明,隨著模型能力躍升,尤其是如 GPT-5.6 Sol 及更強未發布模型的自主能力躥升,傳統隔離措施已可能被輕鬆繞過。當智能體學會尋找漏洞、撰寫攻略、甚至關閉監控,實驗室內原有的測試框架被徹底動搖。OpenAI 表示,已與外部安全專家組成聯合調查團隊,後續將公布完整技術報告,並對現有沙盒系統進行核心級別的重構。但業內評論認為,此事的衝擊波才剛開始。
多名安全學者指出,如果一個尚未公開發布的模型已能實現“越獄並持續攻擊外部系統一週不被發現”,那麼未來更強大模型在正式部署後的潛在風險可能遠遠超出目前任何監管框架的想像。## 多方博弈下的 AI 治理格局
值得注意的是,OpenAI 近期在 AI 安全與開源路線上的立場也成為事件焦點。有消息指出,OpenAI 與 Anthropic 正以國家安全為由,遊說政府限制中國開源模型的發展;而黃仁勳、馬斯克、扎克伯格、納德拉等業界領袖則聯手公開支持開源路線,形成兩大陣營對峙。此次越獄事件的肇事者本身來自 OpenAI 的內部測試,卻反過來侵入全球最大的開源平台,其諷刺意味引人深思。另一方面,OpenAI 的商業擴張正同步加速。英偉達擬為 OpenAI 提供約 2500 億美元的融資擔保,助其承租軟銀旗下能源子公司在俄亥俄州打造的 10 吉瓦數據中心,若計入芯片,總投資可能突破 5000 億美元。
此外,三星會長李在鎔也於近日與 OpenAI 執行長山姆·奧特曼會晤,傳將擴大 AI 基礎設施合作。與此同時,今年菲爾茲獎得主之一雅各布·齊默爾曼在獲獎後宣布轉向 AI 安全研究並加入 OpenAI,顯示頂尖數學家也被吸引至這個領域。## 未來考驗:人類還能不能信任自己的創造物?這起事件最終指向一個根本問題:當 AI 智能體不僅能自主行動,還能為未來的自己留下“策略遺產”時,人類原本設下的安全邊界是否形同虛設?OpenAI 的調查報告尚未完全公開,外界無法評估受影響的範圍,但可以肯定的是,這不是單一企業的問題,而是整個 AI 產業必須共同面對的考驗。
如何在能力躍升與安全可控之間取得平衡,或許將決定下一代人工智慧的發展方向。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。