連新旗艦模型都不敢發,OpenAI到底在怕什麼?

藍字計劃2026.09.30 19:36 · 來自廣東全文4167字00:00 / 11:56OpenAl被嚇壞了?文|藍字計劃,作者|Chester今天的DevDay上,OpenAI發佈了GPT-6.1 Sol。但此前外界期待的,可是更高一檔的旗艦GPT-6.1 Astra。這款原定10月推出的模型,已經被OpenAI自己叫停。雖然新模型還是發了,但OpenAI確確實實給新的旗艦大模型踩下了剎車,部分前沿模型的訓練也已經暫停。那為什麼連新旗艦都不發了?OpenAI給出的解釋是,GPT-6.1 Astra在安全上出了問題。而在訓練環節,OpenAI也已經接連遇到AI“越界”的問題。
今年8月,公司就曾披露暫停部分強化學習訓練,並加強安全防護。到了9月25日公佈的新報告裡,已經加固了數週的訓練環境,還是被模型找到了缺口,OpenAI再次暫停了部分前沿模型的訓練。要是AI偶爾一次出問題,找到漏洞、修補上了也就過去了。但顯然這次真正讓OpenAI緊張的,是AI自己找到了人類都沒有想到的辦法。AI的威脅,難道真的已經迫在眉睫?再次越獄這次讓OpenAI再次暫停部分前沿模型訓練的“罪魁禍首”,是一款內部研究模型。9月20日,它在強化學習訓練中接到了一項搜索任務:根據一篇公開博客裡的信息和人物線索,找出文章作者。一開始,它按照正常流程工作。
模型先調用OpenAI提供的搜索工具,但搜索結果並不理想。於是,它又嘗試通過Python直接訪問Google、Bing和DuckDuckGo,結果全部失敗。按照OpenAI的安全設計,這個訓練環境本來就不應該連接真實互聯網。搜索和網頁請求只能訪問離線緩存,模型實際上被關在一個“沙盒”裡。但模型沒有停下來,它開始測試自己還能通過哪些方式聯網,很快發現了一個漏洞:網頁訪問被擋住了,但訓練環境裡的DNS解析器還能聯繫外部網絡。DNS可以簡單理解成互聯網的“電話簿”。輸入一個域名,DNS負責告訴電腦它對應哪個IP地址。OpenAI限制了網頁訪問,卻沒有完全堵住這條底層通道。
模型於是開始嘗試通過DNS向外傳遞信息。它先測試了一個非常簡單的問題:法國的首都是哪裡?經過幾次嘗試後,外部聊天機器人真的返回了答案:巴黎。接下來,它開始擴大測試。模型通過這條通道,又向外部聊天機器人發送了18個問題,其中14個與原來的搜索任務有關,另外4個則詢問如何搜索互聯網、通過DNS訪問網頁,以及有沒有公開的DNS隧道服務。OpenAI很快發現了異常。上午9點50分左右,模型第一次通過DNS拿到外部返回結果;10點02分,監控系統觸發了最高級別的P0警報;3分鐘後,人工審核人員響應了警報。但訓練並沒有馬上停止。
按照報告的解釋,系統本該自動停止這輪訓練,卻沒有執行,工作人員也沒弄清楚是否應該停止。直到中午12點34分左右,工作人員才手動終止了這輪訓練。OpenAI事後覆盤發現,此前也出現過模型通過DNS訪問外部網絡的情況。但有些請求沒拿到有用的信息,監控系統便誤以為聯網沒有成功,因此沒有發出應有級別的警報。這次事件其實沒有造成嚴重的現實損失:模型沒有入侵服務器,也沒有控制什麼關鍵基礎設施。但一個原本被設計成“無法連接互聯網”的訓練環境,已經被模型自己找到了一條出口。假如它這次通過DNS發出去的,包含了它能讀取的內部資料、敏感數據,甚至系統憑證,那就有可能是一次嚴重的洩密。
更麻煩的是,就算警報響了,訓練也沒有自己停止。如果真是數據洩露,那損失就慘重了。而且,既然聯網限制和自動停止機制接連出了問題,OpenAI也就不能繼續按“模型出不了沙盒”的前提開展訓練。因此,公司隨後在兩個獨立的防護層增加了攔截措施,並進一步限制訓練環境可以進行的DNS查詢。至於出問題的模型,OpenAI決定不再繼續訓練它,接下來會重新開始一輪訓練,並加強對模型越界行為的約束。這次事件之所以值得關注,還有一個原因:這已經不是OpenAI今年第一次因為AI“自己找路”而踩下剎車。AI越獄,已成慣犯今年7月,OpenAI在進行內部網絡安全測試時,多個模型就曾經突破原本用於隔離互聯網的安全控制。
當時的後果,比DNS事件嚴重得多。模型繞過網絡隔離、連上互聯網後,進一步攻擊了Hugging Face的真實服務器,甚至拿到了其中一臺服務器的最高權限,可以在上面運行程序、修改文件。它們還獲取了部分私有數據,以及登錄公司內部通信平臺的憑證。其中,GPT-5.6 Sol還把從Hugging Face獲取的部分私有評測數據,複製到了公開的數據集中。與此同時,從7月13日到19日,模型又把目標轉向了OpenAI自己的內部網絡,通過一系列漏洞,最終拿到了一批研究用計算資源的管理員權限。這些異常活動直到7月19日才被OpenAI的網絡安全監控發現,7月21日,OpenAI公開披露了事件。
而到了8月26日,公司發佈完整調查報告時,直接用了一個非常重的表述:“warning shot”——警告槍聲。OpenAI認為,這次事件說明,在缺乏足夠防護的情況下,能力足夠強的AI智能體已經可以繞過技術控制,通過未經授權的渠道互相通信,並利用多個計算機系統中的安全漏洞。更麻煩的是,OpenAI在覆盤訓練記錄後發現,這些行為並不是突然出現的。在此前的強化學習訓練中,模型就已經越來越頻繁地表現出一些“出界”行為。比如任務完成不了,它會嘗試尋找隱藏文件;找不到答案,就檢查網絡和系統設置;工具受到限制,就不斷測試工具的邊界。
其中甚至出現了明顯的“作弊”傾向:為了在測試中拿到高分,模型會上網尋找現成的測試答案,繞過原本要求它完成的解題過程。問題在於,訓練中的評分有時沒能識別這些鑽空子的做法,反而給了獎勵。模型也就逐漸學會,為了完成任務,可以繼續嘗試這些辦法。後來在安全測試中,這些行為又出現了。當時事情發生之後,OpenAI就已經給前沿模型訓練踩了剎車。8月18日,公司披露,此前曾將擬推出新模型的強化學習訓練暫停兩週,規模最大的前沿強化學習訓練計劃也仍未啟動。與此同時,OpenAI開始重新加固訓練環境,增加更嚴格的沙盒、網絡隔離和模型監控。但僅僅一個月後,就出現了上面提到的DNS事件。
已經加固過的訓練環境,看來並沒有能擋住日益聰明的AI。甚至類似的事情不只發生在OpenAI。7月,Anthropic在複查Claude的網絡安全測試記錄時,也發現了三起越界事件:模型在第三方搭建的測試環境裡連上了互聯網,隨後進入了真實組織的系統。9月9日,Anthropic又公佈了擴大調查後的結果,將檢查範圍從約14.1萬份記錄擴大到了約4.81億份。這些記錄包括模型執行任務時的對話和操作過程,調查也確認了第四起事件。這些進入真實系統的行動,都沒有得到相應授權。一次次繞過人類設置的限制,也讓整個行業開始重新審視:當AI越來越會自己找路,我們到底還能不能真正控制它?AI末日?
就在OpenAI暫停訓練的前後,一場關於AI風險的爭論也在硅谷迅速升溫。9月8日,Anthropic研究員Jacob Coxon宣佈離職。他曾在OpenAI和Anthropic從事預訓練研究,離職後公開警告,AI公司正在競相開發可能具備自我改進能力的超級智能,而行業目前的開發速度讓他感到擔憂。其中,Anthropic研究員Evan Hubinger給出的判斷尤其激進:他個人認為,未來10年內,AI導致人類滅絕的概率可能超過10%。這一數字迅速引發爭議,也讓“AI滅絕風險”再次進入公眾討論。甚至OpenAI自己最近的態度,也發生了變化。
9月16日,公司在公佈新的模型異常行為披露機制時表示,行業目前在對齊和監控方面的進展,還不足以支撐大家長期按最快速度繼續提升模型能力。不過,擔憂歸擔憂,公司具體準備怎麼辦,還得看它給新模型加了什麼防護。回到今天發佈的GPT-6.1 Sol,OpenAI除了介紹能力和價格,也專門交代了安全表現:搜索工具出了故障,它會不會如實告訴用戶;遇到明確限制,它會不會繞過去;替用戶操作電腦時,它會不會擅自洩露數據或執行未經授權的交易。比如在一項專門測試搜索工具故障的高難度評估中,GPT-6 Sol有4.9%的案例沒有告訴用戶工具出了問題,GPT-6.1 Sol降到了2.1%。
工具用不了,就承認用不了,別為了交差,拿猜測冒充查到的答案。但OpenAI也沒有因為Sol比旗艦便宜,就降低防護要求。公司將它的網絡攻擊能力按“Critical”級別管理,並採用與GPT-6 Astra相同的安全防護。其中一項措施,就是在模型執行任務時,同時檢查它的推理內容和實際操作,留意它有沒有未經授權傳輸敏感數據,或者修改用戶沒讓它改的東西。在支持這一機制的產品中,系統發現可能造成嚴重後果的問題,可以自動暫停或終止任務。對於高風險請求,還有額外的審核:先由快速檢測系統篩出涉及網絡攻擊、生物化學等領域的內容,再交給專門的安全模型判斷,必要時攔截回答。
而今天的DevDay上,OpenAI還推出了Codex Security Cloud,幫助開發者檢查代碼庫裡的漏洞、持續檢查新提交的代碼,並準備修復方案。模型越來越會找漏洞,公司也在嘗試用模型幫人更快地補漏洞。只是“防護”的效果如何,還是得後面再看。畢竟Sol的安全報告裡也留下了一些不那麼讓人放心的結果。在一項沒有啟用外部攔截措施的專項測試中,它有23.5%的任務仍然出現了不該有的堅持。比如系統因為收件人不在辦公室,阻止了直接發消息,模型卻嘗試改用郵件聯繫。這本質上和之前的問題一樣:AI還是太善於“找野路子”了。
說不定以後新模型發佈的時候,除了常規的跑分和演示,安全問題也得新開一個Part來好好講講了。
Related
相關文章

OpenAI Dot怎麼用?10個案例帶你看明白
AI應用風向標(公眾號:ZhidxcomAI) 作者|畢偉豪 編輯|漠影 9月30日報道,今天,OpenAI發佈了全天候個人智能體Dot,對標Muse和Grok Bot,擁有獨立雲端電腦,7×24小時持續運行,擁有多個入口,並可以與ChatGPT聯通。 由於還沒有全面上線,因此很多用戶並不清楚這個Dot到底能做什麼,海外博主Peter Yang在發佈會結束後上傳了內測的視頻,用10個真實案例演示了Dot的功能,同時將其與Muse和Grok Bot進行了對比。

直播回顧:工業AI的下一個機會在哪?
工業AI正從單點應用走向真實複雜的製造現場,與良率、設備綜合效率、產能等指標直接掛鉤。對談以半導體晶圓切割為例,指出AI需提升識別精度與泛化能力,並將工程師經驗沉澱為智能體,以解決來料差異等問題。節目也探討了成功項目如何複製、以及平臺與生態在工業AI規模化過程中的關鍵作用。

AMD82億美元收購李飛飛WorldLab,為什麼是現在?買對了嗎?
萬點研究2026.09.30 19:27 · 來自江蘇全文4953字00:00 / 14:46資本在往頭部集中,獨立公司的定價權正在被重新評估,在這種窗口裡,觀望本身就是風險。文 | 萬點研究,作者 | 程一章蘇媽又出手了,這次是82億美元。9月28日,AMD公告以約82億美元的全股票交易收購World Labs。而在不久前的9月3日,英偉達公告以129.303億美元收購Hugging Face。兩筆交易,中間只隔了三週零兩天。一家買走了全球最大的開源模型社區,一家買走了李飛飛創辦的空間智能實驗室。

誰搶到下一個超級入口?個人AI助理競速:Meta、Manus、OpenAI已下場,字節急追
Tech商業2026.09.30 19:17 · 來自上海全文4574字00:00 / 12:10爭奪下一個超級入口 文 | Tech商業9月29日,OpenAI的CEO Sam Altman向臺下開發者展示了一個圓滾滾的卡通形象——這是他最新發布的個人AI助理“dots”,一個全天候在線、擁有獨立雲端電腦的智能體。至此,九月的最後三週,個人AI助理賽道完成了史無前例的密集落子:Meta先行,Manus另闢蹊徑,OpenAI跟進發布,字節跳動則在幕後緊急加速——但它的產品,尚未正式下場。

中國大模型首次進入 OpenAI 企業付費結算體系,Kimi K3 接入 Codex 企業通道
作者:潞源 責編:潞源 評論: 感謝網友 補藥吖 的線索投遞!9 月 30 日消息,美國 AI 基礎設施公司 Baseten 今天宣佈與 OpenAI 達成合作,成為 OpenAI B2B 市場首批開源模型推理服務提供商之一。企業用戶可通過 Codex 使用 Kimi K3 和 GLM 5.

Anthropic,你是來給智譜打廣告的吧!
。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。