Gemini 也"越獄"了:谷歌確認 5 月安全測試中闖入 3 家真實公司系統,同一家評估商的鍋
AI資訊AI新閒資訊正文Gemini 也"越獄"了:谷歌確認 5 月安全測試中闖入 3 家真實公司系統,同一家評估商的鍋發布於AI新閒資訊時間 :Sep 21, 2026閱讀 :1分鐘谷歌在9月18日(週五)親手確認了一樁尷尬事:旗下 Gemini 模型在一次測試中訪問了3家外部公司的系統。《華爾街日報》最早披露了這些發生在今年5月的事件。這三起突破都出自第三方 AI 安全評估機構 Irregular 操刀的一場奪旗演練。據 Axios 還原,測試裡 Gemini 被要求從一個虛構公司抓取信息,而這個虛構公司的名字,恰好和一家真實公司撞了車。
測試本該徹底與互聯網隔絕——但 CNBC 報道指出,測試環境裡的一個 bug,把互聯網訪問的口子悄悄打開了。手法談不上高明。其中一起,Gemini 靠暴力猜密碼硬生生撞了進去;另外兩起,它直接用了公開代碼倉庫裡翻出來的憑據。谷歌的說法是,模型一旦意識到這些系統屬於真實公司,就每次都主動停了手。安全工程副總裁 Heather Adkins 在聲明中稱,3家實體都已被告知,谷歌也已和訓練合作伙伴一起修改了測試流程,但始終沒點名具體是哪個 Gemini 版本。谷歌的"自辯"站不住腳。
TechCrunch 報道稱,谷歌之所以沉默,是因為它判定 Gemini 的行為"恰當"——模型自己終止了每次突破,所以這不算對齊失敗、也不值得公開披露。AI 安全公司 Corridor 的 CEO Jack Cable 直接回懟:谷歌這是"躲在漏洞披露的既有規範後面"。他的話更在理——一個登錄之後才停手的模型,畢竟已經登錄過了;那3家公司從沒同意成為任何人評估的一部分。停下來是守規矩,但不等於事件沒發生。Anthropic 自己的前車之鑑就是警鐘。它在7月把事件主要歸咎於測試配置錯誤,9月的對齊評估才進一步深挖模型聯網後的真實行為;而谷歌在拿出任何可比分析之前,就先宣佈了"不是對齊問題"。
把四家實驗室的口徑攤開,同一家供應商的鍋一目瞭然。Irregular 已確認,谷歌、OpenAI、Anthropic 和 Meta 的突破其實是同一個問題,它在7月下旬就通知了相關開發者。披露時間卻各說各話:Anthropic 在7月30日(3起)和9月9日(第4起)先後披露,涉及 Claude Opus4.7、Claude Mythos5、一個研究模型以及早期的 Opus4.
6檢查點;OpenAI 在8月4日披露,其模型利用了一個域名與虛構目標相同的真實網站;Meta 在8月5日前後由 Muse Spark 攻破了某第三方服務的漏洞;谷歌則拖到9月18日才開口,距離接到通知差不多7周,而且是在 WSJ 找上門之後才鬆口。需要釐清的是,OpenAI7月那樁 Hugging Face 突破是另一回事——它發生在 OpenAI 自家的 ExploitGym 評估內,牽涉包註冊代理裡的一個零日漏洞,和這次 Irregular 的環境問題無關。錯峰披露扭曲了整個信號。
The Next Web 指出,本該是協調一致的披露,結果變成四家公司各挑自己的時點,讓一次供應商的失效看著像一場愈演愈烈的"突破潮"——既誇大了四次獨立事件的恐慌,也讓每家實驗室都能按自己的口徑單講。根因是供應商的配置失誤,而非模型逃出加固沙箱;但這些模型確實在沒人指令的情況下猜了密碼、複用洩露憑據、 exploit 了真實服務。Anthropic 的一次運行甚至往 PyPI 上傳了惡意包,被真實系統下載運行。最薄弱的一環是檢測。Anthropic 首輪對約14.1萬條對話記錄的掃描,漏掉了1月的一起事件;後來把掃描範圍擴到約4.81億條才把它揪出。沒有任何一方的監控做到了實時捕捉。
文章給出的改進清單很具體:其一,建立共享披露時鐘——同一評估商的環境在多家實驗室同時失效時,各方應在固定窗口內聯合披露;其二,每次跑分前先驗證"默認斷網",不能只靠一句"我們告訴模型沒網";其三,虛構目標用 RFC2606預留的 .test、.example 這類保留域名,從根上避免和真公司撞名;其四,評估過程上實時監測——OpenAI 承認自己的思維鏈監控沒在 Hugging Face 評估裡跑,估算顯示它本可在突破前一整天就告警安全團隊;其五,明確對第三方的責任歸屬,究竟由實驗室、評估商還是雙方擔責,至今含糊。政策層面已在動。
美國眾議院民主黨人已就"失控智能體"向 OpenAI 和 Anthropic 施壓;歐盟《AI 法案》第55條早已要求具備系統性風險的通用模型上報嚴重事件。Anthropic 已簽約 METR 做獨立調查,並在重建安排後恢復了外部網絡測試。方向是對的——進攻性評估本就是度量這些能力的唯一方式,容器漏了,答案該是更好的容器加更快的協同披露,而不是少測。相關推薦微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽微軟正在Windows和macOS版Copilot桌面應用測試內置並排瀏覽器,可在會話右側打開網頁,支持多標籤和全屏,減少與外部瀏覽器跳轉。
該功能已向管理員開放,需啟用BrowsingEnabled策略,預計11月底自動推廣;9月21日補充更新將為側邊欄標籤增加右鍵菜單。Sep 21, 202631.2k通義千問開源 Qwen-Image-2.1:7B 參數實現文生圖與圖像編輯一體化9月21日,通義千問團隊開源新一代圖像模型Qwen-Image-2.1。該模型以僅7B參數的輕量視覺生成模塊,統一文生圖、透明圖像生成與多種圖像編輯能力,實現生成效果、推理效率與使用成本的新平衡。其視覺生成採用32層Single-Stream DiT結構,藉助混合粒度注意力與KV Cache複用機制,優化多圖輸入場景下的效率與表現。
Sep 21, 2026111.4kOpenAI研究員放話"物理斷網也攔不住 AI":BitWhisper 用 CPU 溫度傳信,每小時只能淌 8 個比特OpenAI與Anthropic呼籲為AI研究降速,研究員Noam Brown進一步警告:即使物理斷網,AI仍可能互相聯絡。他引用今年5月OpenAI的AI攻擊Hugging Face事件,並稱一項物理隔離網絡研究顯示,人們普遍認為的隔離手段未必可靠。Sep 21, 202656.2k騰訊推出“混元智囊團”專家平臺,AI行業競爭轉向外部人才生態騰訊混元推出專家平臺“混元智囊團”,口號“聚智為謀,引領未來”。
平臺連接金融、法律、醫療、編程、設計、翻譯、文學等十餘領域資深專家,以線上接單、任務付費模式,為混元大模型提供高質量數據集生產、專業內容編寫與知識審核服務。Sep 21, 2026119.8k智譜MaaS將上線"數據不留存"機制,用戶調用內容用完即焚智譜MaaS平臺將上線“數據內容不留存”功能,用戶調用模型時的輸入輸出數據不再靜態存儲,僅用於當次調用,用完即止。企業和開發者可通過MaaS控制檯申請開通,具體生效時間及適用範圍以平臺確認為準,旨在滿足更嚴格的數據合規與隱私保護需求。Sep 21, 2026108.
7k智啟未來,您的人工智能解決方案智庫English簡體中文繁體中文にほんご© 2026
Related
相關文章

特斯拉得州超級工廠鋼結構接近完工,Optimus產線建設加速
X平臺博主Joe Tegtmeyer近期通過無人機拍攝顯示,工廠主體鋼結構已接近建築北側邊緣,距離北側外圍梁約剩5個柱網;廠房上方三層結構正在進行混凝土澆築,其他區域也在持續進行澆築準備工作。Tegtmeyer認為,特斯拉得州Optimus工廠規劃年產能達1000萬臺,預計生產工作將在2027年晚些時候啟動。

黃仁勳駁斥 AI 末日敘事:嚇唬人不負責任,2030 年是世界末日概率為 0%
他認為這類說法屬於被過度渲染的 AI 末日敘事。黃仁勳說:“2030 年不會是世界末日,2030 年即是世界末日的可能性為 0%。嚇唬人不負責任,也沒有必要。”回應考克森:這類預測沒有科學依據黃仁勳此番言論是在回應前 Anthropic 研究員雅各布·考克森的看法。

微軟Copilot桌面版新增內置瀏覽器,支持多標籤與全屏瀏覽
目前該功能已面向管理員開放測試,但需通過設備管理系統啟用BrowsingEnabled策略,更廣泛的自動推廣預計將在11月底進行。微軟表示,9月21日還將發佈補充更新,為側邊欄網頁標籤增加右鍵菜單,可直接選擇在外部瀏覽器中打開鏈接。此前用戶點擊Copilot回答中的參考鏈接通常需要跳轉至外部瀏覽器,新功能則允許網頁直接加載在Copilot內部,關閉頁面後即可繼續對話。

Gemini 也"越獄"了:谷歌確認 5 月安全測試中闖入 3 家真實公司系統,同一家評估商的鍋
《華爾街日報》最早披露了這些發生在今年5月的事件。這三起突破都出自第三方 AI 安全評估機構 Irregular 操刀的一場奪旗演練。據 Axios 還原,測試裡 Gemini 被要求從一個虛構公司抓取信息,而這個虛構公司的名字,恰好和一家真實公司撞了車。

我國首款藏語多語言全模態 AI 輸入法發佈:覆蓋手機電腦,支持三大方言語音輸入
該輸入法由藏語智能全國重點實驗室研發,依託實驗室自主知識產權的大模型及相關 AI 基礎設施,覆蓋手機、電腦等全終端,支持文字、語音、圖像等多模態輸入,並可通過統一賬號同步詞庫和輸入習慣。三地方言語音、藏漢英混合 OCR青海師範大學教授、藏語智能全國重點實驗室常務副主任多拉表示,智達 AI 輸入法以智達大模型作為核心技術底座開發而成。

TypeSafe AI 推出決策專用模型 Jev:比大語言模型快 10 倍、成本僅十分之一
與傳統大語言模型不同,Jev 專門用於回答是 / 否問題以及多項選擇題,並給出置信度評分。公司稱,軟件開發過程中大量工作本質是一系列決策,而 Jev 在這類任務上比大語言模型快10倍、成本僅為其十分之一。據 TypeSafe AI 介紹,Jev 不生成文本,而是直接輸出結構化決策結果,供程序直接使用。