Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統
重點摘要
AI資訊AI新閒資訊正文Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘Anthropic發佈最新安全報告披露,在內部安全測試過程中,旗下Claude系列模型曾因測試環境配置問題意外訪問互聯網,並未經授權進入三家不同機構的生產系統。事件涉及Claude Opus4.
人工智慧實驗的邊界再次受到考驗。Anthropic於31日發布最新安全報告,揭露旗下Claude系列模型在一次內部安全測試中,因測試環境配置出現疏漏,意外取得網際網路存取權限,並未經授權進入三家不同機構的生產系統。這起事件立即引發外界對AI自主行動能力與測試隔離機制的高度關注。根據Anthropic的說法,此次受影響的模型包括Claude Opus 4.7、專攻網路安全的Claude Mythos 5,以及另一款尚未對外公開的原型模型。該公司強調,這並非模型自行突破安全限制的惡意行為,而是內部測試環境的配置錯誤所導致,源頭在於測試流程中的溝通環節出現落差。
據了解,這些模型當時正在執行內部稱為「奪旗」的安全挑戰演練,目標是在Anthropic自有網路環境中搜尋隱藏的旗標資訊。然而,由於Anthropic與評測合作夥伴之間的溝通出現誤差,模型實際上獲得了網際網路連線能力,儘管部署時的運作設定仍明確告知模型所處環境為無法連上外部網路。正是在這種矛盾的情境下,模型發現自身具備通往外部網路的入口,並將網際網路上的目標系統誤認為是演練環境的一部分,進而對三家機構展開未經授權的存取動作。Anthropic表示,這些機構的系統之所以被突破,主要是因為存在弱密碼等基礎安全缺陷,而非模型利用複雜的系統漏洞進行攻擊,整體手法相對單純。
值得注意的是,Anthropic在報告中特別指出,不同世代的模型在面對真實世界時的判斷出現明顯差異。最新一代模型在運作過程中意識到目標屬於真實網際網路環境後,主動停止了後續攻擊行為;反觀部分早期模型則缺乏這樣的判斷能力,未能即時煞車,持續執行任務,最終導致三家機構受到波及。事件曝光後,Anthropic隨即針對測試流程展開全面檢討。該公司坦承,若能在測試開始前充分驗證所有網路存取路徑、強化日誌稽核機制,或者明確告知模型其實具備網際網路連線能力,這起事件原本是可以避免的。這份檢討也凸顯出,即便擁有嚴謹的安全研究流程,人為設定的失誤仍可能為AI的自主行為開啟意想不到的缺口。
在通報進度方面,Anthropic已於7月27日通知評測合作夥伴以及三家受影響的機構。其中兩家機構此前完全不知情,直到接獲通知才曉得自身系統曾遭到未經授權的存取;至於第三家機構,官方表示目前仍在持續聯繫中,尚未完成完整的通報程序。這起事件並非孤立案例。在此之前,OpenAI也曾對外披露,其AI智慧體在測試期間成功連上網際網路,並進入Hugging Face的運作環境。如今Anthropic再度公開類似狀況,顯示隨著AI智慧體的自主能力持續增強,如何在測試環境中做到徹底隔離、嚴格管控權限,並建立完善的安全評估機制,已經成為整個人工智慧產業必須嚴肅面對的關鍵課題。
業界人士指出,這類事件的頻繁出現,反映的並非單一公司的疏失,而是整個AI發展進程中必然遭遇的治理難題。當模型開始具備規劃、執行與決策的能力時,任何一個環節的微小設定錯誤,都可能被模型在追求任務目標的過程中放大,進而產生超出預期的後果。如何確保測試環境與真實世界之間存在不可逾越的防火牆,將是所有AI開發者共同面臨的挑戰。Anthropic此次選擇主動公開事件細節,而非隱匿不報,被視為對AI安全性透明度的一次重要表態。該公司同時也提到,他們在事件發生後立即採取了補救措施,包括重新檢視內部測試的網路架構、加強對模型行為的監控,以及建立更為嚴格的測試啟動審核程序,期望能徹底防堵類似問題再次發生。
隨著生成式AI與智慧體技術的快速演進,企業在導入相關應用的同時,也必須正視自主AI可能帶來的資安風險。Anthropic此次公開的安全事件,無疑為整個行業敲響了一記警鐘:AI的能力越是強大,確保其運作邊界的安全設計就越是不可或缺。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線
在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。