模型真能穿透真實目標
Anthropic 近期公布一項測試結果,其開發的 AI 模型在實戰演練中成功滲透並攻破三家不同組織,引發資安領域廣泛討論。與過往多數測試僅在模擬環境中進行不同,這些模型被賦予真實的滲透任務,實際執行完整的攻擊鏈,從資訊收集到最終突破防線,展現出當前 AI 系統在真實場景中的攻擊能力已超出業界預期。這項測試由 Anthropic 的紅隊主導,目的在於評估先進 AI 模型在不受模擬限制下的實際威脅程度。結果顯示,模型不僅能自主完成偵察、漏洞掃描、權限提升等環節,還能針對目標組織的網路架構與安全措施進行動態調整,最終成功取得內部系統的存取權限。
三家被攻破的組織涵蓋不同領域,但由於測試涉及敏感資訊,Anthropic 未公開具體名稱與產業類別。過去業界對 AI 模型攻擊能力的評估,大多依賴於封閉的模擬環境或經過妥善控制的虛擬對手。這類測試雖然能提供基本的安全指標,但往往忽略現實環境中的變數,例如網路延遲、人為應對、防禦系統的即時更新,以及真實資料的價值所引發的攻擊動機。Anthropic 此次測試直接將模型投入真實企業的資訊環境,讓模型自行探索並做出攻擊決策,結果證實 AI 在真實世界中的破壞力遠超過實驗室內的估算。參與測試的紅隊人員指出,這類模型的實戰表現讓現有的 AI 紅隊測試邊界與授權範圍都必須重新審視。
傳統紅隊測試通常會在事前限定攻擊目標、時間範圍與可用工具,避免超出風險承受度。然而,當模型具備自主學習與決策能力時,一旦被賦予過大的自由度,就可能觸發不可預期的行為,甚至自行串聯多種攻擊手法,突破原本被認為安全的防線。若繼續沿用傳統的評估框架,恐怕無法有效衡量與控管這類系統所帶來的風險。這項結果引發資安領域的廣泛討論,各界開始關注如何針對具備自主攻擊能力的 AI 模型建立更具現實意義的測試標準與監管機制。部分專家認為,現有的 AI 安全測試過度集中在模型本身的偏見或對齊問題,卻忽略了當模型被用於攻擊用途時所可能造成的實質損害。
Anthropic 的測試正好填補了這塊缺口,但也同時暴露出監管框架尚未跟上技術發展的事實。在美國,聯邦貿易委員會與國土安全部等單位已開始研擬針對 AI 工具的資安規範,但多數草案仍停留在要求開發者進行內部風險評估,缺乏對「實際攻擊演練」的強制性要求。Anthropic 的案例表明,若缺乏真實環境的壓力測試,開發者可能無法掌握模型在未受控情境下的行為模式,進而低估其潛在危害。另一方面,這項測試也重新點燃了關於 AI 自主權限的辯論。究竟應該讓模型在訓練階段就接受嚴格的指令限制,還是在部署後才能透過隔離環境逐步釋放能力?
Anthropic 選擇的是後者,讓模型在測試中自由發揮,但同時設有緊急停止機制與監控團隊,確保一旦出現失控跡象就能立即中斷。即便如此,紅隊成員仍表示,模型在部分環節的反應速度與策略選擇讓他們感到意外,顯示現有的安全措施仍有強化空間。部分業者認為,這類測試結果不應被過度解讀為 AI 即將取代人類駭客的警訊。實際上,目前最強大的 AI 模型依然需要人類提供初始的目標資訊與工具鏈,無法完全自主發起攻擊。然而,隨著多模態模型與強化學習技術的進步,AI 在滲透測試中的效率與創意正在快速提升,未來可能只需要少量的人類指引就能完成複雜的攻擊任務。
對於企業與政府機關而言,Anthropic 的測試具有兩層意義。首先是防禦面:傳統的入侵偵測系統與弱點掃描工具可能無法有效對抗基於 AI 的攻擊,因為 AI 能快速調整行為模式、偽裝流量特徵,甚至學習目標的應對模式。其次是合規面:當監管機構開始要求企業定期進行第三方紅隊測試時,AI 模型的參與將成為必要項目,而非選項。目前資安社群正在呼籲制定一套適用於 AI 滲透測試的「真實環境授權規範」,明確界定測試範圍、資料保護要求與應急通報機制。Anthropic 也承諾將在未來公布更多測試細節,幫助業界建立更完善的評估方法論。
這項測試不僅是一場技術演示,更為整個 AI 治理體系敲響警鐘:如果我們無法為 AI 的攻擊能力設立可信的測試標準,那麼無論模型的對齊研究多麼進步,實際的安全風險都將難以掌握。
Related
相關文章

“你以為買的是 DeepSeek Flash,到手可能是 1.5 bit 縮水版”:Pi 核心貢獻者談 AI Token 黑箱
AI訂閱服務存在「黑箱化」問題,使用者可能收到與宣傳不符的縮水版模型,例如號稱DeepSeek Flash卻實際為1.5 bit量化版本。文中揭露量化摻假、緩存鎖死、加密綁定等手法,讓訂閱內容失去透明性。

韓國通過《個人信息保護法》修正案,允許 AI 開發使用個人數據
作者:潞源 責編:潞源 評論: 8 月 24 日消息,據韓媒 The Elec 今天報道,韓國個人信息保護委員會(PIPC)近日表示,國會已全體通過《個人信息保護法》修正案。《個人信息保護法》修訂後,允許人工智能開發商在經過韓國個人信息保護委員會審查後,使用限定範圍內的個人數據。

OpenAI CEO 奧爾特曼:擔心人工智能會被少數強勢主體掌控
OpenAI CEO 奧爾特曼在播客中表示,擔憂 AI 被少數公司或個人控制,也擔心 AI 掙脫人類控制。他認為,對後者的恐懼可能導致前者發生,Anthropic 的 Mythos 模型就是例證。#AI未來#

OpenAI 回應 Codex 使用限制:sub2api 轉售共享會觸發風控
作者:潞源 責編:潞源 評論: 感謝網友 Domado、咩咩洋 的線索投遞!8 月 21 日消息,OpenAI Codex&ChatGPT 團隊負責人蒂博 · 索蒂奧(Thibault Sottiaux)今天在 X 平臺發文稱,官方已經注意到關於 Codex 使用限額出現差異的反饋,並已經進行調查。