何夕2077AI Agent

多智能體規劃階段易受攻擊

2026年7月22日 00:00

重點摘要

多智能體規劃階段易受攻擊。 專家發現多智能體系統存在嚴重缺陷 ⚠️。詳情點擊規劃階段安全防護論文查看。提示詞注入 會級聯改寫下游所有任務。該發現突出了建立安全防線的重要性。

站內 AI 整理稿

# 多智能體規劃階段易受攻擊 專家警告提示詞注入可引發級聯災難

隨著人工智能技術的不斷演進,多智能體系統(Multi-Agent System, MAS)正逐步從實驗室走向工業級應用,涵蓋自動駕駛協調、金融交易決策、供應鏈管理以及複雜科學模擬等關鍵領域。然而,這一協作模式的廣泛部署也帶來了前所未有的安全挑戰。近日,安全研究人員何夕2077發布的最新分析指出,當前多智能體系統在規劃階段存在顯著漏洞,攻擊者可利用提示詞(Prompt)注入的手法,從源頭污染初始指令,導致惡意意圖在多個智能體之間級聯傳播,最終徹底改寫下游所有任務的執行邏輯。這一發現迅速引發學術界與產業界的高度關注。

多智能體系統的核心優勢在於透過多個具備一定自主性的智能體相互協調,共同完成單一智能體難以處理的複雜任務。在典型架構中,系統通常包含一個規劃模塊,負責將高層目標拆解為一系列子任務,並分配給不同的執行智能體。然而,正是這一規劃階段被研究人員點名為當前安全防護中最為薄弱的環節。何夕2077在報告中指出,多數系統將大量信任前置在初始輸入與規劃指令上,缺乏對指令內容的嚴格驗證與隔離機制,使得攻擊者有機可乘。所謂提示詞注入攻擊,原本是大語言模型(LLM)應用中常見的安全威脅,攻擊者透過精心設計的輸入,繞過模型的安全對齊,誘使其執行非預期指令。

在單一智能體場景中,這種攻擊已導致模型輸出惡意代碼、洩露敏感資訊或繞過內容審核。而當攻擊場景延伸到多智能體協作架構時,風險發生了指數級放大。何夕2077強調,只要攻擊者能夠成功污染系統規劃階段的初始提示詞,受感染的意圖就會像病毒一樣在智能體之間自動複製與傳播,每一層的執行結果都會偏離原有目標,形成連鎖反應。具體而言,攻擊過程可分為三個階段。第一階段是注入點突破,攻擊者可能通過外部輸入接口(如用戶查詢、系統日誌、第三方API回傳內容)植入隱蔽的對抗性指令。

第二階段是規劃層污染,這些惡意指令被主規劃器解讀並納入任務分解圖中,使得後續子任務的目標從「完成交易」被篡改為「將資金轉至攻擊者帳戶」或「從數據庫中提取用戶隱私」。第三階段則是級聯執行,下游智能體在接收經過污染的任務描述後,完全無從辨識指令已被改寫,只會忠實執行,並將進一步污染的結果傳遞給更下游的智能體,直至整個系統的輸出被徹底扭轉。

研究人員以一個自動化供應鏈管理系統為例進行說明:若攻擊者在貨物需求的初始描述中注入「將所有訂單優先發送至指定地址」的隱蔽指令,規劃層會將其當作正當業務邏輯分解,採購智能體、庫存智能體與物流智能體將協同將資源集中導向惡意目標,而系統原有的異常檢測機制由於監控的是常規執行指標,往往難以察覺目標已被替換。這種攻擊的隱蔽性極強,可能在系統上線後長期潛伏,直到造成實際損失才被發現。何夕2077的發現為多智能體協作的安全性敲響了警鐘。長期以來,業界注意力多集中在單智能體的對抗魯棒性,或是智能體間的通信加密與身份認證,較少關注規劃層這一「上游樞紐」的防護。

事實上,規劃階段是整個決策鏈路的邏輯起點,一旦被攻破,後續所有的安全機制(如輸出過濾、行為審計、內容限制)都可能淪為擺設,因為這些機制的輸入本身已被污染。專家指出,這並非單純的技術漏洞,而是架構設計層面的系統性缺陷,需要從根本的安全範式進行反思。研究團隊強調,防護必須從規劃層面提前建立。首要措施是對輸入與中間指令實行嚴格的校驗與隔離,類似於軟體開發中的最小權限原則與沙箱機制。規劃器不應盲目信任任何來源的指令,而需對每個輸入進行語義與意圖的安全性檢查,區分「用戶數據」與「控制指令」;同時,子任務的分解過程應引入冗餘校驗,由多個獨立的審計智能體交叉驗證規劃結果是否與原始目標一致。

此外,在智能體間的通信協議中嵌入可追溯的意圖標籤,讓下游智能體能夠識別當前任務的來源與變更歷史,從而在發現異常時自動熔斷。雖然這些防護手段在理論上可行,但在實際部署中仍面臨頗多挑戰。例如,校驗過程本身可能引入新的計算開銷與延遲,對於高即時性要求的系統(如自動駕駛車隊協同)而言難以承受;交叉驗證機制則需要額外的智能體參與,增加了系統的複雜性與潛在攻擊面。何夕2077認為,安全與效率的平衡將是未來研究的重點,但無論如何,將安全考量後置的作法已經行不通,「規劃層的安全設計必須在系統架構定稿之前就納入考量,而不是等到攻擊發生後再打補丁。」

此次披露也引發了行業監管層的關注。有分析認為,隨著各國陸續出台人工智能治理法規,多智能體系統的規劃層安全或將被納入強制性標準。若企業在部署此類系統時未在規劃階段設置有效的隔離與校驗機制,一旦因級聯攻擊導致重大損失,可能面臨嚴重的法律責任與監管處罰。對於正在積極探索多智能體落地的金融、醫療與關鍵基礎設施領域而言,這無疑是一次重要的風險提示。目前,已有多個開源多智能體框架的維護團隊回應稱將優先修復規劃層的驗證漏洞,並發布安全更新。部分大型科技公司的內部研究部門也開始針對提示詞級聯傳播的檢測與防禦展開立項研究。

然而,何夕2077提醒,安全防線的建設是一場持續的攻防對抗,攻擊者會不斷尋找新的注入點與繞過方式,業界需要建立常態化的威脅情報共享機制,共同應對這一新興安全威脅。總體而言,多智能體系統正處於從技術驗證邁向規模化應用的關鍵時期,而規劃階段的安全漏洞無疑是其路上面臨的第一道重大考驗。研究團隊最後強調,若不能在規劃層建立有效的防護機制,單點攻破將迅速演變為系統性災難。唯有將安全作為系統設計的一等公民,從源頭進行嚴格校驗與隔離,才能真正發揮多智能體協作的潛力,確保各類關鍵任務在安全可信的環境中穩定運行。這也是未來多智能體落地應用不可規避的前提條件。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
鈦媒體AI Agent

騰訊是在“賽馬”,還是在打造 “Agent工廠”?

騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。

36 分鐘前
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

2 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

7 小時前