何夕2077AI Agent

多智能體規劃階段易受攻擊

2026年7月22日 00:00

重點摘要

多智能體規劃階段易受攻擊。 專家發現多智能體系統存在嚴重缺陷 ⚠️。詳情點擊規劃階段安全防護論文查看。提示詞注入 會級聯改寫下游所有任務。該發現突出了建立安全防線的重要性。

站內 AI 整理稿

# 多智能體規劃階段易受攻擊 專家警告提示詞注入可引發級聯災難

隨著人工智能技術的不斷演進,多智能體系統(Multi-Agent System, MAS)正逐步從實驗室走向工業級應用,涵蓋自動駕駛協調、金融交易決策、供應鏈管理以及複雜科學模擬等關鍵領域。然而,這一協作模式的廣泛部署也帶來了前所未有的安全挑戰。近日,安全研究人員何夕2077發布的最新分析指出,當前多智能體系統在規劃階段存在顯著漏洞,攻擊者可利用提示詞(Prompt)注入的手法,從源頭污染初始指令,導致惡意意圖在多個智能體之間級聯傳播,最終徹底改寫下游所有任務的執行邏輯。這一發現迅速引發學術界與產業界的高度關注。 多智能體系統的核心優勢在於透過多個具備一定自主性的智能體相互協調,共同完成單一智能體難以處理的複雜任務。在典型架構中,系統通常包含一個規劃模塊,負責將高層目標拆解為一系列子任務,並分配給不同的執行智能體。然而,正是這一規劃階段被研究人員點名為當前安全防護中最為薄弱的環節。何夕2077在報告中指出,多數系統將大量信任前置在初始輸入與規劃指令上,缺乏對指令內容的嚴格驗證與隔離機制,使得攻擊者有機可乘。 所謂提示詞注入攻擊,原本是大語言模型(LLM)應用中常見的安全威脅,攻擊者透過精心設計的輸入,繞過模型的安全對齊,誘使其執行非預期指令。在單一智能體場景中,這種攻擊已導致模型輸出惡意代碼、洩露敏感資訊或繞過內容審核。而當攻擊場景延伸到多智能體協作架構時,風險發生了指數級放大。何夕2077強調,只要攻擊者能夠成功污染系統規劃階段的初始提示詞,受感染的意圖就會像病毒一樣在智能體之間自動複製與傳播,每一層的執行結果都會偏離原有目標,形成連鎖反應。 具體而言,攻擊過程可分為三個階段。第一階段是注入點突破,攻擊者可能通過外部輸入接口(如用戶查詢、系統日誌、第三方API回傳內容)植入隱蔽的對抗性指令。第二階段是規劃層污染,這些惡意指令被主規劃器解讀並納入任務分解圖中,使得後續子任務的目標從「完成交易」被篡改為「將資金轉至攻擊者帳戶」或「從數據庫中提取用戶隱私」。第三階段則是級聯執行,下游智能體在接收經過污染的任務描述後,完全無從辨識指令已被改寫,只會忠實執行,並將進一步污染的結果傳遞給更下游的智能體,直至整個系統的輸出被徹底扭轉。 研究人員以一個自動化供應鏈管理系統為例進行說明:若攻擊者在貨物需求的初始描述中注入「將所有訂單優先發送至指定地址」的隱蔽指令,規劃層會將其當作正當業務邏輯分解,採購智能體、庫存智能體與物流智能體將協同將資源集中導向惡意目標,而系統原有的異常檢測機制由於監控的是常規執行指標,往往難以察覺目標已被替換。這種攻擊的隱蔽性極強,可能在系統上線後長期潛伏,直到造成實際損失才被發現。 何夕2077的發現為多智能體協作的安全性敲響了警鐘。長期以來,業界注意力多集中在單智能體的對抗魯棒性,或是智能體間的通信加密與身份認證,較少關注規劃層這一「上游樞紐」的防護。事實上,規劃階段是整個決策鏈路的邏輯起點,一旦被攻破,後續所有的安全機制(如輸出過濾、行為審計、內容限制)都可能淪為擺設,因為這些機制的輸入本身已被污染。專家指出,這並非單純的技術漏洞,而是架構設計層面的系統性缺陷,需要從根本的安全範式進行反思。 研究團隊強調,防護必須從規劃層面提前建立。首要措施是對輸入與中間指令實行嚴格的校驗與隔離,類似於軟體開發中的最小權限原則與沙箱機制。規劃器不應盲目信任任何來源的指令,而需對每個輸入進行語義與意圖的安全性檢查,區分「用戶數據」與「控制指令」;同時,子任務的分解過程應引入冗餘校驗,由多個獨立的審計智能體交叉驗證規劃結果是否與原始目標一致。此外,在智能體間的通信協議中嵌入可追溯的意圖標籤,讓下游智能體能夠識別當前任務的來源與變更歷史,從而在發現異常時自動熔斷。 雖然這些防護手段在理論上可行,但在實際部署中仍面臨頗多挑戰。例如,校驗過程本身可能引入新的計算開銷與延遲,對於高即時性要求的系統(如自動駕駛車隊協同)而言難以承受;交叉驗證機制則需要額外的智能體參與,增加了系統的複雜性與潛在攻擊面。何夕2077認為,安全與效率的平衡將是未來研究的重點,但無論如何,將安全考量後置的作法已經行不通,「規劃層的安全設計必須在系統架構定稿之前就納入考量,而不是等到攻擊發生後再打補丁。」

此次披露也引發了行業監管層的關注。有分析認為,隨著各國陸續出台人工智能治理法規,多智能體系統的規劃層安全或將被納入強制性標準。若企業在部署此類系統時未在規劃階段設置有效的隔離與校驗機制,一旦因級聯攻擊導致重大損失,可能面臨嚴重的法律責任與監管處罰。對於正在積極探索多智能體落地的金融、醫療與關鍵基礎設施領域而言,這無疑是一次重要的風險提示。 目前,已有多個開源多智能體框架的維護團隊回應稱將優先修復規劃層的驗證漏洞,並發布安全更新。部分大型科技公司的內部研究部門也開始針對提示詞級聯傳播的檢測與防禦展開立項研究。然而,何夕2077提醒,安全防線的建設是一場持續的攻防對抗,攻擊者會不斷尋找新的注入點與繞過方式,業界需要建立常態化的威脅情報共享機制,共同應對這一新興安全威脅。 總體而言,多智能體系統正處於從技術驗證邁向規模化應用的關鍵時期,而規劃階段的安全漏洞無疑是其路上面臨的第一道重大考驗。研究團隊最後強調,若不能在規劃層建立有效的防護機制,單點攻破將迅速演變為系統性災難。唯有將安全作為系統設計的一等公民,從源頭進行嚴格校驗與隔離,才能真正發揮多智能體協作的潛力,確保各類關鍵任務在安全可信的環境中穩定運行。這也是未來多智能體落地應用不可規避的前提條件。

Related

相關文章

AI PC過時了,AC一夜爆發,Agent真的需要專屬電腦?

AMD提出Agent Computer(AC)概念,專為AI Agent長期運行設計,主打始終在線、始終可用。多家廠商在WAIC展示相關產品,但AC對普通用戶需求有限,更適合開發者與內容團隊。AC與PC將共存,不會全面取代傳統個人電腦。

剛剛

我在WAIC 2026看見的十大趨勢

WAIC 2026 展現出 AI 從展示轉向實用,智能體(Agent)成為主流,能完成具體任務才是關鍵。基座模型競爭進入半決賽,各家策略明顯分化;世界模型與具身智能成為新焦點,機器人開始在真實場景中實際工作。

剛剛
量子位AI Agent

我在WAIC 2026看見的十大趨勢

# 我在WAIC 2026看見的十大趨勢 今年上海世界人工智能大會(WAIC)2026的現場,人潮之洶湧超乎想像。高溫與雷暴都擋不住參觀者的腳步,黃牛票被炒上天卻依然一票難求,每個展館和論壇都擠得水洩不通,但沒有人因此熱情減退。如果你也親臨現場,大概會有同樣的感受——這不僅是一場技術展會,更像是中國AI產業的年度世界盃。我們深入展館與論壇,梳理出今年最核心的十大趨勢,幫助未能到場的讀者快速掌握這場盛會的全貌。 今年的WAIC最大的變化,在於它已經從單純的技術陳列場,轉變為中國AI產業的年度排片表。

剛剛

狙擊AMD AI大會?英偉達搶先披露Vera CPU新細節

英偉達在AMD AI大會前夕搶先揭露新一代Vera CPU細節,意圖轉移市場焦點。Vera CPU專為智能體AI設計,強調低延遲與高效能,以補強英偉達在CPU領域的生態佈局。此舉顯示AI競爭從GPU擴展至系統級處理器之爭。

剛剛
量子位AI Agent

酷哇科技亮相WAIC 2026,解密行業首個雙層智能體世界模型

2026 世界人工智能大會(WAIC 2026)於 7 月 17 日在上海世博展覽館揭開序幕,專注城市場景的酷哇科技(COOWA)在上海國投展區帶來一系列亮點。展台上,由酷哇全棧自研的 COOWAM 雙層智能體世界模型驅動的機械臂,流暢地完成了一套「夏日特調」飲品製作,從切西瓜、榨汁、擰瓶蓋到加入檸檬片與蘇打水,全程自主執行,展現出長程複雜操作的實力。同時,酷哇也為旗下首款重載型四足機器狗 X0 舉行線下首秀,吸引現場眾多目光。

剛剛