何夕2077生成式AI

強智能體反讓系統失守

2026年7月31日 00:00

重點摘要

研究人員發現一個違反直覺的現象:多智慧體系統中的審計員愈強大,系統整體安全性反而可能愈脆弱。這項發表在 arXiv 的最新研究《The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure》,首次系統性揭露了大型語言模型(LLM)多智慧體架構下「能力悖論」的存在,引起人工智慧安全領域高度關注。 多智慧體系統被視為大型語言模型的重要延伸方向,透過將複雜任務拆解給不同專業的智慧體分工處理,藉以提升效率與準確度。

站內 AI 整理稿

研究人員發現一個違反直覺的現象:多智慧體系統中的審計員愈強大,系統整體安全性反而可能愈脆弱。這項發表在 arXiv 的最新研究《The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure》,首次系統性揭露了大型語言模型(LLM)多智慧體架構下「能力悖論」的存在,引起人工智慧安全領域高度關注。多智慧體系統被視為大型語言模型的重要延伸方向,透過將複雜任務拆解給不同專業的智慧體分工處理,藉以提升效率與準確度。然而,這種分散式決策過程同時也創造了新型攻擊面。

來自研究團隊的 Qiqi Liu、Runhan Song 與 Shilin Ye 等人,在一系列大規模實驗中發現,攻擊者不需要依賴傳統的語法注入手法,只要將有害請求藏進特定領域的敘事脈絡中,就能透過 Worker 的報告層層傳遞,最終誤導 Manager 執行惡意指令。研究團隊將這種攻擊模式命名為「語義劫持」(semantic hijacking)。為了驗證這個威脅的嚴重程度,研究團隊設計了涵蓋 12 種 Manager 模型與 7 種 Worker 配置的實驗矩陣,總共進行了 42,000 次對抗性測試。

結果顯示,當 Worker 的能力逐步提升時,系統層級的攻擊成功率(Attack Success Rate, ASR)竟然從 18.4% 一路攀升至 63.9%,某些配置下甚至達到 94.4% 的驚人數字。換句話說,團隊投入愈多運算資源去強化子智慧體的能力,系統整體反而愈容易被攻破。這個反常現象背後的原因是什麼?研究團隊進一步針對兩個獨立資料集、總計 47,807 次互動進行多層中介分析,終於找到關鍵機制:「語言確定性」(linguistic certainty)。

分析指出,能力較強的 Worker 在處理對抗性敘事時,更容易將這些本應可疑的內容詮釋為合理指令,並且在回報給 Manager 時,傾向以更加肯定、自信的語氣陳述結論。Manager 在接收到這種斬釘截鐵的背書後,往往直接將其視為執行的正當依據,因而跳過了更深入的風險查核。中介分析的數據進一步支持了這個解釋。

在規模較大的 Worker-Only 實驗設定中,共使用了 14 種 Worker 模型,結果顯示語言確定性解釋了其中 74% 的攻擊效果;無論採用 Monte Carlo 還是叢集拔靴法(cluster bootstrap),95% 信賴區間皆不包含零,代表這個中介效應在統計上具有顯著性。而在 Full-MAS 完整系統設定中,雖然僅有 6 種 Worker 配置,間接效應的方向也呈現一致趨勢,與理論預期相符。值得注意的是,研究團隊也測試了目前常見的防禦手段,結果顯示在 Worker 端加入安全提示(safety prompting)並無法可靠地緩解這類漏洞。

這意味著單純要求子智慧體「保持警覺」或「拒絕可疑請求」的做法,在多智慧體架構的複雜資訊流中效果相當有限,攻擊者仍然可以利用語言確定性的機制繞過防線。既然提升單一 Worker 的能力會讓情況惡化,那該如何防禦?研究團隊根據中介分析的發現,提出了一種名為「異質集成驗證」(heterogeneous ensemble verification)的新方法。核心概念是刻意配對具備不對稱領域能力的 Worker,讓它們各自擁有互補性的盲點,藉此打破「確定性—執行」的連鎖反應。實驗結果顯示,這套方法能將攻擊成功率從 52.8% 大幅降至 2.0%,同時對正常任務的影響微乎其微。這項研究的啟示相當深遠。

當前業界普遍追求將系統中的每個元件都升級到更強大的模型,認為這樣就能帶來更高的安全性;但這份研究清楚指出,在某些架構下,升級元件反而可能系統性地削弱整體安全防禦。真正的防護關鍵,或許不在於消除智慧體之間的能力差異,而在於善用並設計這些不對稱性,讓任何單一子系統都無法僅靠自信的語氣就主導最終決策。論文作者也提醒,這項發現對多智慧體系統的設計原則提出了重新思考的必要性。在追求智慧體效能的同時,如何確保分散式決策過程中的制衡機制不被破壞,將成為下一階段人工智慧安全研究的重要課題。這份研究目前已發表於 arXiv 平台,並獲得 DOI 正式編號,可供學術界進一步引用與討論。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前