智能體內核層級安全網關
重點摘要
隨著AI代理(AI agent)逐漸普及,它們透過模型上下文協定(Model Context Protocol,簡稱MCP)呼叫外部工具——包括檔案系統、網路與API——已成為標準運作模式。然而,這項看似平常的設計卻隱藏著嚴重安全隱憂:當代理的工具呼叫等同於作業系統的系統呼叫(syscall)時,當前絕大多數的安全檢查機制卻仍停留在使用者空間(userspace)層級,意味著只需十行腳本就能輕鬆繞過防護。
隨著AI代理(AI agent)逐漸普及,它們透過模型上下文協定(Model Context Protocol,簡稱MCP)呼叫外部工具——包括檔案系統、網路與API——已成為標準運作模式。然而,這項看似平常的設計卻隱藏著嚴重安全隱憂:當代理的工具呼叫等同於作業系統的系統呼叫(syscall)時,當前絕大多數的安全檢查機制卻仍停留在使用者空間(userspace)層級,意味著只需十行腳本就能輕鬆繞過防護。為了解決這個結構性漏洞,研究人員Daeyeon Son提出了一項名為「Governed MCP」的核心層級工具治理閘道,試圖將工具呼叫安全從應用層提升為作業系統原生支援的能力。
這項研究的核心在於一套基於logit的安全原語(primitive)——ProbeLogits。Governed MCP將此原語嵌入作業系統核心,使其能夠在每次MCP工具呼叫時進行攔截與調度。
整個流程透過六層管線完成:首先是架構驗證(schema validation),確認工具呼叫格式正確;接著依序經過信任層級(trust tier)、速率限制(rate limit)、對抗性預過濾(adversarial pre-filter),再由ProbeLogits語義閘門(semantic gate)進行最關鍵的安全判斷,最後經憲法策略比對(constitutional policy match)並串接Blake3哈希審計鏈(audit chain)以供後續稽核。作者在自行開發的Anima OS中實現了這套架構。
Anima OS是一個以Rust語言撰寫、約28萬6千行程式碼的裸機x86-64作業系統,Governed MCP直接嵌入其核心。根據效能量測,五道非推理層加上審計附加(audit append)的總成本僅11.3微秒(µs)每次呼叫,而ProbeLogits閘門——包含一次探測提示預填充(probe-prompt prefill)與一次logit讀取——在Qwen2.5-7B、Llama-3-8B與Mistral-7B三種模型上,每次分類分別耗時332至556毫秒。相較於在同一硬體上執行的Llama Guard 3,Governed MCP的速度快了2.4到3.4倍。
為了驗證ProbeLogits層的必要性,研究進行了消融實驗(ablation study)。結果顯示,移除ProbeLogits語義閘門後,F1分數從0.789大幅滑落至0.357,降幅達0.432。這項數據明確指出,若僅仰賴手動規則構成的防火牆,完全無法達到足夠的防護效果;ProbeLogits所帶來的語義理解能力正是Governed MCP安全效能的關鍵支柱。從安全性角度來看,Governed MCP的最大突破在於改變了安全強制執行的立足點。
由於所有經由WASM至系統宿主函數(system host function)的呼叫,以及每個註冊的MCP工具,都必須通過核心閘道的仲裁,過去那種只需十行腳本就能繞過使用者空間防護的手法在架構上已不可能實現。不過,作者也坦誠指出,目前仍有一組未封閉的ring-3系統呼叫路徑未被納入閘道控管,這部分有待未來補強。除了效能與安全架構,Governed MCP也展現了良好的跨架構通用性。研究團隊在HarmBench上達到98%至99%的非版權封鎖率(non-copyright block),在XSTest上取得98.
5%至100%的不安全召回率(unsafe recall),而ToxicChat的表現則與Llama Guard 3持平。上述結果證明了ProbeLogits底層原語不依賴特定模型架構,無論是Qwen、Llama還是Mistral系列,都能維持一致的安全效能。整體而言,這項研究傳遞了一個關鍵訊息:AI代理的工具呼叫治理,不應僅被視為應用程式的責任,而應該提升為作業系統的原生功能。透過將安全檢查下沉至核心層級,Governed MCP不僅讓繞過變得不可能,也為未來AI安全基礎設施的設計提供了全新路徑。該論文目前已於arXiv上公開,版本更新至2026年7月6日,引發學術界與開源社群關注。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。