何夕2077模型更新

安全授權網關正式發佈

2026年7月9日 00:00

重點摘要

安全授權網關正式發佈 AI 代理(AI Agent)在執行工具呼叫時,往往依賴於無法自行驗證的文字內容,這使得任何能控制部分上下文的一方都有可能偽造授權外觀,進而誘導代理執行非預期動作。隨著 AI 代理在金融、客服、自動化流程等領域的應用日趨普及,這一安全隱憂也備受關注。近期一項研究針對此問題提出了名為 aiAuthZ 的安全授權閘道,透過將安全決策移出代理主機,並引入身份綁定與不可竄改的審計機制,成功將殘留攻擊成功率降至零,為 AI 代理的安全防護提供了一套新方案。

站內 AI 整理稿

安全授權網關正式發佈

AI 代理(AI Agent)在執行工具呼叫時,往往依賴於無法自行驗證的文字內容,這使得任何能控制部分上下文的一方都有可能偽造授權外觀,進而誘導代理執行非預期動作。隨著 AI 代理在金融、客服、自動化流程等領域的應用日趨普及,這一安全隱憂也備受關注。近期一項研究針對此問題提出了名為 aiAuthZ 的安全授權閘道,透過將安全決策移出代理主機,並引入身份綁定與不可竄改的審計機制,成功將殘留攻擊成功率降至零,為 AI 代理的安全防護提供了一套新方案。研究人員在論文中指出,當前的語言模型在面對以真實代理事故為基礎所設計的八類攻擊場景時,防禦表現差異極大。

他們總共評估了 15 個當代語言模型,發現模型對攻擊的拒絕率從 100% 到 38% 不等,而即使是最昂貴的模型,在面對大量攻擊時也僅拒絕了一半,儘管其價格是其他模型的二十倍以上。這顯示出單純依賴模型本身的能力難以全面抵禦此類偽造授權的威脅。為了解決這個根本問題,研究團隊開發了 aiAuthZ 授權閘道。其核心概念是將安全決策從代理的主機環境中抽離,不容許代理自行判斷工具呼叫的合法性。在每一次工具呼叫執行之前,閘道會先驗證呼叫者的身份,採用的是每則訊息附加 HMAC-SHA256 簽名,並綁定一次性使用的 nonce 與時間戳視窗,確保請求的真實性與時效性。

閘道內建基於角色與參數層級的策略,這些策略代理完全無法讀取或修改,因此攻擊者即使控制了代理的輸入輸出,也無法繞過閘道的審查。aiAuthZ 的每個授權決策都會被記錄在採用 SHA-256 雜湊鏈結的審計日誌中,形成無法竄改的證據鏈。對於每一筆被接受的訊息,閘道會產生一個以 HMAC 認證的 QR 收據,該收據在八種不同的傳輸通道上平均可達到 94% 的驗證成功率,且在 25 次使用錯誤金鑰的偽造嘗試中,沒有任何偽造收據被接受。這樣的設計不僅強化了即時的安全性,也為後續稽核與追蹤提供了可靠的基礎。在效能方面,部署閘道後所增加的安全決策延遲不超過 0.03 毫秒,對於多數即時應用場景而言幾乎無感。

更重要的是,在 15 個先前測試過的語言模型上,搭配 aiAuthZ 之後,殘留的攻擊成功率全都降為 0%。研究人員進一步在 AgentDojo 銀行套件中進行驗證,aiAuthZ 成功阻止了代理所觸發的全部七個攻擊者導向的工具呼叫,僅以一次合法的首次支付作為代價;與之相比,使用無身份綁定的基線政策雖然能阻擋部分攻擊,但仍讓兩次注入攻擊得逞。另外,研究人員從公開的真實代理事故資料庫中選取了九個相關案例進行測試,aiAuthZ 在所有九個案例中全都成功阻止攻擊,而沒有身份綁定的政策基線僅能阻止四個案例。這清楚凸顯了身份綁定所帶來的額外防護效果。

值得注意的是,aiAuthZ 並不能防止模型本身被欺騙或誤導。它設計的目的在於,即便模型已經被成功欺騙而發出惡意工具呼叫,該呼叫仍然無法繞過閘道的身份驗證與授權檢查,從而無法執行超出已驗證用戶權限的動作。換句話說,閘道在不干擾模型正常行為的前提下,為 AI 代理與外部工具之間建立了一道關鍵的安全閘門。目前,研究團隊已將 aiAuthZ 的完整實作與所有實驗資料以開源形式釋出,提供給開發者與研究社群進一步測試與部署。隨著 AI 代理自主性逐漸提高,如何確保它們安全地與真實系統互動已成為迫切課題,這項成果為業界提供了一個可落地的參考方案,也引發了關於「信任邊界應設在何處」的新一輪討論。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前