螞蟻集團連發兩款開源安全模型,為大模型與智能體套上“緊箍咒”
重點摘要
AI資訊AI新閒資訊正文螞蟻集團連發兩款開源安全模型,為大模型與智能體套上“緊箍咒”發布於AI新閒資訊時間 :Jul 13, 2026閱讀 :1分鐘7月13日,螞蟻AI安全實驗室宣佈開源智能體安全護欄SingGuard-NSFA,並同步披露多模態安全護欄SingGuard的詳細信息。
好的,這是一篇根據您提供的資料重新撰寫的完整新聞稿,字數約1200字,分為10個自然段落,符合新聞報導的結構與專業性。 ***
### 螞蟻集團連發兩款開源安全模型,為大模型與智能體套上“緊箍咒”
**(台北訊)** 隨著人工智慧從內容生成邁向自主執行,AI系統的安全防護正面臨全新挑戰。為應對日益複雜的智能體與多模態交互風險,螞蟻集團旗下AI安全實驗室於7月13日宣布,正式開源智能體安全護欄模型「SingGuard-NSFA」,並同步披露了多模態安全護欄「SingGuard」的詳細技術細節。此舉被視為螞蟻集團在AI安全領域從內容審核走向行為管控與系統治理的關鍵布局,為快速發展的大模型與智能體生態裝上了一道關鍵的「安全閥」。此次推出的兩款模型分別針對當前AI應用最前沿的兩大場景:「自主執行的智能體」與「多模態交互的大模型」。
不同於傳統AI主要負責內容生成,新一代智能體已開始具備自主調用工具、執行代碼、規劃多步驟任務的能力,這使得安全問題的維度急遽擴張。螞蟻集團此次的技術發布,正是為了解決模型輸出之外,更為棘手的行為控制、權限管理與系統治理難題。過去一年來,全球AI安全事件頻傳,從Amazon Q的提示詞投毒、Microsoft Copilot的資料洩露,到開源智能體框架OpenClaw暴露出的提示詞注入風險,一再顯示智能體的自主性越強,安全風險的放大效應就越明顯。與此同時,國際與國內監管機構也開始加速行動。
2025年12月,OWASP(開放式網路應用安全專案)發布了《智能體應用安全十大風險》;而於今年5月,中國國家網信辦等三部委更聯合印發了《智能體規範應用與創新發展實施意見》,首次從國家層面為智能體安全治理設立明確標杆。在此背景下,螞蟻AI安全實驗室推出的「SingGuard-NSFA」,堪稱是專為智能體操作裝上的「即時剎車」。其核心功能是在智能體執行任何動作之前,完成實時安全檢測,從請求攔截與響應兜底兩端構建行為安全防護網。
該模型基於CIA(保密性、完整性、可用性)原則,並參考OWASP等國際安全指南,將智能體風險細分為7大類、28個中類及185個具體場景,並建立了一個覆蓋133種語言、近10萬條樣本的評測體系,展現了極高的風險覆蓋率。在技術實現上,SingGuard-NSFA提供了高度靈活的部署方案。它具備兩種工作模式:一種可逐條產出詳細的風險分析報告,便於事後審查與合規記錄;另一種則能在極短的50毫秒左右完成單次風險判定,完美適用於線上高併發場景的即時攔截。此外,針對不同硬體環境,該模型提供了0.8B、2B、4B、9B四種參數規模。最令人驚豔的是,僅0.
8B的輕量級模型即可達到8B模型的性能水準,且新增風險類別時只需訓練輕量模塊,無需重新訓練整個模型,大幅降低了安全維護的成本。針對多模態交互場景,螞蟻則推出了名為「SingGuard」的全能守門員。面對如Anthropic的Claude Fable 5等旗艦模型被研究者用Unicode或西里爾字母繞過安全護欄的案例,SingGuard展現了其獨特價值。它能處理文本、圖片及跨模態內容的統一安全判斷,有效識別攻擊者將惡意指令隱藏在不同模態中的複雜攻擊。
其「快慢結合」的推理機制,在保證效率的同時提升了判斷準確率,並支援動態加載自然語言安全規則,無需重新訓練模型即可更新,特別適合業務流量大且規則持續演進的生產環境。在多項公開評測中,SingGuard在涵蓋文本查詢、文本回復、圖像、多模態和多語言的35個數據集與評測切分上,平均F1分數均為最高。其對比對象涵蓋了Llama Guard 3、Google的ShieldGemma、GPT-5.1及Gemini 3-Pro等業界主流護欄,SingGuard均實現了全面領先,展現了強大的技術實力。
中國信通院人工智能研究所安全治理部副主任呼娜英對此表示,隨著大模型邁向自主執行,AI安全正從內容審核延伸至行為管控與系統治理,已成為智能體規模化應用的基礎能力。她強調,螞蟻集團此次的開源舉措,對於建構健康、有序的AI生態具有重要的推動作用。值得關注的是,螞蟻集團在AI安全的布局並非一日之功。其先前已針對開源智能體框架OpenClaw進行專項安全審計,並於今年4月聯合清華大學開源了智能體安全防禦插件ClawAegis。此次連續開源,正是建立在螞蟻集團二十餘年支付安全、數據保護與風險治理的深厚積累之上,相關技術也已在「螞蟻阿福」、AI版支付寶「阿寶」等業務場景中實踐。
透過積極參與國內外標準制定,螞蟻集團正將自身的AI安全能力從技術創新推向更廣泛的產業實踐,為AI的規模化、可信化應用奠定堅實基石。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。