當AI開始“自作主張”,誰來為智能體戴上“項圈”?全球AI安全實戰化大考,中國方案打入前三

全球AI安全實戰化測評,中國方案DoGNAVY位列前三 2026年7月,OpenAI一款大模型在內部測試中“失控出逃”——自主發現漏洞、規劃路徑,成功入侵Hugging Face平臺。該模型為獲得更高評分,主動利用此前未知的零日漏洞突破沙箱,侵入存儲測試答案的數據庫,全程由AI自主完成。事後測試方發現,美國主流AI模型無法處理惡意載荷,最終轉用中國開源模型完成溯源分析。這一事件將AI智能體的行為安全與運行時控制問題推至前臺。而在更具量化性的國際安全測評中,問題的緊迫性同樣得到了驗證。
CyberGym:面向真實漏洞挖掘的實戰化基準 近期,加州大學伯克利分校發佈的國際安全權威榜單CyberGym公佈了最新排名。該基準以1507項來自188個真實開源項目的歷史已修復漏洞為任務,測試AI智能體從零開始自主挖掘、驗證並利用漏洞的能力,被Anthropic、DeepSeek、微軟、Wiz等視為AI安全能力的關鍵標尺。8月5日,國際公認安全權威榜單CyberGym公佈了最新排名,來自中國的團隊DoGNAVY獲得全球第三、開源第一的成績。
DoGNAVY:開源路線下的全球第三、中國第一 由國內頂尖人工智能研究機構(上海)與安全團隊達酷諾威(DARKNAVY)聯合研發的DoGNAVY,在此次測評中通過1369道題(通過率90.8%),排名全球第三,僅次於微軟MDASH(92.0%)和Wiz×Google DeepMind的Atlas(90.9%),並超越OpenAI GPT-5.5-Cyber(85.6%)與Anthropic Claude Mythos(83.1%)。一張榜單,幾乎湊齊了全球最頂尖的AI公司。前兩名用了同樣的路數:多個閉源頂級模型”拼裝作戰”。
用Wiz自己的說法,Atlas會把每個環節路由給在這項任務上表現最好的模型。這條路線足夠強大,但有個前提——你得同時買得到、也用得起全世界最強的那幾個閉源模型。而對國內團隊來說,這不僅意味著成本,更意味著可獲得性與自主性的挑戰。部分國際領先模型並未正式向中國市場開放服務。DoGNAVY選擇了另一條路。它只用了一款基礎模型——智譜在6月開源的GLM-5.2,一個任何人都能從Hugging Face上下載、自由部署的通用模型。DoGNAVY讓AI像安全專家一樣思考 複製一個頂級安全研究員,關鍵不在於“複製知識”,而在於“複製工作方式”。
CyberGym考驗的正是Agent的長時間探索、驗證、糾偏、改進能力。對此,DoGNAVY將頂尖安全研究員的工作方式及決策邏輯內化為Agent工作流;通過從程序入口還原調用鏈與數據約束,判斷真實輸入能否觸發漏洞;同時將真實研究中實踐有效的工具賦予Agent,讓靜態分析提出路徑與約束,動態驗證以覆蓋率、崩潰與運行時證據加以校驗。工作流與自決策 DoGNAVY 通過結構化工作流將開放式漏洞驗證分解為輸入輸出明確的研究活動,在關鍵決策點設置檢查條件。模型仍負責選擇分析路徑、形成假設和決定行動,但工作流保持目標、記錄結論並限制無效發散。
系統允許在證據衝突時撤銷錯誤前提並回溯重分析,避免在錯誤假設上累積工作。漏洞可達性分析 真實項目需從實際入口出發,滿足解析、狀態與數據約束後方可到達目標代碼。DoGNAVY將漏洞描述與代碼結構關聯,逐步恢復從外部輸入到缺陷位置的調用鏈與數據約束,重點關注輸入如何被解析、轉換和傳遞,以及哪些條件決定路徑可達。對大型代碼庫,系統通過索引化理解縮小搜索範圍,並組織已確認的入口、路徑、約束及未解決問題為可持續更新的任務狀態。當靜態結論不足時,保留不確定性並轉入動態驗證,而非將“未找到”等同於“不存在”。
動靜結合分析 DoGNAVY將靜態分析與動態探索置於統一反饋循環:靜態分析生成可解釋的漏洞路徑與輸入約束,動態分析驗證可達性、觀測運行時行為並反饋結果。動態反饋(如覆蓋率、錯誤位置、崩潰穩定性)指導下一輪靜態修正或輸入構造;靜態約束則縮小動態搜索範圍。該閉環持續提供外部證據,降低純語言推理在複雜控制流和二進制輸入上的累積誤差。動態驗證始終以真實入口和運行條件為邊界,只有可重複的目標相關行為才被採納為最終 PoC,排除非目標崩潰或環境異常。
知識庫與記憶 DoGNAVY內置面向多平臺(Android、iOS、HarmonyOS、IoT)的通用安全研究經驗,描述可遷移的漏洞分析方法和約束,而非特定目標答案。本次 CyberGym 實驗未加載任何數據集相關任務、漏洞編號、歷史 PoC 或補丁信息,僅保留常見漏洞分析與驗證經驗,以檢驗泛化能力。同時,跨任務記憶關閉,每個任務獨立執行,結果不注入後續任務;但單任務內持續沉澱已確認的代碼路徑、約束、嘗試與反饋,經組織壓縮後保留關鍵決策信息,緩解長上下文注意力稀釋。隔離跨任務記憶雖犧牲持續學習優勢,但更能客觀反映系統泛化能力,並減少對數據集的適應性偏差。
AgentDoG:給AI智能體戴上“診斷項圈” DoGNAVY的背後,是一套完整的技術體系。從Agent基礎設施到安全研究工作流,均由國內聯合團隊共同完成。其中,頂尖安全團隊達酷諾威將長期服務眾多領軍企業所積累的一線經驗轉化為專業安全能力;國內頂尖人工智能研究機構則通過名為AgentDoG( https://github.com/AI45Lab/AgentDoG)的安全架構,提供了核心的智能體運行與診斷能力。為什麼需要AgentDoG?因為AI智能體的風險,早已不是”說錯話”那麼簡單。
一個能夠操作文件、調用API、訪問網絡的Agent,可能因為一條隱藏在網頁中的惡意指令洩露隱私文件,可能因錯誤理解工具參數造成經濟損失,甚至可能”悄無聲息”地偏離正軌、執行危險動作。現有的安全工具只能給出”安全/不安全”的簡單判斷,無法告知風險根源。AgentDoG的不同之處在於,它不僅能精準判斷Agent行為的安全性,更能診斷風險來源、追溯失效模式、解釋決策動因。訓練AI安全模型通常很“燒錢”——需要海量數據和巨大算力。AgentDoG團隊換了一種思路:先用一套智能篩選機制,從海量數據中只挑出最關鍵的千餘樣本,再通過數據淨化技術去掉“雜音”。
最終,一個參數量僅為通用大模型千分之一的小模型,在複雜風險識別任務中達到了78.4%的準確率——與頂級大模型不相上下。當攻擊按小時提速,防禦不能再按年增長 AI正在同時改寫軟件開發和網絡攻防。過去,一個高危漏洞從被發現到形成可用攻擊能力,往往需要專業研究員投入數週甚至數月。如今,這部分工作正在被壓縮到數小時內。當攻擊的門檻和成本一路走低,防禦就不能繼續只依賴少數頂級專家。全球第三、中國第一,只是一個座標。它真正說明的是:以國內機構的AI研究能力、開源大模型與一線真實攻防經驗,已經能夠形成有效協作,處理最難、最大規模的專業安全任務。
這一成績指向的,不只是一次技術驗證,更是讓頂尖安全攻防能力不再只侷限於少數區域和機構,而能被更多創新者獲得、使用並共同建設——讓更多中國創新擁有AI安全力量。版權所有,未經授權不得以任何形式轉載及使用,違者必究。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
