超越OpenAI、Anthropic!國產AI安全智能體殺進全球前四、國內第一

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 超越OpenAI、Anthropic!
### 超越OpenAI與Anthropic,中國AI安全智能體闖入全球前四
中國資安大廠深信服近日公開旗下AI安全智能體Sangfor AI在國際評測的最新戰果。在針對真實工業場景的代碼安全實戰平台CyberGym中,Sangfor AI以基於GLM-5.2國產大模型的固定配置,成功處理超過一千三百項漏洞挑戰任務,整體成功率達86.3%,一舉拿下全球第四、中國參測團隊第一的排名,甚至超越了OpenAI與Anthropic兩家國際AI巨頭的成績,引發業界高度關注。CyberGym被視為當前代碼安全領域含金量最高的實戰靶場之一。
與傳統靜態理論測試不同,該平台完全貼近工業真實場景,考題來自大量開源軟體的歷史高危漏洞,重點考核AI智能體能否自主完成源碼分析、多階段漏洞推演、漏洞復現以及PoC(概念驗證)的完整鏈路。這樣的設計讓評測結果更具行業參考價值,也直接反映AI在複雜代碼對抗中的真實能力。在此次評測中,Sangfor AI在細分項目上表現穩定。針對ARVO任務的成功率達到87.2%,OSS-Fuzz任務的成功率也有77.7%。這些數字不僅驗證了國產大模型在嚴苛環境下的實戰水準,也顯示出深信服在AI安全領域的技術積累已具備國際競爭力。#### 以「智能體群體」協作,打造可驗證的安全能力
深信服技術團隊說明,為了解決漏洞挖掘過程中常見的長鏈路推理、多假設探索以及持續驗證等難題,Sangfor AI採用了「智能體群體(Agent Swarm)協同作戰」的架構,並導入「證據管治」機制。這套技術框架的核心運作邏輯分為四大環節,確保每一步調查都具備清晰的脈絡與可信度。首先是「有界探索」。系統會針對不同的安全假設,分別開啟獨立且邊界清楚的調查分支,讓多種可能的解釋能夠並行推進,避免互相干擾,也防止未經證實的假設悄悄變成集體共識。這種設計大幅提升了探索效率。其次是「證據持久化」。各調查分支之間不是透過完整的對話歷史來協調,而是以「證據」作為協作基礎。
已經驗證的觀察結果與已被證明錯誤的路徑都會被保留下來,如此一來,同一條錯誤路線就不會被反覆重試,浪費資源。第三是「動態假設裁決」。系統中有一個協調層,會持續根據不斷演變的證據狀態,判斷哪些假設依然成立、哪些問題尚待解決、哪些地方值得繼續投入資源。每輪探索都能有效收窄搜尋範圍,逐步逼近真正的漏洞所在。最後是「對抗式候選評審」。當證據指向某個具體的觸發方案時,系統才會構造候選輸入並進行嚴格的對抗式評審。評審會同時挑戰「這次崩潰是否可復現」以及「是否真的對應到目標漏洞」。未能通過評審的候選會被退回,用於修正下一步的探索方向。只有真正經得起檢驗的候選結果,才會成為系統最終的安全結論。
深信服技術團隊將這套機制總結為「以假設拓展探索,以證據裁定結論」,確保AI既能大規模排查潛在風險,又能透過多層校驗將誤判機率壓到最低。#### 從實驗室走入企業研發,安全Agent逐步落地
除了在國際評測中繳出亮眼成績單,深信服也透露,相關技術已經開始應用於企業的程式碼安全場景,推動傳統靜態應用安全測試(SAST)朝向具備自主推理與業務理解能力的安全Agent升級。與過去只能仰賴規則匹配的作法相比,新世代的安全Agent不僅能識別SQL注入、命令執行等常見漏洞,還能分析複雜的業務邏輯,找出越權存取、認證繞過等傳統工具難以涵蓋的安全風險。根據深信服介紹,這些能力已經開始融入其產品體系,為企業級用戶帶來具體的價值提升。在漏洞檢出方面,可以有效克服傳統SAST的盲區,全面識別邏輯漏洞、越權與認證繞過等問題,大幅擴展程式碼安全的覆蓋範圍。
在人工成本上,藉由AI自動化完成程式碼理解、跨檔案關聯分析、攻擊路徑推理與風險驗證,能顯著減輕安全專家繁重的人工審查負擔。此外,多階段推理與嚴謹的證據驗證機制也有效降低了誤報率,讓研發人員可以專注在真正需要修復的高風險問題,不需浪費時間處理無效告警。同時,將安全檢測前移到開發撰寫與CI/CD流程中,實現「程式碼提交即自動審計」,有助於縮短研發交付週期,減少後期修補成本,加速業務上線。對於企業而言,AI安全Agent的價值不僅在於「發現更多漏洞」,更在於能夠以高準確率、低人工成本與快速反應,同步達成研發效率與程式碼安全的提升。
深信服方面表示,未來將持續深耕大模型安全技術,不斷迭代安全Agent的能力,把國際評測中驗證的前沿技術,轉化為企業可以實際落地的安全防線,持續實踐「讓每個用戶的數位化更簡單、更安全」的承諾。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。