Microsoft AI Releases MAI-Cyber-1-Flash: A 5B-Active-Parameter Cyber Model That Pushes MDASH to 95.95% on CyberGym
重點摘要
Microsoft AI has released MAI-Cyber-1-Flash, its first model built specifically for cyber defense. The model does not ship as a standalone endpoint.
微軟人工智慧團隊正式發表旗下第一款專為網路防禦打造的模型「MAI-Cyber-1-Flash」。這款模型並非以獨立端點的形式提供,而是內建於微軟的多模型代理掃描框架 MDASH 之中,擔任安全任務的核心引擎。MAI-Cyber-1-Flash 是一款採用自注意力機制與稀疏混合專家層(sparse Mixture-of-Experts)的 Transformer 模型,總參數量達到 1,370 億,但每次推理僅活化約 50 億參數,支援 256k 的上下文長度,輸入與輸出皆為純文字格式。
MAI-Cyber-1-Flash 是從 MAI-Code-1-Flash 微調而來,後者已是內建於 GitHub Copilot 與 VS Code 中的輕量級代理程式碼模型。微軟表示,這款新模型隸屬於 MAI-Thinking-1 技術譜系,其訓練目標是讓模型能在真實漏洞環境中執行偵測與修補任務,而非進行攻擊性操作。MDASH 本身是一個管理超過 100 個專門代理程式的自動化安全框架,處理流程分為五個階段:準備(Prepare)、掃描(Scan)、驗證(Validate)、去重(Dedupe)與證明(Prove)。
在架構中,Auditor 代理負責標記可疑發現,Debater 代理則透過意見分歧來判斷漏洞的可利用性;到了 Prove 階段,框架會對 C/C++ 目標執行觸發輸入,搭配 ASan(AddressSanitizer)進行驗證。為了控制前沿模型的運算成本,MAI-Cyber-1-Flash 承擔了 MDASH 中高達 90% 的任務,僅將最困難的 10% 案件升級給 GPT-5.4 處理。微軟指出,這種路由設計比先前的 GPT-5.4、5.4 mini 與 5.3 codex 配置節省約 50% 的成本。
在公開的 CyberGym 基準測試中,MDASH 搭配 MAI-Cyber-1-Flash 與 GPT-5.4 共同運作,取得了 95.95% 的分數。CyberGym 是一套由 188 個 OSS-Fuzz 專案中抽出 1,507 個真實漏洞重現任務所組成的公開評測集,微軟在其預設的等級一配置(提供含漏洞的原始碼與高階描述)下進行評估。相比之下,微軟在 2026 年 5 月首次公開 MDASH 時,該框架僅使用當時市面上的通用模型便在 CyberGym 上獲得 88.45%,已是公開排行榜最高分,領先第二名約 5 個百分點。如今將框架內約 80% 的模型更換為專用模型後,分數從 88.
4% 跳升至 95.95%,研究團隊直言這是「毫不含糊的進步」。微軟將此次成績與競爭對手比較,指出成績比 Anthropic 的 Mythos 高出約 12 個百分點,而排行榜上其他四個對比系統的得分落在 83.2% 至 85.6% 之間。除 CyberGym 外,研究團隊也公布了其他獨立的終端基準測試結果。在 CVEBench 上得分 0.314,CyberSecEval4 威脅情資項目 0.553、惡意軟體分析項目 0.33,CRSBench 在 POV 設定 1,200 下為 0.651。
值得注意的是,在 ExploitGym 的三個子項目(Kernel、Userspace、Browser)中,MAI-Cyber-1-Flash 全部掛零。微軟團隊解釋,這是刻意為之而非缺陷:模型經過訓練僅執行修補漏洞等防禦任務,而不具備部署惡意程式碼或撰寫攻擊程式的能力。一個僅有 50 億活化參數、無法生成攻擊程式,卻能驅動 95.95% 漏洞發現管線的模型,正是防禦專用產品所需要的核心資產。
MDASH 由微軟自主程式碼安全團隊(Autonomous Code Security, ACS)開發,團隊成員包含來自美國國防部先進研究計畫局(DARPA)AI 網路挑戰賽冠軍隊伍 Team Atlanta 的專家。今年五月,MDASH 輔助的研究成果已產出 16 個 CVE(含 4 個重大遠端程式碼執行漏洞),影響 Windows 網路與驗證堆疊。回溯測試更顯示,在五年的時間範圍內,MDASH 能復原 clfs.sys 中 28 個 MSRC 案例的 96%,以及 tcpip.sys 中 7 個案例的 100%。
MAI-Cyber-1-Flash 的釋出代表微軟在 AI 驅動安全領域的關鍵布局:以一個專注防禦、輕量化且成本可控的模型,讓 MDASH 這套多代理框架達到新標竿。目前該模型的取用仍需經過微軟的授權審核,尚未全面開放。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。