日本Sakana AI放出Fugu Cyber:一個多智能體系統,把GPT-5.5-Cyber和Claude都挑落馬下
重點摘要
AI資訊AI新閒資訊正文日本Sakana AI放出Fugu Cyber:一個多智能體系統,把GPT-5.5-Cyber和Claude都挑落馬下發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘網絡安全這道防線,正在被一種新的作戰單元重新定義。7月21日,日本人工智能初創企業Sakana AI發佈專為應對現代網絡防禦複雜性而打造的Fugu Cyber模型,它在業界最具挑戰性的安全基準測試裡交出了足以壓過頭部閉源對手的成績。
日本人工智慧新創公司 Sakana AI 於 7 月 21 日正式推出專為現代網路安全防禦設計的全新模型「Fugu Cyber」,這款多智能體系統在業界最具挑戰性的安全基準測試中,一舉擊敗 OpenAI 的 GPT-5.5-Cyber 與 Anthropic 的 Claude Mythos-Preview 兩大頂尖閉源模型,引起資安與 AI 領域高度關注。Sakana AI 以「演化式神經網路」與「多智能體協作」技術聞名,過去曾推出多款高效能小型模型,如今將相同概念延伸至網路攻防場景,企圖改寫傳統資安防線的作戰邏輯。
根據官方公布的測試數據,Fugu Cyber 在 CyberGym 基準測試中達到 86.9% 的成功率,而在 CTI-REALM 測試中則取得 72.1% 的成功率。這兩個測試分別模擬真實世界中的滲透攻擊、威脅情資分析與應變處理,難度極高。相比之下,OpenAI 的 GPT-5.5-Cyber 與 Anthropic 的 Claude Mythos-Preview 在相同測試中表現均低於此門檻,顯示 Fugu Cyber 不僅在通用語言理解上不輸對手,更在專屬的資安任務上展現出超越性的優勢。
Fugu Cyber 的核心並非單一的大型語言模型,而是由多個專門化的智能體(agent)所組成的協作系統。每個智能體負責不同的任務,例如漏洞掃描、日誌分析、攻擊鏈推演、修復建議生成等,並透過一個中央調度機制進行動態分工與資訊交換。這種架構讓系統能夠同時處理多條攻擊路徑,並在幾秒內提出防禦策略,大幅縮短從威脅偵測到應變處置的時間差。Sakana AI 表示,這種「多智能體協作」設計靈感來自自然界中蟻群與蜂群的集體決策模式,能夠在高度不確定的環境中保持韌性與效率。網路安全領域長期面臨「誤報率過高」與「專家人力短缺」兩大痛點。
傳統的規則式防禦系統難以抵擋新型態的零日攻擊,而通用型 AI 模型雖然能理解自然語言,卻缺乏對網路協議、封包結構與攻防戰術的深度理解。Fugu Cyber 的出現,正是試圖填補這道鴻溝。Sakana AI 透露,他們在訓練過程中使用了大量真實且匿名的攻擊流量數據,並結合合成對抗樣本,讓模型能夠在模擬攻防中不斷自我演化,從而適應不斷變化的威脅環境。值得注意的是,Sakana AI 是一家日本新創,總部位於東京,創辦人來自 Google Brain 與日本頂尖學術機構。
不同於 OpenAI 與 Anthropic 等美國公司主導的閉源路線,Sakana AI 持續公開部分模型權重與技術報告,試圖建立更透明的 AI 安全生態。Fugu Cyber 雖然尚未完全開源,但官方已經釋出技術白皮書,詳細說明多智能體系統的架構與測試方法,學術界與資安社群可據此進行獨立驗證。業界分析人士指出,Fugu Cyber 的成功不僅代表技術層面的突破,更可能改變企業採購 AI 資安解決方案的思維。過去企業傾向直接導入 GPT-5.5-Cyber 或 Claude 等通用旗艦模型,但這些模型在專屬領域的表現往往不如預期。
Fugu Cyber 以相對較小的參數量(推測在百億級別)達到甚至超越千億級對手的成績,顯示專用模型在特定任務上仍有巨大優勢。這也讓外界開始重新評估「大模型即一切」的假設,轉而關注「模型組合」與「任務分工」的效益。CyberGym 測試由多家獨立資安實驗室共同設計,涵蓋滲透測試、釣魚郵件辨識、惡意軟體分類、事件應變建議等 12 個子項目。Fugu Cyber 在其中的 9 個項目中取得最高分,尤其在「多階段攻擊鏈預測」與「修復優先級排序」兩個項目大幅領先對手。
CTI-REALM 測試則更聚焦於威脅情資的提取與關聯分析,要求模型從大量非結構化報告中擷取攻擊者手法、工具與指標,並建立可操作的防禦建議。Fugu Cyber 在這項測試中展現出對專業術語與上下文的高度掌握,誤判率僅為 GPT-5.5-Cyber 的一半。Sakana AI 執行長在發表會上強調,Fugu Cyber 並非意在取代人類資安分析師,而是作為「戰術輔助系統」來減輕專家的工作負擔。他提到,現代企業每天可能收到數千筆安全告警,分析師根本無力逐一審視,而 Fugu Cyber 可以自動過濾掉 95% 以上的誤報,並將剩餘的威脅事件依嚴重程度分級,附上具體的應變步驟。
這項能力對於缺乏大型安全團隊的中小企業特別有吸引力。目前 Fugu Cyber 已開放部分企業進行 Beta 測試,預計今年第四季推出正式版本。Sakana AI 表示,定價將採用「按任務計費」模式,而非傳統的授權或訂閱制,讓客戶只需為實際使用的分析次數付費。此舉可能進一步降低中小企業採用 AI 資安的門檻。同時,該公司也計劃與日本國內的網路安全局合作,將 Fugu Cyber 整合進國家級威脅情資共享平台,強化關鍵基礎設施的防護能力。儘管 Fugu Cyber 表現亮眼,但仍有一些挑戰待解決。
例如,多智能體系統的協調延遲在高強度攻擊下可能成為瓶頸;此外,模型對全新攻擊手法的適應能力尚需時間驗證。Sakana AI 表示,他們將持續透過「演化式訓練」機制,讓系統在每次攻擊事件後自動更新知識庫,縮短從威脅出現到防禦部署的窗口。資安社群則普遍持正面態度,認為多智能體架構為 AI 驅動的網路安全開闢了一條新路徑,值得密切關注後續發展。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。