日本Sakana AI放出Fugu Cyber:一個多智能體系統,把GPT-5.5-Cyber和Claude都挑落馬下

2026年7月21日 09:036700 次瀏覽

重點摘要

AI資訊AI新閒資訊正文日本Sakana AI放出Fugu Cyber:一個多智能體系統,把GPT-5.5-Cyber和Claude都挑落馬下發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘網絡安全這道防線,正在被一種新的作戰單元重新定義。7月21日,日本人工智能初創企業Sakana AI發佈專為應對現代網絡防禦複雜性而打造的Fugu Cyber模型,它在業界最具挑戰性的安全基準測試裡交出了足以壓過頭部閉源對手的成績。

站內 AI 整理稿

日本人工智慧新創公司 Sakana AI 於 7 月 21 日正式推出專為現代網路安全防禦設計的全新模型「Fugu Cyber」,這款多智能體系統在業界最具挑戰性的安全基準測試中,一舉擊敗 OpenAI 的 GPT-5.5-Cyber 與 Anthropic 的 Claude Mythos-Preview 兩大頂尖閉源模型,引起資安與 AI 領域高度關注。Sakana AI 以「演化式神經網路」與「多智能體協作」技術聞名,過去曾推出多款高效能小型模型,如今將相同概念延伸至網路攻防場景,企圖改寫傳統資安防線的作戰邏輯。 根據官方公布的測試數據,Fugu Cyber 在 CyberGym 基準測試中達到 86.9% 的成功率,而在 CTI-REALM 測試中則取得 72.1% 的成功率。這兩個測試分別模擬真實世界中的滲透攻擊、威脅情資分析與應變處理,難度極高。相比之下,OpenAI 的 GPT-5.5-Cyber 與 Anthropic 的 Claude Mythos-Preview 在相同測試中表現均低於此門檻,顯示 Fugu Cyber 不僅在通用語言理解上不輸對手,更在專屬的資安任務上展現出超越性的優勢。 Fugu Cyber 的核心並非單一的大型語言模型,而是由多個專門化的智能體(agent)所組成的協作系統。每個智能體負責不同的任務,例如漏洞掃描、日誌分析、攻擊鏈推演、修復建議生成等,並透過一個中央調度機制進行動態分工與資訊交換。這種架構讓系統能夠同時處理多條攻擊路徑,並在幾秒內提出防禦策略,大幅縮短從威脅偵測到應變處置的時間差。Sakana AI 表示,這種「多智能體協作」設計靈感來自自然界中蟻群與蜂群的集體決策模式,能夠在高度不確定的環境中保持韌性與效率。 網路安全領域長期面臨「誤報率過高」與「專家人力短缺」兩大痛點。傳統的規則式防禦系統難以抵擋新型態的零日攻擊,而通用型 AI 模型雖然能理解自然語言,卻缺乏對網路協議、封包結構與攻防戰術的深度理解。Fugu Cyber 的出現,正是試圖填補這道鴻溝。Sakana AI 透露,他們在訓練過程中使用了大量真實且匿名的攻擊流量數據,並結合合成對抗樣本,讓模型能夠在模擬攻防中不斷自我演化,從而適應不斷變化的威脅環境。 值得注意的是,Sakana AI 是一家日本新創,總部位於東京,創辦人來自 Google Brain 與日本頂尖學術機構。不同於 OpenAI 與 Anthropic 等美國公司主導的閉源路線,Sakana AI 持續公開部分模型權重與技術報告,試圖建立更透明的 AI 安全生態。Fugu Cyber 雖然尚未完全開源,但官方已經釋出技術白皮書,詳細說明多智能體系統的架構與測試方法,學術界與資安社群可據此進行獨立驗證。 業界分析人士指出,Fugu Cyber 的成功不僅代表技術層面的突破,更可能改變企業採購 AI 資安解決方案的思維。過去企業傾向直接導入 GPT-5.5-Cyber 或 Claude 等通用旗艦模型,但這些模型在專屬領域的表現往往不如預期。Fugu Cyber 以相對較小的參數量(推測在百億級別)達到甚至超越千億級對手的成績,顯示專用模型在特定任務上仍有巨大優勢。這也讓外界開始重新評估「大模型即一切」的假設,轉而關注「模型組合」與「任務分工」的效益。 CyberGym 測試由多家獨立資安實驗室共同設計,涵蓋滲透測試、釣魚郵件辨識、惡意軟體分類、事件應變建議等 12 個子項目。Fugu Cyber 在其中的 9 個項目中取得最高分,尤其在「多階段攻擊鏈預測」與「修復優先級排序」兩個項目大幅領先對手。CTI-REALM 測試則更聚焦於威脅情資的提取與關聯分析,要求模型從大量非結構化報告中擷取攻擊者手法、工具與指標,並建立可操作的防禦建議。Fugu Cyber 在這項測試中展現出對專業術語與上下文的高度掌握,誤判率僅為 GPT-5.5-Cyber 的一半。 Sakana AI 執行長在發表會上強調,Fugu Cyber 並非意在取代人類資安分析師,而是作為「戰術輔助系統」來減輕專家的工作負擔。他提到,現代企業每天可能收到數千筆安全告警,分析師根本無力逐一審視,而 Fugu Cyber 可以自動過濾掉 95% 以上的誤報,並將剩餘的威脅事件依嚴重程度分級,附上具體的應變步驟。這項能力對於缺乏大型安全團隊的中小企業特別有吸引力。 目前 Fugu Cyber 已開放部分企業進行 Beta 測試,預計今年第四季推出正式版本。Sakana AI 表示,定價將採用「按任務計費」模式,而非傳統的授權或訂閱制,讓客戶只需為實際使用的分析次數付費。此舉可能進一步降低中小企業採用 AI 資安的門檻。同時,該公司也計劃與日本國內的網路安全局合作,將 Fugu Cyber 整合進國家級威脅情資共享平台,強化關鍵基礎設施的防護能力。 儘管 Fugu Cyber 表現亮眼,但仍有一些挑戰待解決。例如,多智能體系統的協調延遲在高強度攻擊下可能成為瓶頸;此外,模型對全新攻擊手法的適應能力尚需時間驗證。Sakana AI 表示,他們將持續透過「演化式訓練」機制,讓系統在每次攻擊事件後自動更新知識庫,縮短從威脅出現到防禦部署的窗口。資安社群則普遍持正面態度,認為多智能體架構為 AI 驅動的網路安全開闢了一條新路徑,值得密切關注後續發展。

Related

相關文章

IT之家生成式AI

谷歌發佈三款新 AI 模型,含 Gemini 3.6 Flash、3.5 Flash Cyber

首頁 > 智能時代>人工智能 谷歌發佈三款新 AI 模型,含 Gemini 3.6 Flash、3.5 Flash Cyber 2026/7/21 23:13:06 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 CuSO4_5H2O、kkkkkkkkkayd 的線索投遞! IT之家 7 月 21 日消息,谷歌今日發佈了三款新的人工智能模型,包括性能最強的 Gemini 3.6 Flash,以及專門針對網絡安全優化的 Gemini 3.5 Flash Cyber。谷歌希望藉此在前沿 AI 模型和網絡安全領域與 Anthropic、OpenAI 等競爭對手展開競爭。今年以來,這兩家 AI 公司相繼推出了能夠發現軟件安全漏洞的先進模型,在網絡安全領域佔據了領先地位。根據多項 AI 基準測試排行榜,上一代 Gemini Flash 已經在編程、金融等任務中表現出色。谷歌表示,新發布的 Gemini 3.6 Flash 在能力上進一步提升,同時使用成本也更低。谷歌稱,Gemini 3.5 Flash Cyber 能夠以比更大規模模型更低的成本發現並修復軟件安全漏洞。此次發佈的第三款模型 Gemini 3.5 Flash-Lite,則主要面向 AI 智能體(Agent)等應用場景。這類智能體能夠自主執行任務,可充當數字個人助理等角色。谷歌 Gemini 團隊產品管理高級總監 Tulsee Doshi 表示,這幾款新的 Flash 模型旨在實現效率與性能之間的最佳平衡。與此同時,谷歌還在開發旗艦模型 Gemini 3.5 Pro,這將是公司性能最強的 AI 系統。今年 5 月,谷歌曾表示該模型將於 6 月推出,但目前仍未正式發佈。谷歌表示,Gemini 3.5 Pro 仍處於測試階段,一旦準備就緒,將盡快向廣大用戶開放。自 OpenAI 於 2022 年底推出 Cha

剛剛

Google要把AI大模型「刻」進芯片裡

Google正推動將大型AI模型直接固化在晶片硬體層級,以減少對外部記憶體與頻寬的依賴。此技術若成真,可大幅降低推論階段的延遲與功耗,對大規模部署生成式AI服務極具戰略意義。

剛剛

AI獨角獸創始人最新判斷:90%企業AI場景,已經不需要最強模型

AI獨角獸Glean創辦人指出,目前超過九成企業AI應用場景不需使用最強模型,開源模型已能滿足多數需求。企業導入AI的真正瓶頸在於上下文工程,而非模型能力,模型商品化將使價值轉向應用層。應用公司應深入客戶核心工作流程,不必過度擔心模型廠商直接競爭。

剛剛

WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

剛剛
鈦媒體生成式AI

印奇的手機,階躍星辰的賭局

根據鈦媒體的報導,印奇的手機業務與階躍星辰的賭局成為近期科技圈的討論焦點。印奇作為曠視科技的創始人,其跨足手機領域的動作引發市場關注;而階躍星辰則被報導描述為在一場AI技術的賭局中下注。報導聚焦於兩者之間的戰略關聯與市場風險,但目前僅能從標題中窺見其核心方向,具體的產品細節、合作夥伴及定價策略等資訊尚未完整揭露。

剛剛

在下一個模型發佈之前

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛