GPT-5.6-Sol在網絡攻防能力上,超越了Mythos,開源模型也排好了

2026年7月21日 17:06
GPT-5.6-Sol在網絡攻防能力上,超越了Mythos,開源模型也排好了

重點摘要

AISI最新評估顯示,開源與閉源AI模型在網路攻擊能力上的差距已縮小至4到7個月。其中GPT-5.6-Sol在網路攻防能力上超越了Mythos,開源模型也在排行榜上展現出快速追趕的趨勢。

站內 AI 整理稿

人工智慧安全評估機構(AISI)最新發布的評估報告,揭示了開源與閉源AI模型在網路攻防能力上的競爭格局出現明顯變化。報告指出,兩者之間的技術差距已從過去的顯著落差,縮小至僅4到7個月,顯示開源社群在短時間內的快速迭代正在逐步追趕上閉源陣營的腳步。長期以來,閉源大型語言模型在網路攻擊與防禦的實戰測試中佔據主導地位,憑藉龐大的參數規模與集中的研發資源,在模擬滲透、漏洞挖掘、惡意程式碼生成等項目上保持領先。然而,AISI的評估結果顯示,這項領先優勢已不再穩固——開源模型透過社群協作與頻繁更新,正以驚人的速度縮小與閉源產品的距離。在具體的模型能力比對中,報告特別點名兩款代表性模型:GPT-5.

6-Sol 與 Mythos。評估指出,GPT-5.6-Sol 在網路攻防的綜合測試分數上已正式超越Mythos,展現出更強的實戰能力。這項結果不僅代表單一型號的技術躍升,更反映出背後訓練策略與安全對抗機制的進步。此外,開源模型的整體表現也逐步在相關排行榜上站穩位置。AISI的評估報告中,開源模型在網路攻防類別的排名已經完成排序,部分模型甚至擠進前端區塊,顯示出開源陣營在局部領域已具備超車閉源產品的實力。這對過去依賴封閉生態維持技術護城河的公司而言,無疑是一項警訊。業界分析人士指出,隨著開源模型在網路攻防能力上的快速進化,未來AI安全領域的攻防對抗將比以往更加激烈。

開源社群可以快速吸收最新研究成果,並將防禦機制與攻擊手法直接整合進模型,而閉源模型則需要透過版本更新與授權限制來維持控制力,這種差異使得競爭態勢更趨複雜。值得注意的是,AISI的評估並非只針對靜態的模型能力,而是模擬真實的攻防場景,包括自動化漏洞掃描、社交工程腳本生成、以及對抗性提示的應對等。在這些項目中,GPT-5.6-Sol 的表現尤其突出,其成功繞過多層次防護的機率明顯低於Mythos,顯示在安全性設計上有了更細緻的調整。開源模型的排名提升,也得益於社群對安全議題的重視。過去開源模型常被認為在安全性上較弱,因為其程式碼公開,攻擊者也能輕易研究弱點。

但AISI的報告顯示,這種情況正在改變——開源社群透過集體審計與快速修補,反而在某些場景下比閉源模型更快應對新興威脅。不過,閉源模型仍擁有資源集中的優勢。例如,部分大型閉源模型在處理複雜、多階段的攻擊鏈時,仍能保持較高的成功率,這與其訓練資料的規模與多樣性有關。但4到7個月的時間差,意味著開源模型已經能夠在閉源模型發布新版本後的數個月內,複製或超越其核心能力。AISI的報告也引發了關於AI安全政策的討論。如果開源模型在網路攻防上持續進步,甚至在某些領域反超,那麼傳統的監管思維是否需要調整?畢竟,開源模型的可取得性更高,一旦被惡意使用,其擴散風險可能比閉源產品更難控制。

這也讓安全評估機構開始重新思考評估框架,是否該加入更多針對開源特性的測試項目。回到市場層面,GPT-5.6-Sol 與 Mythos 的對比,已經成為業界關注的焦點。GPT-5.6-Sol 的開發團隊在模型設計上強調了安全對抗訓練,使其在面對紅隊測試時表現更穩定。而Mythos雖然在自然語言理解上仍有優勢,但在純粹的攻防場景中,似乎已讓出領先位置。總體而言,AISI的這份評估報告為AI安全領域劃出了新的分水嶺。開源與閉源之間的技術鴻溝正在以肉眼可見的速度收窄,未來4到7個月的差距可能進一步縮小,甚至在某些垂直領域完全消失。

這不僅是技術競賽的結果,也預示著AI安全將進入一個更加動態、且需要多方協作的時代。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

1 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

1 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

2 小時前