GPT-5.6-Sol在網絡攻防能力上,超越了Mythos,開源模型也排好了

2026年7月21日 17:06
GPT-5.6-Sol在網絡攻防能力上,超越了Mythos,開源模型也排好了

重點摘要

AISI最新評估顯示,開源與閉源AI模型在網路攻擊能力上的差距已縮小至4到7個月。其中GPT-5.6-Sol在網路攻防能力上超越了Mythos,開源模型也在排行榜上展現出快速追趕的趨勢。

站內 AI 整理稿

人工智慧安全評估機構(AISI)最新發布的評估報告,揭示了開源與閉源AI模型在網路攻防能力上的競爭格局出現明顯變化。報告指出,兩者之間的技術差距已從過去的顯著落差,縮小至僅4到7個月,顯示開源社群在短時間內的快速迭代正在逐步追趕上閉源陣營的腳步。 長期以來,閉源大型語言模型在網路攻擊與防禦的實戰測試中佔據主導地位,憑藉龐大的參數規模與集中的研發資源,在模擬滲透、漏洞挖掘、惡意程式碼生成等項目上保持領先。然而,AISI的評估結果顯示,這項領先優勢已不再穩固——開源模型透過社群協作與頻繁更新,正以驚人的速度縮小與閉源產品的距離。 在具體的模型能力比對中,報告特別點名兩款代表性模型:GPT-5.6-Sol 與 Mythos。評估指出,GPT-5.6-Sol 在網路攻防的綜合測試分數上已正式超越Mythos,展現出更強的實戰能力。這項結果不僅代表單一型號的技術躍升,更反映出背後訓練策略與安全對抗機制的進步。 此外,開源模型的整體表現也逐步在相關排行榜上站穩位置。AISI的評估報告中,開源模型在網路攻防類別的排名已經完成排序,部分模型甚至擠進前端區塊,顯示出開源陣營在局部領域已具備超車閉源產品的實力。這對過去依賴封閉生態維持技術護城河的公司而言,無疑是一項警訊。 業界分析人士指出,隨著開源模型在網路攻防能力上的快速進化,未來AI安全領域的攻防對抗將比以往更加激烈。開源社群可以快速吸收最新研究成果,並將防禦機制與攻擊手法直接整合進模型,而閉源模型則需要透過版本更新與授權限制來維持控制力,這種差異使得競爭態勢更趨複雜。 值得注意的是,AISI的評估並非只針對靜態的模型能力,而是模擬真實的攻防場景,包括自動化漏洞掃描、社交工程腳本生成、以及對抗性提示的應對等。在這些項目中,GPT-5.6-Sol 的表現尤其突出,其成功繞過多層次防護的機率明顯低於Mythos,顯示在安全性設計上有了更細緻的調整。 開源模型的排名提升,也得益於社群對安全議題的重視。過去開源模型常被認為在安全性上較弱,因為其程式碼公開,攻擊者也能輕易研究弱點。但AISI的報告顯示,這種情況正在改變——開源社群透過集體審計與快速修補,反而在某些場景下比閉源模型更快應對新興威脅。 不過,閉源模型仍擁有資源集中的優勢。例如,部分大型閉源模型在處理複雜、多階段的攻擊鏈時,仍能保持較高的成功率,這與其訓練資料的規模與多樣性有關。但4到7個月的時間差,意味著開源模型已經能夠在閉源模型發布新版本後的數個月內,複製或超越其核心能力。 AISI的報告也引發了關於AI安全政策的討論。如果開源模型在網路攻防上持續進步,甚至在某些領域反超,那麼傳統的監管思維是否需要調整?畢竟,開源模型的可取得性更高,一旦被惡意使用,其擴散風險可能比閉源產品更難控制。這也讓安全評估機構開始重新思考評估框架,是否該加入更多針對開源特性的測試項目。 回到市場層面,GPT-5.6-Sol 與 Mythos 的對比,已經成為業界關注的焦點。GPT-5.6-Sol 的開發團隊在模型設計上強調了安全對抗訓練,使其在面對紅隊測試時表現更穩定。而Mythos雖然在自然語言理解上仍有優勢,但在純粹的攻防場景中,似乎已讓出領先位置。 總體而言,AISI的這份評估報告為AI安全領域劃出了新的分水嶺。開源與閉源之間的技術鴻溝正在以肉眼可見的速度收窄,未來4到7個月的差距可能進一步縮小,甚至在某些垂直領域完全消失。這不僅是技術競賽的結果,也預示著AI安全將進入一個更加動態、且需要多方協作的時代。

Related

相關文章

IT之家模型更新

阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升

首頁 > 智能時代>人工智能 阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升 2026/7/21 19:29:06 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 7 月 21 日消息,據千問大模型官方消息,Qwen3.8-Max-Preview 最新版本已上線,能力又有提升,前端(WebDev)表現會更好。千問大模型稱:“Qwen3.

剛剛
鈦媒體模型更新

智譜保衛硅谷

智譜保衛硅谷錦緞2026.07.21 13:48 · 來自北京全文2584字00:00 / 07:12地緣無法阻擋代碼的流動。文 | 錦緞上週,全球最大的AI開源社區Hugging Face遭遇入侵。攻擊者是一個完全自主的AI智能體系統,在大量短生存期沙盒中執行了數千個獨立操作,在一個週末內橫向移動進入了多個內部集群。這是一次被行業預測多年、但首次在現實中完整上演的“智能體攻擊”。

1 小時前
鈦媒體模型更新

沿用DeepSeek架構,美國大模型開始抄中國作業

沿用DeepSeek架構,美國大模型開始抄中國作業字母AI2026.07.21 13:37 · 來自北京全文5310字00:00 / 14:20貴在美國製造。文 | 字母AIOpenAI前首席技術官穆拉蒂,做出了一款中國模型的“貴替”。Thinking Machines發佈的首款模型Inkling,混合專家架構主要沿用DeepSeek-V3,後訓練冷啟動還使用了Kimi K2.5等開放模型生成的數據。

1 小時前

當AI給出標準答案,人如何“不同凡想”?一場WAIC UP! 思享會撕開的全球追問

好的,這是一篇根據您提供的資料重新撰寫的新聞稿,力求完整、深入,並滿足字數與段落要求。 --- ## AI給出標準答案,人如何「不同凡想」?一場WAIC思享會直擊全球青年的集體困惑 2026年7月,上海世博展覽館,世界人工智慧大會(WAIC)的主會場內,算力、演算法與資本的碰撞激盪著空氣。然而,在幾百米外的一個下沉廣場,一場名為「WAIC UP!」的思享會卻刻意避開了喧囂,沒有權威的致辭,沒有炫目的技術發佈,更沒有動輒數億的合作協議。

4 小時前
鈦媒體模型更新

Kimi K3發佈後,最慌的不是英偉達

Kimi K3 正式發佈後,市場出現一種觀點:這款產品真正讓業界緊張的對象並非英偉達。相較於繪圖晶片龍頭,其他專注於特定領域的晶片或運算方案供應商可能面臨更直接的競爭壓力。 目前關於 Kimi K3 的具體規格、合作夥伴與市場定位仍在陸續揭露中。業界將持續關注這款新產品對整體 AI 運算生態的影響,以及哪些廠商會率先感受到衝擊。

4 小時前