GLM-5.3 來了:底座沒換,編程暴漲 50%,還順手揪出潛伏 40 年的世界級漏洞
GLM-5.3三大標籤,最強安全模型,最強編程模型,最強開源模型 作者丨高允毅 編輯丨岑 峰 昨晚剛經歷完DeepSeek的狂歡,智譜不聲不響放個大招,GLM-5.3正式上線。我們先看智譜給GLM-5.3的三個標籤,最強安全模型,最強編程模型,最強開源模型。在基座模型沒變的情況下,GLM-5.3編程能力體感暴漲50%,寫起代碼來直逼幹了十年的資深老架構師。在找Bug和漏洞防禦上,甚至可以對標Mythos 5,能一口氣挖出2436個漏洞,裡面光是中高危漏洞就有 1097 個。
而這些飛躍,都來自極致的後訓練,智譜將秘訣歸功於“架構優化技術IndexShare、強化學習算法SAO、以及新一代後訓練框架Slime框架”。而且智譜這次動作極快,不僅官方編程工具 ZCode、效率神器 AutoClaw 連夜開放,GLM Coding Plan 也直接面向所有人開放訂閱。為了配合這波全員狂歡,GLM Coding Plan 的額度已經滿血復活。01編程能力:開源第一,體感超Claude Fable 5智譜的編程能力有多強?可以說,全面逼近全球頂尖模型Claude Fable 5,甚至在部分高難度評測裡完成了反超。我們可以看一下數據。
在考驗真實終端環境複雜操作的 Terminal-Bench 3.0 上,GLM-5.3 開啟了驚人進化,得分從4.6 直接大躍進到 28.3,緊逼Fable 5的33.7。在長程軟件工程、極其考驗持續改代碼能力的 DeepSWE v1.1 中,它更是從 46.2 提升到 66.9,距離 Fable 5 只差 2.8 分,跟 Kimi K3 的差距更是縮短到了微弱的 0.6 分,而長程任務一直是 Kimi K3 的拿手好戲。而在強調多工具協作、覆蓋真實專業場景的 Agents' Last Exam 評測中,GLM-5.3 直接反超Fable 5 。
在測試AI 能不能在現實職場裡真正替人類幹活、以及能產出多大的實際經濟價值的 GDPval-AA v2 裡,GLM-5.3 直接拿下全球第一。整體而言,GLM-5.3 這次不僅進步大,而且提升的方向非常有針對性,它主要提升的是複雜軟件工程、終端操作和真實世界 Agent 任務的表現。可以說,智譜希望把GLM-5.3訓練成能真正扛起整個項目的專家級開發者,而這種能力的提升源於智譜自建的一套評測:Z.ai Code Bench。區別於傳統的紙上談兵,這個評測不看模型做題,而是直接把大模型空投進真實的本地開發環境,模擬人類開發者使用 Coding Agent 的體感。
結果在難度最高的 High 檔位下,GLM-5.3 拿到了 31.4% 的準確率,比Claude Opus 4.8(29.5%)還高1.9%。而在Token效率上,面對同一項高難任務,Opus 4.8需要12 萬個 Token,而GLM-5.3 平均只用了 5 萬個Token,這意味著,在真實開發環境中,GLM-5.3 不僅比Claude Opus 4.8做得更好,算力還節省了一半。這是怎麼做到的呢?官方表示原來他們把訓練環境一比一復刻成了大廠專家的完整工作流。
拿最複雜的機器學習優化任務來說,智譜直接給模型配齊了和算法工程師一模一樣的計算集群、存儲系統、內部文檔和代碼庫,讓它在真實環境裡端到端地實操。而有些任務的工作量十分巨大,即使是一位人類工程師,也得死磕好幾天。在這種極限捶打下,大模型終於開了竅。它不再是隻會聽話執行單條命令的機器,而是學會了像人類專家一樣,自己去發現 Bug、推導分析、自主驗證,最後一個人高產地把整個項目閉環掉。02安全能力:從"附屬功能"變成"主打招牌"不過相較於編程能力而言,這次更新中,安全問題才是GLM-5.3真正的重頭戲。官方披露,從GLM-5.
2發佈以來,智譜聯合各個頂尖安全團隊,已經在 269 個開源和商業項目中,累計揪出了 2436 個漏洞,裡面光是中高危漏洞就佔了 1097 個,部分漏洞甚至潛伏了近 40 多年。還記得前段時間震驚科技圈的 Hugging Face 被黑事件吧?當時在面對 OpenAI 超強模型的攻擊時,Hugging Face 幾乎癱瘓。而 Claude 因為層層安全限制導致無法正常防禦,最後是開源模型 GLM-5.2 成功頂住壓力,這一戰也直接讓它成為“全球安全大模型”的標杆。到了 GLM-5.3,智譜在安全上更強了。為了防範惡意請求,GLM-5.3 搭建了一套“縱深防禦”的風險審查系統,把防線分成了三層。
最外層是一個輕量級的分類模型,用來快速攔截大規模的低級濫用。中間層是推理監控器,在模型一邊思考的時候,一邊實時盯著它的任務意圖。最內核則是模型自身的“深度安全對齊”,讓它從底層邏輯上就能自主拒絕攻擊請求。最後這層最關鍵,因為在開發者下載模型到本地部署的開源場景下,只有模型自身的防線才是唯一有效的安全盾牌。更聰明的是,這套系統不是一刀切地搞“關鍵詞封殺”,而是根據“意圖和語境”來做風險分級。畢竟在網絡安全領域,黑客攻擊和專家防禦在字面描述上高度相似。GLM-5.3 的精細化審查,就是為了能一邊攔截高危漏洞利用,一邊放行正常的安全防護工作。
其實,智譜在安全方向上佈局很早,早在 2025 年 9 月,他們就聯合國內多家頂級安全實驗室,共同制定了專業化的網絡安全評測與執行框架。他們早早看到,伴隨著模型能力的快速提升,攻擊能力正在擴散。而近期一系列的模型失控越獄事件也確實印證了這一猜想。比如Mythos 5在測試中連網逃逸,甚至為了把惡意代碼塞進開源項目,註冊了一堆“假號”;連 Meta 的模型也因為配置錯誤溜出實驗室,順手把隔壁公司的系統給端了;而OpenAI 被迫宣佈緊急暫停下一代模型 Astra 的研發,就因為它的自主黑客能力已經強到了不受控的“危急”紅線。
在安全事件頻發後,智譜死磕安全能力,執意開源,正是為了打破頂尖安全技術被少數閉源大廠壟斷的局面。通常來說,網絡安全實操可拆分為代碼審查、漏洞驗證、漏洞利用以及真實環境的攻防閉環。而在實際的測試中,它在鏈條前半段的“防守和驗證”上已經登峰造極,甚至反超了 Mythos 5和 GPT-5.6 Sol,但在深入的漏洞利用階段仍有提升空間。官方還透露了,除了Hugging Face事件,GLM-5.3還曾協助處理另一起AI發起的攻擊事件。當時,FOFA 的追蹤分析引擎 Ferret 敏銳地察覺到巴西一臺臨時文件服務器有些不對勁。當安全人員把 GLM-5.
3 接入分析後,順藤摸瓜,一個名為 "Neo" 的未知 AI Agent 黑客終於浮出水面。這個被稱為 "Neo" 的 AI 黑客胃口極大,它打算獵殺某國的會計師事務所、稅務服務公司和記賬機構。在短短不到兩個月的時間裡,這個 AI 黑客就已經瘋狂擴軍,名下管理著 4 臺黑客服務器、7 個惡意域名、6 萬個用於轟炸的郵箱以及 100 多個自動化攻擊腳本,在短時間內扔出了 18567 封高度擬真的釣魚郵件。面對數千個開放目錄、數萬份雜亂日誌,這種高度碎片化、海量且由 AI 生成的攻擊線索,如果單靠純人工分析,幾乎是個不可能完成的任務。而 GLM-5.
3 在介入後,迅速在垃圾信息裡提取出關鍵線索、自動關聯跨服務器的攻擊行為,最終輔助安全研究人員,完整還原出了整條被埋藏在深處的 AI 攻擊鏈條。這可能也是大模型安全史上的一個里程碑事件:人類用“防禦 AI”,第一次死死狙擊了“攻擊 AI”。此外,它還協助挖出了一個潛伏在互聯網底層 DNS 協議規則本身、長達 40 多年的世界級隱患。這個漏洞不是某家公司的代碼寫錯了,而是互聯網底層基建的“出廠設計缺陷”。攻擊者只需要發送極少量的特殊請求,就能把服務器的計算壓力瞬間放大近 8 萬倍,能在一夜之間癱瘓全球超過 1000 萬處公網 DNS 服務。
如果被惡意引爆,全球的網站訪問、郵件收發、雲服務全得瞬間停擺。幸運的是,這些漏洞被翻出來後,已經全部進入了 CNVD 國家漏洞庫的協同修復流程。就像安全圈廣為流傳的那句話:對於防守方而言,最好的安全,事故沒有發生。03一切強大,源於後訓練GLM-5.3 的發佈,可以說給正在尋找新增長曲線的大模型行業,投下了一塊極具重量的新路標:當預訓練的參數紅利逐漸見頂,後訓練到底能釋放多大的能量?智譜能靠後訓練實現跨越式提升,背後的技術底牌究竟是什麼?答案藏在一套彼此協同、層層遞進的後訓練技術體系裡。
架構優化 IndexShare、強化學習算法 SAO、分佈式後訓練框架 Slime,三者分別從算力成本、算法穩定性、工程規模化三個維度,重新定義了大模型後訓練的效率天花板。要做深後訓練,先要解決的是長上下文的算力成本。隨著 Agent 任務鏈條不斷拉長、工程環境複雜度持續提升,模型需要處理的上下文長度動輒突破百萬 Token。動態稀疏注意力機制雖然能從原理上降低注意力計算量,但每層都需要配置獨立的索引器,通過點積計算和 Top-K 篩選判斷哪些 Token 需要被關注,這筆索引計算的開銷反而成了新的瓶頸。可以簡單理解為,為了省下趕路的成本,反而在導航上花了更多的錢。
IndexShare 就是負責省算力的架構優化方案。它的核心思路是不再給每一層 Transformer 都配備獨立的索引器,而是讓每 4 層共享同一個輕量級 Indexer。這種分層複用的設計,在 1M 上下文長度下將單位 Token 的 FLOPs 直接降低了 2.9 倍。它不僅釋放了推理側的算力空間,更重要的是為後訓練階段引入更長的任務軌跡、更復雜的多文件工程環境掃清了成本障礙,讓長程強化學習變成了 “可落地的常規操作”。算力問題解決了,強化學習本身的穩定性難題,又是長程 Agent 訓練面前另一難題。傳統的同步 PPO、GRPO 等算法,都遵循 “湊齊一整批數據再統一更新” 的邏輯。
訓練節點要等所有推理節點跑完軌跡才能開始參數更新,推理節點也要等參數同步完成才能開始下一輪採樣,兩邊互相等待不僅造成大量算力空耗,一旦遇到個別長難任務拖慢整體進度,還會出現 “掉隊者效應”,嚴重時甚至引發訓練死鎖。而在長程任務中,傳統方法往往訓練到 160 步左右,就會因為策略偏離正軌而徹底崩潰,根本撐不起完整的長週期工程任務訓練。SAO出現是為了保證不崩盤。它徹底拋棄了批量同步的傳統思路,實現了單軌跡級別的異步化訓練:模型每跑完一條完整的任務軌跡,不需要等待其他樣本完成,直接送入數據緩衝區,訓練端就可以立刻讀取數據開始參數更新。這種設計直接解耦訓練和推理,按最優效率運行,大幅提升硬件利用率。
還讓長程強化學習的穩定性更上一個臺階,以前傳統方法撐不過 160 步的長鏈條任務,現在可以穩定支撐超過 1000 步的連續訓練,模型終於有機會學習到從需求拆解到調試交付的完整工程閉環。而Slime 後訓練框架的作用就是承接起 IndexShare和 SAO的超級流水線,讓強化學習(RL)可以大規模跑起來。Slime 採用了一種“訓推分離”的流水線思路。
它把整個後訓練拆成了三件事:首先是推理生成(Rollout),模型在沙箱和終端環境中執行任務、編寫代碼並獲取反饋;其次是分佈式訓練(Training),系統接收這些反饋數據並快速更新模型權重;同時,通過數據緩衝區(Data Buffer)作為中介,推理和訓練兩個環節可以異步獨立運行,從而大幅提升了整體計算效率。以前要訓練一個千億參數模型的強化學習,動輒需要幾周時間,而智譜用 Slime 框架,把這個過程縮短到了 2 到 3 天。這意味著,大模型的後訓練變成了一個可以快速試錯、天天迭代的常態化流程。放到整個行業的視角來看,GLM-5.3 的出現,其實是一個明確的行業信號。
2026 年的大模型行業,參數競賽的上半場已經逐漸落幕,DeepSeek、OpenAI、Anthropic 等頭部廠商都在尋找新的增長曲線,而 GLM 用實際成果證明,後訓練就是那條確定的賽道。當把將基座能力“練深、練透、擠出水分”,大模型的價值挖掘,才剛剛進入深水區。參考鏈接:https://mp.weixin.qq.com/s/JdBx3B12L7Mhxruf4Nfr4g上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

王興興“錯配”梁文鋒?
王興興“錯配”梁文鋒?字母榜2026.08.24 17:44 · 來自河北全文4818字00:00 / 13:21關於世界模型,宇樹和DeepSeek理念分歧明顯。文 | 字母榜宇樹科技的股價還在持續下跌。市值從上市首日的4449億元高點,跌至2400億元,截至8月24日收盤,市值較最高點蒸發了2000億元。然而比股價更值得關注的是,宇樹接下來要怎麼走。8月20日,也就是宇樹上市第二天,王興興出現在北京世界機器人大會論壇。十多分鐘的分享裡,AI成為了高頻詞彙。他談到AI實時生成、實時識別,也談到AI模型投入,更透露了宇樹正在預研的一件事:讓物理AI機器人實現“自進化”。王興興講的每一件事,最後都指向一個關鍵要素:AI大模型。特別是最後一點,王興興說,要實現“物理AI自進化”,要用目前最前沿、最頂尖的AI大模型來驅動。而這恰恰是宇樹目前不太擅長的部分。不過,宇樹找到了DeepSeek。今年8月,兩家公司已經達成合作,圍繞AI大模型與具身智能相關技術展開合作。說到具身智能公司和AI大模型公司的合作,就不得不提當年Figure AI和OpenAI的合作。2024年,OpenAI在投資Figure AI後,雙方簽署了三年合作協議,合作開發人形機器人AI模型。但是僅一年後,FigureAI終止合作,轉向自研。於是問題來了:王興興和梁文鋒,會不會重走Figure AI和OpenAI的老路?01為什麼宇樹需要DeepSeek?對於宇樹來說,過去幾年,模型研發已經有了一些積累,但顯然投入不足,進展緩慢,所以找到一個頂尖的AI大模型公司合作,是一個比較自然的選擇。先來看宇樹目前的模型研發進展。當前,具身智能大模型沒有一個統一的技術路線,但VLA和世界模型,是行業重點探索的兩個方向。行業甚至也在探索兩者融合的技術路線。宇樹也在摸索,採取了“兩條腿走路”的策略,並行研發兩種模型。所謂VLA(視覺

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。