GLM-5.3發佈,基座沒變,能力卻漲了

2026年8月14日 14:15
GLM-5.3發佈,基座沒變,能力卻漲了
站內 AI 整理稿

Leo張ToB雜談2026.08.14 14:13 · 來自四川全文3769字00:00 / 11:05GLM-5.3的發佈證明了後訓練Scaling的潛力。過去的幾個月,國內外大模型廠商都迎來了新一輪的版本更新,4月,OpenAI發佈GPT-5.5版本,並於近日將免費用戶默認模型升級為GPT-5.6 Luna;7月中旬,月之暗面發佈Kimi K3;8月初,DeepSeek V4 Pro正式上線;阿里Qwen3.8-Max以2.4萬億參數規模開放API訪問......8月3日,ZCode官網短暫上線了“ZCode for GLM-5.3”頁面,官方說明文檔也對外開放了大約一個小時。

那次“意外洩露”讓智譜股價當天漲超8%。一週後,高盛上調智譜收入預期35%。直到8月14日,智譜AI也正式發佈了新一代基座模型GLM-5.3。該模型總參數規模7430億,在編程能力和複雜工程執行等核心人物上取得突破。讓人意外的是,GLM-5.3的技術路徑——基座模型沒變,但能力卻提升了不少。智譜在官方公告中明確寫道:“與GLM-5.2相比,基座模型沒變,但通過極致的後訓練Scaling大大提高了模型的智能上界。”此外,GLM-5.3在白盒代碼審查與漏洞推理等安全任務中的表現接近Mythos 5,在網絡安全防禦場景中的表現讓人眼前一亮。GLM-5.3到底要“升”什麼?要理解GLM-5.

3的分量,得先看看GLM-5.2走到了哪一步。6月13日,智譜開源了旗艦模型GLM-5.2。這款模型交出了一份相當漂亮的成績單:混合專家(MoE)架構,總參數量約7530億,上下文窗口達100萬token。在國際人工智能獨立評測機構Artificial Analysis的綜合能力評測榜單上,GLM-5.2拿下51分,位列開源模型最佳水平。富瑞發佈研報稱,GLM-5.2在Artificial Analysis模型智能指數中排名全球第三,為中國模型首次打入前三位,在編程及智能體能力上分別排名全球第四及第二。換句話說,GLM-5.2已經是國產開源模型裡跑得最快的那一個。

但大模型這行,沒有“守成”一說,直白點說,你不跑,別人就會超過你。與GLM-5.2相比,GLM-5.3基座模型並沒有改變,但通過極致的後訓練Scaling大幅提升了模型的智能上界,主要體現在了數十倍的長程任務環境、更豐富的環境類型,以及超長的後訓練時間。具體到能力層面,在編程能力方面,相比GLM-5.2,GLM-5.3體感評測提升50%,據智譜AI方面透露,GLM-5.3在包括Terminal Bench 3.0在內的公開基準測試中,在開源模型方面排名第一。其中,在Terminal Bench 3.0上,GLM-5.3的得分從4.6提升到28.3;在DeepSWE v1.1上,得分從46.

2提升至66.9;在Agents' Last Exam 上,得分也從23.8提升至28.5。在GDPval-AA v2中,GLM-5.3得分1769,展現基於編程能力湧現的專業任務執行能力。這些結果表明,GLM-5.3不只擅長做出一個好看的Demo,更能接住複雜的大目標,在數萬行代碼、上百個文件和多個相互依賴的系統之間持續推進。在極少人工干預的情況下,它也能長時自主開發、反覆驗證,最終把項目推進到可交付狀態。從GLM-5.2開始,智譜引入了effort level(思考檔位)控制。在相近Token預算下,GLM-5.3在任務完成質量、執行速度和使用成本之間取得了更好的平衡。

安全能力值得期待如果說編程能力的提升是GLM-5.3的基本操作,那麼網絡安全能力的湧現就是一條更值得關注的驚喜。在網絡安全能力方面,GLM-5.3在白盒代碼審查與漏洞推理等安全任務中的表現接近Mythos 5,相信後續再網絡安全防禦實戰場景中能發揮比較大的價值。智譜在官方公告中坦承:“安全能力的出現並不偶然,安全工作本質上是約束嚴格的編程能力。”從2025年9月開始,智譜就在這個方向投入研究,與國內多家頭部安全實驗室一同推進更多長程任務環境,構建更專業化的評測與執行框架。在CyberGym測試中,模型從白盒源代碼出發,通過觸發程序故障來識別和驗證漏洞。GLM-5.3得分為83.

5%,高於GLM-5.2的77.2%,與Mythos 5的83.8%和GPT-5.6 Sol的83.6%基本相當。在更考驗深度推理能力的ExploitBench中,模型需要進一步理解真實漏洞的成因並完成相應的利用。GLM-5.3得分為54.4%,是GLM-5.2(24.4%)的兩倍多,但仍低於Mythos 5的78.0%和GPT-5.6 Sol的73.5%。在ExploitGym中,模型在限定時間內完成漏洞利用任務的數量。GLM-5.3在兩小時內完成105項任務,六小時內完成130項,而GLM-5.2分別只完成29項和39項。Mythos 5仍然領先,兩個時間段分別完成181項和247項。

這三個基準呈現出一個清晰的趨勢:越接近漏洞利用鏈的前端,GLM-5.3的提升越明顯;越深入完整的漏洞利用,模型與Mythos 5等閉源前沿模型之間的差距也越大。換句話說,GLM-5.3在發現漏洞這個環節已經追上了全球頂尖水平,但在利用漏洞這個更深的環節還有不小的距離。這既是差距,也是方向。之所以讓筆者對GLM-5.3在網絡安全的能力有所期待的是,智譜AI官方發佈的真實案例。GLM-5.3聯合國內安全團隊發現2404個漏洞,其中1088個為中高危,最早可追溯至約40年前,部分漏洞存在於Android、Windows、macOS、APP等人們每天使用的軟件中。GLM未來猜想GLM-5.

3交出了一份漂亮的成績單,但它面前仍然擺著三個必須回答的問題。首當其衝的就是視覺。GLM-5.3的升級有一個容易被忽略的細節:它依然是一個純文本模型。此前,智譜首席科學家唐傑在社交平臺上發起全球意見徵集,為GLM-5.3收集功能建議,瀏覽量超過40萬。評論區被一個詞刷屏了:視覺。開發者想要的,是能看懂截圖、能解析表格、能從UI設計圖直接生成代碼的模型。而GLM-5.2雖然性能強勁,但偏偏沒搭載視覺編碼器,看不了圖,也造不出圖。智譜並非沒有視覺技術。這家公司此前發佈過CogVLM視覺編碼器和GLM-5V-Turbo原生多模態模型。但唐傑此前認為多模態對提升AGI智能幫助有限,主張分開發展。

這一策略如今看來需要調整了—開發者的呼聲和市場的競爭態勢都在迫使智譜做出改變。其次是深度漏洞利用的差距怎麼追?ExploitBench上54.4%對Mythos 5的78.0%,ExploitGym上130項對247項,這兩組數字清晰地劃出了GLM-5.3與全球頂尖水平之間的距離。GLM-5.3在漏洞發現(CyberGym)上已經追平了Mythos 5,但在漏洞利用(ExploitBench、ExploitGym)上仍有顯著差距。智譜自己也承認:“越深入完整利用,模型與Mythos 5等閉源前沿模型之間的差距也越大。”這個差距意味著什麼?

在真實的網絡安全攻防中,“發現漏洞”只是第一步,“驗證漏洞”和“修復漏洞”同樣關鍵。如果模型只能發現而不能驗證,安全團隊的工作量依然巨大。智譜需要在這條路上繼續追趕。最後,也是很多大模型公司都需要面對的,商業價值如何體現?智譜2025年全年總營收達7.24億元。這個數字放在大模型賽道里不算小,但對比其市值(即便是經歷了大幅回撤之後)依然顯得不成比例。資本市場對大模型公司的估值,本質上是在為未來的可能性買單。但這種可能性需要被不斷驗證。國內排名前十的互聯網公司中有9家深度集成了GLM系列模型。這是一個不錯的起點,但遠非終點。在政企市場之外,智譜需要在更廣闊的商業化場景中證明自己。

不過,外部環境正在向有利於智譜的方向變化。8月6日,DeepSeek發佈公告計劃近期整體上調API服務定價。業內人士認為,這一動作打破了此前大模型行業以低價競爭為主的格局。智譜年內已多次上調API價格,如果行業整體漲價成為趨勢,智譜的定價策略將不再顯得“突兀”。高盛已經上調了智譜今年的收入預期35%。但高盛同時將智譜的目標價下調,評級維持“中性”。上調收入預期、下調目標價——這組看似矛盾的操作傳遞了一個清晰的信號:市場看好行業的增長空間,但對具體公司的競爭位置仍持觀望態度。兩個月的迭代週期放在大模型時代是一個不算慢的節奏,GLM-5.

3的發佈證明了後訓練Scaling的潛力(在不更換基座的前提下,靠極致的長程任務訓練和更豐富的環境交互,照樣能榨出大模型更多的智能空間)。這對行業來說是一個值得留意的信號:參數競賽或許不是唯一的路,把現有模型的能力“挖透”同樣能帶來可觀的回報。(文|Leo張ToB雜談,作者|張申宇,編輯丨楊林)

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛