剛剛,GLM-5.3來了!拿下多個開源SOTA,我用它“魔改”DeepSeek Harness

2026年8月14日 15:10
剛剛,GLM-5.3來了!拿下多個開源SOTA,我用它“魔改”DeepSeek Harness
站內 AI 整理稿

(公眾號:zhidxcom) 作者 | 陳駿達 編輯 | 心緣 8月14日報道,就在剛剛,智譜發佈了其最新一代旗艦模型GLM-5.3,並宣佈模型將在兩週內開源。這是一個擁有7430億個參數的模型,和此前的GLM模型一樣主打編程。在多項主流基準測試中,GLM-5.3位居所有已開源或即將開源模型中的第一;其在編程與智能體任務上的能力,已逼近Claude Fable 5、GPT-5.6 Sol等海外頂尖模型。與國內模型相比,GLM-5.3與Kimi K3在編程和智能體領域互有勝負,並在絕大部分基準測試中領先DeepSeek-V4-Pro-0813。而在網絡安全能力方面,GLM-5.

3則展現出一定優勢,領先於另外兩款國產模型。同時,GLM-5.3還在能力和token效率之間取得了更好的平衡。在相同的高檔位思考預算下,GLM-5.3的準確率達到31.5%,超過Claude Opus 4.8的29.5%,任務平均輸出約5萬個token,不到Opus 4.8平均輸出量的一半。在發佈前獲得了GLM-5.3的內測資格,得以提前深度體驗這款模型在真實開發場景中的完整能力。在我們的實測中,GLM-5.

3+ZCode的組合不僅能從0到1開發一款以真實地圖數據1:1復刻上海陸家嘴至外灘區域的3D開放世界駕駛遊戲,還能“裸考”DeepSeek剛開源的Harness框架:在零先驗的條件下讀懂這個超7000個文件的代碼倉庫,再按它的規矩打造出一個“人格插件”。除了編程能力之外,智譜稱GLM-5.3在充分的預訓練之後,還湧現出了不錯的網絡安全能力,在與國內高校、企業的合作中,GLM-5.3用兩週時間揪出了2436個漏洞。在白盒代碼審查與漏洞推理等安全任務中,GLM-5.3的表現與Claude Mythos 5接近。目前,GLM-5.

3已上線智譜的AI編程工具Zcode、效率工具AutoClaw,支持通過GLM Coding Plan使用。同時,這一模型還在TraeWork、WorkBuddy、Qoder、OpenCode等平臺開放了搶先體驗。智譜稱,GLM-5.3的API將很快上線。同時,在模型開源之前,GLM-5.3還將完成安全評估、安全加固,以限制其在網安領域的潛在攻擊能力,保留其防禦價值。體驗鏈接:https://zcode.z.ai/en 博客鏈接:https://z.ai/blog/glm-5.

3 一、拿真實數據1:1復刻外灘建築群,還做了個開放世界駕駛遊戲 此次測試,我們用到了智譜最近更新的ZCode,搭配旗艦模型GLM-5.3。我們交給GLM-5.3的第一個任務是一份有難度的產品需求文檔:以真實的OpenStreetMap數據為基礎,開發一款上海陸家嘴至外灘區域的3D開放世界駕駛遊戲。文檔中要求,地圖解析、座標轉換和遊戲邏輯等關鍵模塊全部讓模型“手寫”,只允許使用Three.js的底層渲染能力。為了測試模型在長任務中的記憶可靠性,我們還在文檔中部埋下了兩條“陷阱條款”,包括凌晨兩點到四點外灘建築燈光熄滅一半,以及地圖邊緣需要設置帶有提示的軟性阻擋。GLM-5.

3拿到需求後先驗證了數據的真實形態。它編寫腳本從Overpass API拉取了8萬多個OSM節點,先做了一輪數據勘查,確認地圖數據的完整性後,才開始開發。整個開發過程持續了多輪,最終交付了約4900行代碼,覆蓋數據管線、車輛物理、車輛音效、導航、晝夜循環和存檔系統,兩條埋雷條款在最終驗收中全部通過。開發過程中,可以觀察到GLM-5.3排查問題的思路很清晰。測試早期,遊戲頁面完全卡死,它沒有盲目改動代碼,而是給本地服務器加了請求探針,通過麵包屑日誌定位到問題。在精準定位後,GLM-5.3修復bug的效率得到了提升。比如,當我提出遊戲相機視角存在問題,有時會穿過建築時,GLM-5.

3從這條模糊的描述出發,統計出全部6300多棟建築中有大約4成的輪廓環繞方向與牆面法線約定相反,從而導致了上述問題,實際修復只改了幾行代碼。因為測試環境無法直接目檢畫面,它甚至自己寫了一個零依賴的PNG解碼器,用像素統計來客觀證明水面、標線和夜間燈光確實被正確渲染。值得一提的是,搭配ZCode使用時,整個對話的平均緩存命中率達超過了99%,可以節省不少錢。不過,在這一項目的開發過程中,我們也發現了GLM-5.3的一些短板。工程能力之外,它的審美判斷還有提升空間,建築貼圖和道路標線的觀感先後經過四輪人工反饋,還是沒能達到預期,略顯簡陋。總體來看,GLM-5.

3搭配ZCode基本可以順利完成用戶交代的開發任務,但用戶仍需要給模型提供一定的反饋,才能打磨出更好的交付物。二、讀懂超7000個文件,連夜打造DeepSeek Harness“人格插件” 如果說駕駛遊戲考察的是GLM-5.3從零創造的交付能力,第二項實測考察的則是另一個方向:面對一個完全陌生的大型代碼倉庫,能否讀懂它,再按它的規矩改造它。我們的測試對象是DeepSeek昨天剛剛開源的DeepSeek Harness,一個採用“一切皆插件”架構的智能體框架。這個monorepo包含40多個頂層包、200多個工作區項目、7400多個文件。對GLM-5.

3來說,這是一次“裸考”:DeepSeek Harness倉庫發佈僅一天,它的訓練數據裡不可能有任何相關信息,對這個框架的全部認識只能來自現場摸索。第一項任務是倉庫級理解。我們向GLM-5.3詢問,用戶執行dsh web之後,從進程啟動到第一條消息抵達模型,中間經過哪些模塊,插件如何加載,出錯時又如何兜底。面對這種體量的代碼倉庫,GLM-5.3派出了4個並行探索子智能體,分別追查CLI入口、插件機制、模型契約與消息通路,再把四份結論匯成一份鏈路報告,並回頭逐條核對關鍵代碼。這些文件的跨度較大,而GLM-5.3成功地找到了它們之間的聯繫。

報告的關鍵結論有三條:插件的裝配依據一份YAML清單逐行登記,不存在目錄掃描式的自動發現;順著這條線索,它鎖定了LlmAdapter這份所有模型提供方共同遵守的契約;啟動失敗時的策略是快速失敗,而非靜默跳過。在此基礎上,我們進一步要求GLM-5.3為DeepSeek Harness開發一個“人格插件”,讓AI的回覆可以在文言文、東北話與貓語之間切換。這項任務的難點在於要做到“零侵入”:我們要求GLM-5.3開發的結果功能要生效,但框架的原有行為不能變,插件關閉要立刻復原。GLM-5.

3先派出2個探索子智能體並行通讀倉庫,約5分鐘後各自提交報告,研究頁面交互方案時又派出第3個,3個子智能體合計消耗約690萬token。規範摸清後,它選定系統提示註冊表作為注入口:指令隨系統層下發,用戶消息沒有改動;插件卸載後註冊表自行摘除。下方是GLM-5.3最終交付的插件效果。可以看到這個插件的交互體驗是比較原生的,可以與DeepSeek Harness的其他插件出現在同一個菜單欄中,切換後語言風格的確符合要求。再來看看具體的執行過程。初版交付涉及20個文件、淨增560行,除代碼外還包含雙語文檔配對記錄與重新生成的依賴圖。

同時,配套的11條單元測試一次通過,覆蓋開啟注入、關閉復原與三人格路由等功能。不過,在跑全量回歸的時候出現了一段插曲:771個測試文件中有6個失敗。為排查問題,GLM-5.3先將自己的改動整體撤下,在乾淨基線上重跑同一批用例,失敗原樣復現。據此,它確認問題源於本機環境,與新增代碼無關。在解決環境問題後,應我們要求,GLM-5.3複用了DeepSeek Harness既有的命令機制,將人格切換接入網頁端,鍵入一條斜槓命令即可切換人格,前端基本沒有新增代碼,28項文檔門禁與937對雙語文檔檢查全數通過。從結果看,GLM-5.

3在本輪實測中的長板是任務拆解、跨包溯源與代碼引用,以及對陌生工程規範的理解和遵循,對照實驗的處置方式也比較嚴謹。不過,體驗時我們也發現,ZCode在一些長任務執行期間存在反饋不足,我們一度以為進程中斷,人工打斷了執行。同時,對於一些風險很低的修改,GLM-5.3也會跑完整的檢查與測試,這在有些場景下可能會帶來不必要的token消耗。DSH“人格插件”開源地址: https://github.com/chenjunda0018-sketch/A-persona-plugin-for-DeepSeek-Harness 三、能力提升來自後訓練Scaling,網安能力湧現 智譜在GLM-5.

3博客中,詳細介紹了這款模型在技術方面的思考。GLM-5.3的基座模型與GLM-5.2完全一致,其能力提升主要來自於後訓練的Scaling。GLM-5.3在後訓練過程中經歷了更長的任務環境,更豐富的環境類型,後訓練時間也明顯加長。隨著任務環境的不斷豐富,智譜還觀察到GLM-5.3湧現出超預期的網絡安全能力。例如,在白盒源代碼安全基準測試CyberGym中,GLM-5.3得分為84.5%,超過GLM-5.2(77.2%)、Claude Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)。

在更接近完整漏洞利用的ExploitGym測試中,2小時內,Mythos 5完成了181個任務,GLM-5.3完成105個任務,達到Mythos 5約58%的水平,相比GLM-5.2的29項提升明顯。GLM-5.3發佈前兩週,智譜聯合清華大學、南開大學,以及雲起無垠、綠盟科技、賽博崑崙、DARKNAVY、華順信安、奇安信、騰訊玄武、雲鼎實驗室等多家安全團隊,開展了密集的紅隊測試與安全評估。

相關測試最終在2周內累計發現漏洞2436個(經過初篩、去重),其中1097個為中高危,最早可追溯至約45年前,代表性漏洞覆蓋系統內核、操作系統、瀏覽器引擎、開源基礎組件、互聯網應用與互聯網協議等269個項目,相關漏洞均已報送國家CNNVD/CNVD國家漏洞庫,為提高披露過程的透明度,智譜建立了Z.ai安全披露賬本,記錄漏洞從發現、確認到修復的全過程。執行效率方面,智譜自GLM-5.2開始引入effort level(思考檔位)控制。智譜稱,在相近Token預算下,GLM-5.3在任務完成質量、執行速度和使用成本之間取得了更好的平衡。

結語:智譜、DeepSeek等紛紛重押後訓練,不換基座也能換代 從我們的實測來看,GLM-5.3已經能在真實工程現場交出完整的交付物;而審美判斷等短板,或許可以成為下一輪後訓練繼續打磨的方向。後訓練這條路線近期的受益者不止智譜一家:DeepSeek-V4正式版能力的大幅提升,同樣與後訓練階段的投入有關。在預訓練的數據與算力紅利逐漸見頂之後,後訓練正成為頭部模型廠商進一步提升性能的關鍵方向,其潛力很可能還未被充分挖掘。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛