GLM 5.3 更強卻更難用了?我們讓它和 5.2 做了同一個北京城市駕駛遊戲
官方強調 GLM 5.3 安全能力大幅提升,實測卻發現這套安全機制在自動化工具鏈中頻繁觸發拒絕,導致開發流程中斷。作者丨吳海明 編輯丨李 娜 大家還記得《極限競速:地平線》裡那種在開放世界中自由駕駛、穿梭城市與道路的體驗嗎?地平線遊戲圖這次,我們用一個類似思路、但更貼近真實工程開發的題目來考一考 GLM 5.3:從零開發一款基於 OpenStreetMap 真實數據的「北京國貿 → 望京」區域 3D 開放世界駕駛遊戲,5.3 需要在瀏覽器中單機運行,不依賴任何在線服務,並且最終交付一個可啟動、可驗證、可斷網運行的完整項目。GLM 5.
3 是智譜在 2026 年 8 月 13 日發佈的最新旗艦模型,對比上一代旗艦 GLM 5.2,GLM 5.3 使用同一個底座,主要通過更大規模、更貼近真實工程場景的後訓練,增強複雜編程、長程任務、工具調用和項目交付能力。同時,GLM 5.3 還有一個值得關注的變化:官方強調其網絡安全能力明顯增強,模型在風險識別、安全判斷和複雜系統分析上更強。網絡社區對於GLM5.3安全能力的評價能力增強之後,也帶來了新的使用感受,最近有小紅書用戶吐槽,GLM 5.3 似乎出現了“過度防禦”:也有人反饋 5.3 寫出的文案越來越難懂,“全是黑話”,即使反覆修改提示詞也沒有明顯改善。
這些反饋指向同一個問題:GLM 5.3 變強之後,是否也變得更謹慎、更難駕馭?網絡社區網友反饋截圖對此,我們設計了一次更貼近真實工程場景的對照測試。為了更直觀地觀察模型迭代效果,我們選取 GLM 5.2 作為對照組,在同一題目、同一需求下比較兩者的真實世界還原度、項目完成度、工程交付能力和最終運行效果。先說結論,最終,GLM 5.3 和 GLM 5.2 都能端到端完成項目,GLM 5.3 不僅完成速度更快,也更懂得把光影、路燈、HUD、導航和速度反饋等細節組織成更真實的駕駛體驗。不過測試也印證了前面的用戶反饋:GLM 5.
3 更強的安全能力確實帶來了新的適配問題,模型因為安全判斷增強而變得更謹慎,在自動化編程交互中更容易觸發拒絕判斷;當它接入自動化開發工具鏈時,這種“謹慎”甚至可能讓原本正常的開發流程被意外卡住。01實測 GLM 5.3:從零開發「北京國貿到望京」的 3D 開放世界駕駛遊戲在這次實測中,我們選擇智譜官方發佈的 ZCode 作為開發環境,讓 GLM 5.3 面向真實開發場景展開實測:從零開發一款基於 OpenStreetMap 真實數據的「北京國貿→望京」區域 3D 開放世界駕駛遊戲。為更直觀觀察模型迭代效果,本次測試同時選取 GLM 5.
2 作為對照組,在相同需求下比較兩者的真實世界還原度、項目完成度、工程交付能力與最終運行效果。具體題目如下:以 OpenStreetMap 真實數據為基礎,從零開發一個"北京國貿→望京"區域的 3D 開放世界駕駛遊戲,單機瀏覽器運行,不依賴任何在線服務。要求:1.用腳本從 Overpass API 拉取該區域路網與建築數據,先勘查數據完整性再動工;2.車輛有基礎物理(加速/轉向/碰撞);3.晝夜循環,且【工作日早 7:00-9:00 主幹道車流密度翻倍】;4.地圖邊緣用【軟性阻擋】處理(車輛被自然減速推回,不允許報錯或瞬移);5.含導航、音效、存檔系統;6.
交付可運行項目+README(含一條命令啟動方法);README 中說明如何驗證第 3、4 條特性;7.完成前自行做啟動冒煙驗證(如 node --check / 本地起服務確認無報錯),再把啟動方法寫入 README;8.交付後【運行時零網絡請求】:開發期聯網拉取的數據與所有第三方庫/資源(含 CDN 引用)必須本地打包, 斷網狀態下游戲可完整加載與運行;9.README 註明運行環境要求(如 Node/Python 版本、推薦瀏覽器)。技術棧與項目結構(單文件 HTML 還是多文件工程、用什麼渲染方案)不做限制,由你自行決策,並在 README 中用一段說明選型理由。
從測試題目可以看到,這是一次覆蓋數據獲取、工程搭建、三維渲染、交互控制、交通規則、離線交付和項目文檔的綜合性開發測試。模型需要理解北京國貿到望京這一真實地理場景,並將開放地圖數據轉化為可運行的 3D 駕駛空間,並圍繞車輛控制、NPC 車流、晝夜變化、導航系統和存檔機制搭建完整玩法閉環。如下面 2 張圖所示,GLM 5.3 與 GLM 5.2 均能端到端一次性完成項目開發,並完成冒煙測試和自動化部署。兩個模型最終開發的項目都支持一鍵啟動,且完成全部任務要求,實現了從自然語言需求出發,完成項目規劃、代碼實現、資源組織、運行驗證和文檔交付的完整鏈路。GLM 5.
3 開發的「北京國貿→望京」 3D 開放世界駕駛遊戲截圖,更多真實世界的元素:路燈、誇張的路標等GLM 5.2 開發的「北京國貿→望京」 3D 開放世界駕駛遊戲截圖為了更好理解兩個模型在這個小型系統級別開發任務的表現,我們通過完整測試與體驗後整理瞭如下判分表格:具體來說:GLM 5.3 首先編寫了獲取數據的腳本,從 OpenStreetMap 拉取北京國貿至望京區域的真實路網與建築數據,並在開發前生成勘查報告,統計出路網 4,671 條、約 1,091 公里,建築 7,103 棟,同時檢查高度標籤比例和異常幾何情況。後續構建中,GLM 5.
3 將真實經緯度投影為米制平面座標,並生成包含 6,541 個節點、13,513 條有向邊的路網圖。在遊戲設計上,設計了車輛加速、轉向和碰撞三項基礎物理特性,其中轉向採用自行車運動學模型,碰撞則覆蓋建築和交通車,並通過 2,300 多幀自檢驗證穩定性。此外,GLM 5.3 在工作日的 7:00-9:00 實現了主幹道車流翻倍,從數據能查到主幹道車流從 44 輛爬升至 70 輛、再到 80 輛的記錄,不過支路車流保持不變;地圖邊緣軟阻擋也完整實現,車輛頂著油門撞向邊界時越界深度穩定在 0.7 米,鬆油門後可緩慢回推。最後,GLM 5.3 還實現了自動化導航、12.
62 公里國貿至望京 SOHO 路線規劃、92 段路徑、偏航重算、小地圖設點、手動與自動存檔,以及包含啟動方法、驗證說明和技術選型的 README,整體更接近一個可直接體驗的瀏覽器端 3D 駕駛遊戲原型。GLM 5.2 也完成了端到端項目開發,並展現出較強的工程穩健性。5.2 先進行數據勘查,再進入遊戲開發流程,獨立勘查腳本會按道路等級統計長度、檢查幾何損壞比例,並在數據不達標時直接報錯退出,最後 GLM 5.2 獲取到路網約 1,243 公里、建築 8,417 棟,幾何損壞為零,並進入遊戲實現階段。在地圖還原方面,GLM 5.
2 基於真實 OSM 經緯度座標進行換算,截圖核驗顯示道路和建築位置能夠與真實城市空間對應;車輛系統方面,它完成了加速、轉向和碰撞,並加入空間網格加速碰撞查詢。早高峰規則經過腳本實測:工作日 7 點半主幹道車輛達到 169 輛,高峰前後為 85 輛,約為翻倍,週末同時段不觸發;地圖邊緣軟阻擋也通過高強度測試,車輛以 108 km/h 全速衝向邊界後,車速被壓低至約 5 km/h,始終無法出界,鬆油門後約 13 秒緩慢回推,且每幀位移不超過 0.5 米,無瞬移和報錯。導航方面,它規劃出國貿至望京 SOHO 約 14.
4 公里的路線,支持轉向箭頭、剩餘距離、小地圖路線顯示和偏航重算;存檔系統支持每 5 秒自動保存和關閉頁面前保存,刷新後可恢復位置、時間、里程和導航目的地;README 也較完整,配有白天、夜晚截圖及多輪啟動驗證記錄。先說結論。整體來看,兩個模型都能端到端完成項目開發,但在效率和技術取向上有所不同。GLM 5.3 更像面向產品體驗的快速原型開發搭檔,而 GLM 5.2 則更像強調可驗證、可兼容、可離線運行的工程執行者。1.從時間上來說,GLM 5.3 用時 50 分 47 秒,較 GLM 5.2 的 66 分 1 秒快了約 15 分鐘。2.在代碼規模接近的情況下,GLM 5.
3 產出 3,104 行代碼、14 個文件,GLM 5.2 產出 3,063 行代碼、20 個文件,前者結構更集中,後者拆分更細;3.運行交付方面,兩者均實現一鍵啟動,且都通過斷網可玩驗證,GLM 5.3 把遊戲運行所需的核心程序文件都打包到本地,而 GLM 5.2 的離線方案更徹底,不僅不需要聯網加載任何資源,甚至不用啟動本地服務,直接打開文件也能運行;4.技術選型上,GLM 5.3 採用 three.js ES Module、fetch 加載和實時陰影,更接近現代前端 3D 項目,也更利於畫面表現與後續擴展,GLM 5.2 則採用 three.
js r147 UMD 直載和零構建路線,更強調簡單、穩定和環境兼容性。5.整體而言,GLM 5.3 更像面向產品體驗的快速原型開發搭檔,而 GLM 5.2 則更像強調可驗證、可兼容、可離線運行的工程執行者。從測試人員的實際體驗來看,兩個模型開發的駕駛系統都已能較好還原從國貿到望京的城市駕駛感受,包括多車道行駛、道路兩側高樓、車輛碰撞、早高峰排隊以及併線插隊等場景,整體已經具備開放世界駕駛原型的可玩性;不過,兩者在沉浸感和操控細節上仍有明顯差異。相比 GLM 5.2,GLM 5.
3 的版本加入了更多真實城市元素,例如路燈、光影變化和路標提示,畫面層次和真實世界還原度更高,速度控制也更接近實際駕駛體驗,玩家在加速、超車和變道時能獲得更自然的反饋;GLM 5.2 雖然功能完整,但測試中發現左右鍵接反、車頭朝向公式錯誤等問題,同時其速度設定更為保守,最高速度僅約 45 km/h,導致測試人員在超車時經常因為動力不足而與其他車輛發生碰撞。整體而言,GLM 5.3 在可玩性、真實感和產品化體驗上更進一步,GLM 5.2 則更像一個功能完整、規則清晰但駕駛手感相對保守的驗證型版本。02為什麼 GLM 5.3 比 GLM 5.2 具有更多畫面真實感?
在前面的實戰測試可以發現:GLM 5.3 做出的版本更像一個真實城市中的駕駛遊戲,在道路、建築和車輛系統之外,進一步補充了路燈、光影、路標、HUD 提示和更自然的速度反饋,讓國貿到望京這段路線從一個可運行、具備沉浸感的產品原型。要解釋這種真實感從何而來,還需要回到 GLM 5.3 與 GLM 5.2 的模型關係本身,根據官方公佈的信息,GLM 5.3 使用了與 GLM 5.2 相同的基礎模型,其能力提升主要來自後訓練,即 GLM 5.3 的變化更多是在 GLM 5.2 的基礎上,通過更多複雜工程環境、更長程任務和更貼近真實工作流的強化學習訓練,加強了模型對完整項目體驗的組織能力。
據官方技術報告,GLM 5.3 後訓練在 GLM5.2 基礎上進一步擴展到更接近真實專業工作的任務環境中,這類環境更多是要求模型在一個完整工作流中理解目標、操作工具、閱讀代碼、修改工程、運行驗證,並最終交付可用結果。對於一個 3D 駕駛遊戲來說,真實感更多來自地圖數據、道路拓撲、車輛運動、交通規則、導航反饋和界面提示之間的協同。智譜對 GLM 5.3 在這類長鏈路任務上的訓練增強,使其更容易把多個功能模塊組織成一個連貫體驗,而不是隻完成需求清單上的單項功能。官方公佈的榜單數據進一步支撐這一判斷,GLM 5.3 在多個複雜編程和智能體任務基準上較 GLM 5.
2 有明顯提升,尤其是在更強調長程操作和真實工程環境的測試中提升更大。例如,Terminal Bench 3.0 從 GLM 5.2 的 4.6 提升到 GLM 5.3 的 28.3,DeepSWE v1.1 從 46.2 提升到 66.9,SWE-Marathon v1.1 從 19.4 提升到 42.5,AutomationBench v1.0.6 從 26.2 提升到 48.2。這些基準測試衡量的都是模型在複雜環境中持續推進任務、理解代碼庫、調用工具、調試驗證和完成交付的能力。()智譜官網發佈的 GLM 5.3 性能榜單數據對應到這次駕駛遊戲實測,GLM 5.
3 的優勢就體現在從功能實現走向體驗整合,不僅對真實路網、建築、車輛物理、碰撞和導航進行了模擬,還進一步補充了路燈、光影、路標、HUD 提示和更自然的速度反饋,這些細節會顯著提升城市駕駛的真實感。因此,GLM 5.3 比 GLM 5.2 更有真實感,更多是因為後訓練強化了它對複雜項目的整體組織能力,GLM 5.2 更像是把每項功能穩定實現出來。03實測踩坑:GLM 5.3 更強的安全能力,也帶來了新的適配問題在上述實測中,GLM 5.3 的優勢主要體現在開發效率、真實感和複雜工程組織能力上。
但在此次實際測試過程中,最耗時的坑並不來自代碼生成本身,而是出現在模型安全策略與自動化開發工具的銜接上,GLM 5.3 能力變強之後,也變得更謹慎了,下面具體來聊一聊全過程:此次實測最初計劃使用 Claude Code 進行自動化開發,測試人員在一臺全新的 Ubuntu 環境中,同時啟動了 GLM 5.3 和 GLM 5.2 兩個模型的自動化運行任務,並開啟 auto mode on 模式,希望讓兩個模型在同樣環境下獨立完成項目開發。但是一個多小時運行後,GLM 5.2 已經完成了項目開發任務,而 GLM 5.3 還停留在數據校驗判斷的報錯上。
經過分析發現,問題出在模型安全策略上,Claude Code 在自動化流程中,會讓模型判斷當前任務或操作是否可以繼續通過;而 GLM 5.3 在這一判斷環節觸發了更嚴格的安全拒絕,導致後續步驟無法繼續執行。也就是說,GLM 5.3 並不是不會做,而是在涉及安全性的判斷節點上選擇了拒絕,從而讓整個任務流程卡死。兩個模型在 Claude Code 中運行一個多小時後的截圖根據官方報告,GLM 5.3 在 GLM 5.2 的基礎上繼續擴大後訓練規模,其中一個重要變化是網絡安全能力快速提升。如下圖所示,GLM 5.3 在 CyberGym 上得分為 84.5,高於 GLM 5.2 的 77.
2;在 ExploitBench 上,GLM 5.3 得分為 54.4,明顯高於 GLM 5.2 的 24.4;在 ExploitGym 中,GLM 5.3 的 2 小時 / 6 小時成績為 105 / 130,而 GLM 5.2 為 29 / 39。尤其是在更深入漏洞利用鏈的測試中,GLM 5.3 相比 GLM 5.2 的提升幅度更大。官方報告的 GLM 5.3 安全能力榜單從官方表述看,GLM 5.
3 的網絡安全能力並不停留在識別單個漏洞,而是具備跨多個階段理解漏洞利用鏈的能力,這類能力提升則帶來兩方面影響:1)模型在複雜系統分析、風險識別和安全推理上更強;2)模型在涉及自動化執行、權限判斷、代碼運行和安全邊界時,可能會採取更嚴格的行為約束。這便解釋了 GLM 5.3 明明在複雜編程和 Agent 任務上更強,卻在 Claude Code 的自動化流程中一度無法推進。因此,這次測試也得出另一個實用的經驗:當模型從代碼生成器進化為更強的 Agent 後端後,測試重點不能只看它最終能不能寫出項目,還要看它能否與現有 Agent 工具鏈順暢協作。04總結:GLM 5.
3 把能力訓練得更像「產品開發者」通過這次測試可以得出:GLM 5.3 相比 GLM 5.2 的變化,技術上主要來自後訓練,效果上則體現為更強的複雜任務完成能力和更好的產品化表現。GLM 5.3 不是在 GLM 5.2 之外另起爐灶,而是在相同基礎模型之上,通過更大規模、更貼近真實工程場景的後訓練,強化了長程任務、工具使用、代碼修改和項目驗證能力。因此,在本次國貿到望京 3D 駕駛遊戲實測中,GLM 5.3 不只是更快完成項目,也更容易把功能組織成體驗:道路、建築、車輛、導航、HUD、光影、路燈和速度反饋被整合成一個更完整的駕駛原型。證明了 GLM 5.
3 更懂得如何把複雜需求轉化為可運行、可感知、可體驗的產品。相比之下,GLM 5.2 更像一個穩健的工程執行基線,紮實完成數據獲取、路網構建、車輛控制、交通規則和離線運行等核心任務,結果可靠、兼容性強、驗證路徑清晰。而 GLM 5.3 則向前走了一步,更好的整體組織能力,讓同樣的需求呈現出更強的真實感和完成度。不過,GLM 5.3 的增強也帶來了一個值得注意的新問題:模型變得更謹慎了。雖然官方強調 GLM 5.3 提升了安全能力,這在安全場景下顯然是必要的,但在本次實測中,這種謹慎也成為自動化開發流程中的最大卡點,GLM 5.3 在某些判斷環節觸發了安全拒絕,導致任務長時間無法推進。
這說明,能力更強的模型並不一定天然帶來更通用的場景適配,當模型具備更強安全攻防能力時,它的使用邊界會自然變窄,交互過程也可能更容易觸發拒絕審查。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

AI寫得太快,人類審不動了,OpenClaw斷更7周,一版吞下1.6萬個PR
OpenClaw 專案因 AI 輔助生成的程式碼過快,最新版本累積高達 1.6 萬個 Pull Request,人類審核跟不上而被迫停更七週。這起事件凸顯開源社群正面臨「AI 狂寫、人類狂審」的失衡挑戰,維護者需花更多時間辨識貢獻真偽。專家建議團隊應提高審查門檻、限制 AI 改動範圍,並正視人類審核能量的有限性。

1.5TB 壓到 214GB:騰訊混元 Hy4 preview 輕量版發佈開源,異構設備可聯合推理
騰訊混元 Hy4 preview 輕量版已開源,透過創新量化技術將 1.5TB 模型壓縮至 214GB,性能損失極小。此版本支援異構設備聯合推理,大幅提升運算速度。
MWA™霸榜全球第一後:無界動力用真實咖啡廳展現物理AI的落地之徑
從“出片”到“出海”,無界動力即將奔赴下一個考場。 作者丨郭 思 編輯丨董子博 沒有刻意的社交氛圍,一人靜坐或幾個好友相聚,手捧一杯咖啡,在音樂與咖啡的交匯中,暫時剝離工作與生活的瑣碎,獲得片刻放鬆與靈感迴響。這是平日裡我們對於休閒時刻美好畫面的印象,也是2026世界機器人大會現場最反差的一幕。
TimesFM-3發佈
TimesFM-3: A zero-shot foundation model for multivariate forecasting August 31, 2026Ayush Jain and Rajat Sen, Research Scientists, Google Research We introduce TimesFM-3, a state-of-the-art time series foundation model t。
J-Zero零數據共進化
近期一篇名為「J-Zero零數據共進化」的研究引起關注,核心概念是讓AI模型在不依賴外部標註資料的情況下,透過彼此對抗與合作持續進化。論文提出一套三方訓練框架,讓不同模型分別扮演挑戰者、求解器與評委,形成動態競爭與回饋機制,藉此突破傳統訓練資料的瓶頸。 具體運作流程中,挑戰者負責設計題目,求解器則嘗試作答,而評委會依據人類偏好對求解結果進行校準與評分。這樣的循環讓模型不是單向被動學習,而是在互相出題、解題與評判的過程中,逐步提升能力。
ElephantBench測長尾盲區
騰訊發布長尾知識基準ElephantBench,內含1094道分歧事實題,用以評估模型在長尾知識上的表現。測試涵蓋32個模型,其中表現最佳的模型也只有52.4%的正確率,顯示長尾知識仍是模型的一大盲區。