GLM-5.3-Flash發佈,多模態終於來了

Leo張ToB雜談2026.08.27 08:40 · 來自北京全文3897字00:00 / 10:34GLM-5.3-Flash是GLM-5系列的首個原生多模態模型。不久前,在OpenCode和OpenRouter上進行了出現了一個名為Ox-Alpha(中文社區稱作牛來)的模型,並迅速成為當週最受歡迎的模型。而就在近日,智譜AI出面認領了這個中文名為“牛來”的模型,就是其最新發布的GLM-5.3-Flash。值得注意的是,GLM-5.3-Flash是GLM-5系列的首個原生多模態模型。
重新定義模型“斬殺線”Ox-Alpha上線首日即衝至OpenRouter榜首,並刷新單日tokens用量歷史紀錄,相較OpenRouter平臺之前最大tokens量提升4倍。能力強只是GLM-5.3-Flash最不值得一提的一個環節,GLM-5.3-Flash帶來的驚喜之一就是將模型的價格“打下來”。原先,大模型有著參數越大、能力越強、價格越貴的定律,OpenAI的GPT-4系列、Anthropic的Claude Opus系列,無不遵循這一定律。就連智譜自己的GLM-5.3,上半年提價後輸出價格也達到了28元。GLM-5.3-Flash的出現,打破了這條曲線。GLM-5.
3 Flash的Artificial Analysis Intelligence分數為57分,超過了上一代旗艦模型GLM-5.2,也高於DeepSeek旗艦模型V4 Pro正式版的53分。在Artificial Analysis Intelligence Index的公開榜單上,GLM-5.3-Flash的57分“遠高於同類模型的中間值(18分)”。而就是這種比肩主流閉源模型的能力,其價格主流模型的四十分之一。官方數據顯示,GLM-5.3-Flash每百萬Token輸入0.8元、輸出2.8元、緩存命中價格0.23元。橫向對比調價後的DeepSeek V4 Flash——其谷時價格分別為輸入1.
5元、輸出4.5元。綜合輸入和輸出成本,GLM-5.3-Flash在絕大多數常規調用場景下比DeepSeek V4 Flash更便宜。而對比Claude Opus 4.8,差距更加懸殊。按當時匯率折算,Opus 4.8每百萬Token輸入約35元、輸出約175元。GLM-5.3-Flash的價格僅為對方的四十分之一左右。“同樣智力,1/40價格,前沿智能,第一次不需要省著用。”智譜在發佈公告中這樣寫道。8月,DeepSeek V4 Flash已經完成了一輪提價。漲價說明市場有強勁需求——也說明“便宜”這件事,在商業上不可持續太久。而智譜在GLM-5.
3-Flash上選擇的路徑恰恰相反:用更低的成本結構,支撐更低的價格,同時不犧牲模型能力。這不再是一個單純的市場營銷動作,而是一次工程能力的驗證。多模態終於來了此前,智譜首席科學家唐傑在社交平臺上發起全球意見徵集,為GLM-5.3收集功能建議,瀏覽量超過40萬。評論區被一個詞刷屏了:視覺。GLM-5.3-Flash是GLM-5系列的首個原生多模態模型。視覺編碼(Visual Coding)並不只是處理圖像,它拓展編程所能觸及的邊界。
對於前端開發、遊戲開發、3D仿真等任務而言,最終產物包括用戶能夠感知的界面、交互或虛擬世界,視覺能力被原生集成進模型中,使其能夠自主判斷何時需要“觀察”,並利用視覺反饋來指導下一步行動。GLM-5.3-Flash的多模態能力,最直接的落點是Coding。傳統編程模型的工作方式是:你給它需求,它輸出代碼,然後你拿去跑、去看效果、發現問題、再把問題喂回給它。這是一個“人”在閉環裡當裁判的流程。GLM-5.3-Flash把裁判也交給了模型自己——視覺能力被原生融入Coding循環,使模型能夠主動觀察界面、渲染結果與交互反饋,並據此持續測試和改進。這意味著什麼?
模型寫完前端代碼,可以自己“看”一下渲染出來的頁面長什麼樣;做完一個遊戲功能,可以自己“玩”一下看看有沒有bug;搭完一個3D場景,可以自己“轉”一圈檢查各個視角是否協調。智譜針對視覺編碼開發了專門的數據合成流水線,重點訓練模型的自我視覺判斷與測試時改進能力。最終生成的軌跡要求模型與環境交互、檢視自身輸出,並進行迭代式改進。這不再是“生成代碼”的單向輸出,而是一個“生成-觀察-修正”的閉環。智譜官方展示:GLM-5.3-Flash在Blender中自主運行了16個小時,沒有任何外部素材,從零搭建了一套約400平方米的專業主廚自宅與測試廚房。這個任務遠不止“寫代碼”那麼簡單。
在Blender中構建一個連貫的3D場景,需要把幾何、材質、光照與空間等知識轉化為一個在不同視角下都保持一致的3D結構。模型需要判斷什麼時候該“看一眼”渲染結果,再用看到的結果決定下一步該做什麼。它要自己決定牆怎麼砌、光怎麼打、廚房動線怎麼規劃——然後看到效果,再調整,再看到效果,再調整。16個小時,一個模型在虛擬世界裡當了一次建築師兼室內設計師兼施工隊。另一個官方展示的案例是復刻遊戲《泰拉瑞亞》。從圖像到可運行工程,從兩小時電影到8分鐘成片,這些實測合集展示的,是一個不僅能寫代碼、還能“看懂”自己寫了什麼的模型。跑在國產卡上GLM-5.
3-Flash最不尋常的地方,或許不在模型本身,而在它跑在什麼上面。過去一週,智譜首次嘗試用一個大規目國產芯片集群,直接承載來自全球開發者的真實線上負載。據瞭解,官方沒有確認具體供應商,也沒有公佈具體芯片數量,但據某些媒體報道,其調用超過10萬張國產芯片,算力供應商或來自華為、摩爾線程與海光,有知情人士透露,訓練或由海光DCU等國產芯片支持。但可以確認的是:Ox-Alpha在OpenCode和OpenRouter上的所有請求流量,全部由國產芯片提供算力支持。這是一次真實的、持續的壓力測試——不是在實驗室裡跑幾個峰值數據,而是讓全球開發者用腳投票。
用戶不知道模型背後是誰、用的是什麼芯片,只根據速度、穩定性和效果決定是否繼續調用。結果,Ox-Alpha成了當週最受歡迎的兩個平臺上的調用冠軍。國產芯片跑前沿大模型,這件事本身就很有挑戰性。單張國產芯片當前面對的主要瓶頸是內存容量和帶寬,而GLM-5.3-Flash又原生支持最長1M上下文,對顯存和通信提出了更高要求。智譜的解法是在SGLang基礎上構建專用推理引擎,並做了一系列激進的內存優化。包括節點內張量並行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合緩存量化以及Layer Split等技術。
核心思路是“以算力換帶寬、以通信換顯存”——用國產芯片相對充裕的算力,去彌補內存上的短板。在集群層面,智譜採用了Encode-Prefill-Decode(EPD)分離式架構。多模態編碼、Prompt預填充和逐Token解碼被拆分為三個可以獨立調度和擴縮容的工作池,讓不同階段按照各自的算力特徵運行。這套方案的效果是:與同一批硬件上的初始基線相比,端到端服務性能提升了3倍。智譜稱,最終硬件效率和單Token成本已經達到與主流英偉達GPU相當的水平。這裡需要做一個重要區分。所謂“1/40”,並不是說國產芯片的硬件推理成本只有海外GPU的1/40。目前並沒有公開數據支持這樣的比較。
更準確的理解是:一款全部由國產芯片集群承載的前沿模型服務,把面向用戶的價格壓到了Claude Opus 4.8的大約1/40。但這已經足夠說明問題。國產芯片不僅可以跑前沿大模型,而且可以在大規模真實流量下跑得穩定、跑得經濟。更值得關注的是智譜形成的一個正向循環。整個推理引擎的構建工作,由GLM-5.3驅動的infra agent大大加速——它協助工程師開發與優化算子、診斷性能瓶頸、改進部署服務棧。“模型優化系統,系統承載模型”,這句話不再是一個願景,而是已經跑通的現實。過去一年,中國大模型公司一直在做兩件事:把模型能力往前推,把推理成本往下壓。GLM-5.
3-Flash在這兩個方向上都邁出了一步——用更少的參數激活、更低的計算量、更高效的注意力機制,實現了與Claude Opus 4.8持平的綜合智能評分;然後用國產芯片集群承接大規模真實流量,把價格壓到了對方的四十分之一。這不再是一個“追趕”的故事。當一款開源、原生多模態、全部跑在國產芯片上的模型,在第三方綜合評測中與全球最受歡迎的閉源旗艦得分持平,而價格只有對方的四十分之一——行業競爭的規則,正在被重新書寫。GLM-5.3-Flash的模型權重已通過MIT許可證在Hugging Face等平臺開源,API同步開放。任何人都可以下載、使用、二次開發。
(本文首發於APP,文|Leo張ToB雜談,作者|張申宇,編輯丨蓋虹達)
Related
相關文章

AI的賬單,不只由科技公司買單
AI的賬單,不只由科技公司買單登頂可選2026.08.27 11:52 · 來自廣西全文6626字00:00 / 19:30AI正在從一個技術變量,變成社會的資源配置變量文 | 登頂可選8 月,英偉達聯合六家大型金融機構,為 AI 基礎設施搭建了規模超過 5000 億美元的融資平臺。隨後,它又為 OpenAI 在美國俄亥俄州的數據中心項目提供最高 1050 億美元的擔保。8 月 23 日,阿里巴巴在香港啟動 800 億港元股票配售,募集資金全部投向芯片、AI 基礎設施和模型研發。這是香港上市公司歷史上規模最大的後續股票發行。另一組變化出現在電網上。今年前七個月,中國全社會用電量同比增長 4.7%,互聯網數據服務用電量增長了 43.3%。過去三年,人們習慣從模型能力理解 AI。到了 2026 年,圍繞 AI 流動的不只有技術和風險投資。AI 正在從一個技術變量,變成社會的資源配置變量。當一項技術走向新的產業週期,它和普通人的關係,也不再取決於每個人有沒有打開 AI 工具。一、互聯網時代,也是從資源流動開始的類似的變化,在中國並不陌生。上世紀 90 年代,大多數中國家庭還沒有電腦,互聯網用戶也很有限,通信網絡和信息基礎設施的建設已經啟動。此後十幾年,資本進入互聯網,企業的廣告和渠道預算逐漸轉移,零售、媒體、支付、物流的經營方式陸續改變,大量年輕人才進入計算機和互聯網行業。互聯網最終改變了企業經營、人才流向和城市產業結構。這個過程沒有等到所有人接入網絡才發生,基礎設施和資本的變化要早得多。今天的 AI 已經出現了類似的信號。2024 年初,中國大模型日均 Token 調用量約為 1000 億;到今年 3 月,這個數字達到 140 萬億,兩年多增長超過 1000 倍。需求迅速傳導到了另一端。2025 年,中國已經建成 42 個萬卡級智算集群,全國算力中心用電量達到 1700 億千瓦

DeepSeek調價之後,誰走出了斬殺線?
象先志2026.08.27 11:34 · 來自安徽全文3862字00:00 / 10:05一次調價,重新劃定了大模型的競爭邊界文 | 象先志不久前,Artificial Analysis那張散點圖傳遍行業,DeepSeek V4 Flash以0.027美元的單任務成本劃出了一條“斬殺線”——全球將近70%能力不及它、價格卻比它貴的模型,集體落在了這條線以內。一個月後,DeepSeek自己開始重畫斬殺線。上週價格落地,DeepSeek V4 Flash高峰時段單任務成本從0.027美元升至0.

工業Agent不是“套殼”大模型!西門子百年經驗灌進工業AI
西門子推出工業AI智慧體Eigen Engineering Agent,能在真實工程系統中獨立完成端到端任務,執行效率較手動工作流提升2至5倍。同時透過西門子Xcelerator平台,以產品組合、開發生態與商業入口三層架構,整合工業軟體、自動化與夥伴生態,推動工業AI規模化落地。目前該平台已匯集900餘款產品、超過60萬註冊用戶與600餘家生態夥伴。

燒錢與營收並進,DeepSeek被曝前七個月收入4.75億元,Minimax連夜披露ARR暴漲500%
TechHorizon2026.08.27 10:08 · 來自北京全文1339字00:00 / 04:00這些大模型廠商都在為營收做準備,尤其是推動B端API業務實現健康毛利率。8月26日晚間,MiniMax披露了最新財務數據,截至今年8月,公司ARR(年度經常性收入)已經超過8億美元,半年暴漲500%。

“額度想重置就重置”,Codex負責人Tibo談OpenAI幕後:產品沒做好就補償、ChatGPT與Codex合併、暫停部分前沿模型RL訓練
CSDN·2026年08月27日 09:46“只要我認為時機合適,隨時都可以按下那個「重置」按鈕。” “只要我認為時機合適,隨時都可以按下那個「重置」按鈕。” “我不太關注競爭對手,我真正看重的是我們能獨特地做好什麼,我們的價值觀是什麼,以及我們如何最大限度地向這些目標加速。

Edge AI Daily 早報(8月27日)
Edge AI Daily2026.08.27 08:28 · 來自北京全文6559字00:00 / 17:38當日核心情報涵蓋AI基礎範式動搖(嬰兒學習效率挑戰Scaling Law)、OpenAI企業級產品擴張(ChatGPT Work登錄憑證、Admin插件)、微軟AI圖片永久標記隱私爭議、LAION最大開源視頻數據集、亞馬遜關停MTurk、蘋果M5 Ultra芯片突破本地AI算力、Anthropic記憶合併默認開啟。