商湯大裝置支撐智譜 GLM-5.3-Flash上線,國產異構助力前沿智能進入普惠時代
8月26日晚,智譜正式上線並開源GLM-5.3-Flash(320B-A18B),這是GLM-5系列的首個原生多模態模型。其總參數320B,能力超過GLM-5.2,在全球權威的Artificial Analysis Intelligence Index(AA綜合智能指數)中取得57分,進入全球前沿模型能力區間,與Anthropic最受歡迎的模型Claude Opus 4.8得分持平。GLM-5.3-Flash的架構專為極低成本而設計,結合智譜最新的30T Token多模態預訓練語料,能夠以更少的計算資源實現更強的性能。依託先進的國產異構混推技術,商湯大裝置為GLM-5.
3-Flash上線提供大規模國產算力支持與Token服務,打造國產算力規模化商用又一硬核落地標杆。這一合作的背後,正是商湯打造的 “一套模型、一座 Token(詞元)工廠、一套智能體管控系統” 核心能力體系。其中 Token 工廠承擔著把智能能力規模化生產出來的關鍵作用:它通過多模態模型和大裝置基礎設施的聯合優化,把不同芯片、集群、能源和交付節點組織起來,持續生產更高質量、成本更低的Token。同時Token工廠與大模型之間構建起雙向反哺閉環,更好適配原生多模態模型的迭代需求。商湯大裝置高效支持了智譜 GLM-5.3-Flash的上線工作,正是這套閉環能力的有力印證。
長期以來,市場對國產算力的認知是,性價比不高、難以規模商用。而在正式發佈前,GLM-5.3-Flash以匿名模型Ox-Alpha(中文社區稱作牛來)在OpenCode和OpenRouter上進行了大規模測試,Token調用量高達62T,這些請求流量全部由國產芯片提供算力支持。且相較同一硬件環境下的初始基線,GLM-5.3-Flash基於國產芯片集群,端到端服務性能提升3倍,硬件效率和單Token成本已達到主流英偉達GPU相當水平。這一實踐表明,國產算力已經能夠在大規模真實業務場景下,高效、經濟地支撐前沿大模型推理需求。
作為最懂大模型的AI基礎設施,商湯大裝置全面擁抱國產化,並持續推動國產算力從“單點可用”走向“大規模商用”。今年WAIC期間,針對當前國產算力規模化商用卡點,商湯大裝置從“性價比、適配性、能效比”三個維度系統性破題。在性價比層面,商湯大裝置跳出單卡性能比拼的傳統思路,通過先進的異構混合推理技術,根據不同推理階段對計算、帶寬的不同需求讓不同架構、不同定位的國產芯片各盡其長、高效協同,整體推理性價比達到 NVIDIA H系列的 1.25 倍,相比國產同構推理,同等成本下Token產能擴大約2.5倍。在適配性上,通過底層算子優化、多卡並行調優和工具鏈適配等,大幅降低國產算力應用門檻。
在能效比層面,商湯大裝置推出算電協同Agent,並重新定義TPW(Tokens Per Watt)作為AIDC全新價值標尺。此外,通過整合多元算力,並持續優化推理引擎與芯片性能,商湯大裝置Token Factory正在形成大規模、高效率、低成本的Token供給能力,7月日均Token服務量已達到 2.42萬億,預計2026年年底突破日均10萬億,全年Token量級增長25倍。未來,商湯大裝置將持續投入基於國產化算力的Token服務建設,打造高性能、低成本、可規模交付的AI基礎設施,推動國產算力從單點技術突破走向產業體系化繁榮。
Related
相關文章

華為的數據供應商,拿下90%的具身大腦企業|對話景聯文CEO
機器人前瞻(公眾號:robot_pro) 作者 | 周加琦 編輯 | 漠影 機器人前瞻8月267日報道,近日,杭州AI數據運營商景聯文科技發佈了一批用宇樹機器人採集的真機數據集,包含近15000小時的真機數據,用於模型訓練。 對於當前的具身智能行業而言,15000小時真機數據已經是一筆不小的數據量。但對整個行業來說,遠遠不夠。 相比大模型時代已經積累了億級的互聯網數據,具身智能沒有現成的大規模數據可用於訓練。 對於長期處在數據產業的企業而言,這種差異感更明顯。

OpenAI 將向印度 ChatGPT 免費及 Go 套餐用戶投放廣告
作者:清源 責編:清源 評論: 8 月 27 日消息,OpenAI 宣佈,即日起將在印度向 ChatGPT Free 和 Go 套餐用戶投放廣告。本月早些時候,OpenAI 修改了服務條款,明確說明用戶在使用 ChatGPT 時可能看到廣告。

谷歌推出全球首個雙盲 AI 評估技術,基於加密環境保障基準測試公正性
作者:小泵 責編:小泵 評論: 8 月 27 日消息,谷歌宣佈推出全球首個針對前沿專有 AI 模型的雙盲評估,將外部評估限制在加密“黑箱”環境中,避免模型提前獲取測試信息來優化性能。就像學生考前不能提前看到試題才能真實反映水平一樣,當前 AI 模型評估也面臨同樣問題:如果模型提前接觸測試題目(注:也就是所謂的“基準汙染”),評估結果的可信度就會大打折扣。

上線一月,Seedance 2.5能否抗住“平替”圍攻?
1小時前HappyHorse與Wan3.0賽馬,誰是阿里版Seedance?昨天衝擊250億,拓竹復刻大疆第一步:隔壁開店圈地2026-08-21閱讀更多內容,狠戳這裡查看AI測評豆包MiniMax即夢AI選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇Figure用一款APP建立全球「數據採集經濟體」,中國具身企業誰會搶先跟進?

ChatGPT報警後:誰有權審判你的對話框?
ChatGPT等生成式AI若在對話中偵測到潛在威脅,是否應主動通報執法單位,引發各界討論。支持者認為AI應承擔社會責任即時阻止憾事,反對者則擔憂語言模型易誤判玩笑與反諷,恐侵犯隱私和言論自由。目前缺乏明確法律框架界定AI舉報義務與責任歸屬,未來或需建立分級制度,由人類專業人員最終判斷。

HBM正在被重新定義
半導體產業縱橫2026.08.27 18:25 · 來自北京全文3679字00:00 / 11:37新一代HBM4將成為技術轉折點。文 | 半導體產業縱橫隨著AI大模型訓練與推理需求持續爆發,算力芯片的性能瓶頸已從計算單元轉向存儲帶寬,HBM高帶寬內存成為制約高端AI硬件迭代的核心關鍵。在HotChips 2026國際高端芯片技術大會上,全球兩大存儲龍頭三星、SK海力士集中披露了HBM4下一代技術演進路線,打破了行業沿用多年的HBM迭代邏輯。