讓Token生產更高效:異構混推的關鍵技術演進與創新實踐

2026年9月23日 18:01
讓Token生產更高效:異構混推的關鍵技術演進與創新實踐
站內 AI 整理稿

商湯大裝置異構混推創新實踐與技術演進 Token經濟加速爆發,算力需求發生結構性反轉,推理需求已取代訓練,成為算力增長主引擎。隨之而來的,是AI基礎設施面臨的全新命題與挑戰:當Token調用量邁向千倍級增長,推理系統如何承接持續攀升的需求?如何通過異構算力實現高效、穩定的Token生產?在近日舉辦的“2026全球AI芯片峰會·Token工廠異構混訓混推技術研討會”上,商湯大裝置資深技術專家羅偉以《Token工廠:以異構算力構建新一代Al基礎設施》為主題發表演講,深入剖析規模化推理面臨的系統挑戰,並分享商湯大裝置在異構推理架構、模型適配及關鍵技術演進等方面的實踐與探索。

01行業挑戰:Agent時代,推理負載瓶頸貫穿整套系統 Agent時代的負載特徵,和傳統單輪對話的推理需求有明顯不同。首先是長上下文,帶來了輸入計算和KV Cache佔用的持續增長;其次是連續多輪的對話,意味著前綴複用和熱點不斷變化;再者是突發與長尾需求多,意味著流量和長度的分佈會持續波動。羅偉表示,面對這些變化,商湯大裝置的底層邏輯已經轉向“以Token、狀態與時延預算為中心”,所有設計都圍繞Token的生產效率、交付質量與單位成本,進行資源的組織和利用。這一以Token為中心的系統設計,也支撐商湯大裝置持續提升規模化Token生產與服務能力。

如今,商湯大裝置的日均Token服務量,已經從年初2月的0.46萬億,增長至8月4.5萬億。02創新實踐:橫向串資源、縱向拉效率,系統級提高Token產能 如何把單點效率組織成系統級Token產能?羅偉分享了商湯大裝置的兩條主線:“橫向編排”與“縱向優化”。兩條主線最終指向共同目標:模型質量達標、SLO達標、有效吞吐提升、單位產能成本下降。橫向串資源:讓不同算力各展所長 所謂“橫向編排”,目的是資源協同,讓平臺知道哪些模型、哪些版本能運行在哪些算力上,哪些Prefill與Decode組合能做KV Cache交接,當前請求應該進入哪條路徑,負載變化時如何自動調整。

針對不同品牌、不同規格的算力,商湯大裝置構建了統一的資源畫像,覆蓋計算吞吐、KV Cache的容量、有效帶寬、模型兼容性等,讓不同算力進入同一個編排視角。在此基礎上,平臺對推理請求進行全生命週期管控。從准入配對、Prefill執行、KV Cache狀態交接,到Decode接管,每一個環節都有標準化的協同機制,保障服務穩定性。“我們不會把某一類芯片永久固定為P節點或D節點。”羅偉強調,平臺會根據模型、批量、上下文長度的瓶頸變化,動態調整不同芯片的角色分工,實現更高的可用性、靈活的組合和配比。

縱向拉效率:讓整條路徑性能最大化 在橫向打通資源的同時,商湯大裝置持續深化“模型×引擎×芯片”三層縱向優化,從模型適配到芯片運行時,充分釋放整條執行路徑的性能。其中,在模型層,針對權重量化、顯存預算進行精細化調優,平衡精度與吞吐;在引擎層,針對Attention、GEMM等核心算子進行並行優化;在芯片層,深度適配編譯、訪存調度與內存管理。而所有優化結果都會在真實負載中進行系統驗證,規避單點效率的瓶頸。03技術演進:從動態池化到模塊拆分,持續提升Token生產效率 在成熟實踐的基礎上,羅偉進一步分享了異構協同走向更高效率、更高靈活性的兩大關鍵技術演進方向。

技術演進方向一:從固定P/D到動態資源池 在資源調度層面,商湯大裝置正在從固定P/D配比走向動態資源池化。不同業務、不同時間段的輸入輸出長度和流量熱點不斷變化,靜態P/D組合容易造成局部排隊和資源錯配。為此,商湯大裝置分別構建Prefill Pool和Decode Pool,根據實時負載、KV Cache狀態及節點健康度,動態完成請求路由和P/D資源匹配。當長輸入導致Prefill壓力升高時,系統可動態增加P節點;當長輸出推高Decode負載時,則增加D節點,甚至通過角色切換實現P/D節點靈活轉換,讓資源跟著負載動態調整,在保障SLA的同時提升整體算力利用效率。

技術演進方向二:從P/D走向模塊級資源池 面向未來多模態、MoE模型的發展,傳統按P/D兩階段劃分資源的方式將顯現瓶頸。商湯大裝置的架構演進方向,是進一步走向模塊級資源池化:將Encoder、Attention、FFN、視覺編碼等不同模塊拆分為獨立資源池,各自按負載特點彈性擴縮容,讓資源匹配更精準、利用率更高。演講最後,羅偉表示,面向未來,作為“最懂大模型的AI基礎設施”,商湯大裝置將持續推動產品與技術迭代,與生態夥伴共同加速AI基礎設施持續升級,推動普惠AI,智造美好未來。

Related

相關文章

阿里雲發佈Qwen Book:AI智能體電腦正式亮相

產品搭載Skill鍵盤陣列、全局AI按鍵、語音手寫筆等交互入口,並提供支持7×24小時運行重度任務的操作空間,針對傳統AI辦公中跨應用、跨Agent協同效率不足的問題進行優化。Qwen Book基於“OS as Harness”理念,以千問端雲模型為核心,深度融合操作系統、應用、雲服務與硬件能力,統一管理交互入口、運行時環境、個人持續上下文以及軟硬件操控能力,構建可理解、可記憶、可持續運行和可治理的Agent計算環境。

剛剛

AI會自己返工到達標為止?豆包工作上線目標模式,先給計劃、確認後才幹活

目標模式面向有明確要求的複雜任務:用戶寫清楚驗收目標後開啟執行,豆包工作在完成任務後會對目標逐項校驗,只要有一項不達標,就自動返工、繼續調整,直到達標。計劃模式則面向步驟多、消耗大的複雜任務:豆包工作會先產出一份可審閱、可編輯的Markdown格式實施計劃,供用戶校準修改,待對齊工作需求並確認後才開啟執行,使執行過程更可控、資源與時間消耗更合理。

剛剛
雷峰網模型更新

啟仔遠仔,想成為第一個被你帶回家的硅基夥伴

啟元 T1,兩款機器人當天開售,基礎版本售價 19999 元。這是整個行業第一次有人把量產消費級人形機器人推進市場,且發售即發貨,10 月 1 日啟元就將按訂單陸續發貨。01Q1與T1,同一個問題的兩種回答啟元這次發佈的兩款機器人,一個叫 Q1(暱稱“啟仔”、“Q仔”),一個叫 T1(暱稱“遠仔”)。

剛剛
量子位模型更新

刷視頻也能教會機器人幹活!1200億tokens人類動作預訓練,誤差按冪律下降

個陌生家庭。它要收拾散落在客廳裡的玩具、疊毛巾、鋪床。機器人到達現場後,不再採集新數據,不更新模型權重,也不根據現場執行結果重新選擇模型。 視頻很容易被概括成“人形機器人‘零樣本’做家務”。嚴格來說卻並非如此。三個任務此前都在其他環境中用專門數據做過適配。

剛剛