Qwen3.8首日可用,助力存量算力長期有用:智源FlagOS開源開放生態共享
阿里巴巴開源超大規模Mo E模型Qwen3.8-2.4T-A95B,眾智Flag OS社區同步完成Day0多芯片適配。Qwen3.8-2.4T-A95B已在平頭哥、英偉達、摩爾線程、華為昇騰、沐曦、崑崙芯、海光、清微智能、隧原等9家AI芯片上完成基於Flag OS統一開源技術棧的多芯適配、精度對齊與部署驗證,針對不同芯片情況提供包括BF16FP8INT8等多種精度的版本,開發者可直接獲取對應芯片的開箱即用方案。從今年2月首次開展MiniCPM4.5-o模型的多芯片Day0適配,到今天實現Qwen3.8-2.
4T模型在9款芯片上的Day0適配,Flag OS已累計完成來自7大頭部模型團隊、12款主流開源模型、覆蓋多達10款芯片的跨芯Day0適配,向AI芯片與大模型產業驗證了:基於統一、開放的系統軟件棧,實現前沿模型"—次開發、多芯快速適配"已具備規模化落地能力。本次發佈的Qwen3.8-2.4T-A95B是阿里巴巴開源模型系列中規模最大、能力最強的一代,首次將Qwen-Max級別的模型開放出來。主要特性:超大規模Mo E架構,總參數2.
4T,激活參數95B,純文本模型編程、專業工作、科研、長程智能體任務能力顯著提升;支持reasoningeffort調節推理深度,preservethinking保留歷史推理原生262,144 tokens,可擴展至1,010,000;提供BF16/FP8權重,兼容vLLM、SGLang、Token Speed在Coding Agent相關基準測試中,Qwen3.8-Max相比Qwen3.7-Max有明顯提升:Terminal Bench 2.1從74.5升至86.6,SWE-bench Pro從60.6升至67.7,接近Opus 4.8(69.2),Paper Bench從64.8升至93.
0,並超過Opus 4.8(80.3)。本次Qwen3.8-2.4T模型的適配,雖然相比Qwen3.5/Qwen3.6模型主體結構變化有限,但最重要的挑戰是模型參數規模比Qwen3.5-397B擴大了6倍。為了讓當下已經部署的主流AI芯片能跑起來,Flag OS需要解決因參數規模巨大帶來的一系列系統優化問題。為了解決超大規模參數問題,本次Flag OS技術棧新增了面向多款AI芯片的統INT8量化支持,通過Flag OS-Compressor多芯片模型量化工具鏈,實現了對Qwen3.8的FP8/BF16原生權重到INT8的兩條量化壓縮路徑,並完成量化推理算子的在多款AI芯片的適配。
量化遷移後的權重,在多種AI芯片上評測,與英偉達原生基於CUDA的FP8版本對照,誤差平均分偏差均在對齊區間內,保證了量化+跨芯遷移後的模型質量。基於眾智Flag OS建立的從編譯器、算子庫、多芯片框架統一plugin等技術,Flag OS團隊得以快速完成了模型壓縮量化、跨芯適配及驗證、精度對齊評測、開源版本發佈等重要步驟。—、從Day0適配到規模化驗證:打通前沿模型與多元算力的"首日可用"Qwen3.8-2.4T的多芯片Day0適配,是Flag OS緊跟前沿模型發佈節奏、實現新模型“首日多芯可用”的又一次實踐。
自今年2月首次開展Day0適配以來,Flag OS技術團隊已在6個月內完成10餘款這一能力回應了國產AI算力產業化落地的兩項核心需求:一方面,使雲服務與應用生態能夠第一時間部署最新模型;另一方面,讓既有算力基礎設施持續承接模型演進,延長使用週期、釋放存量算力價值。1、為國產AI算力雲服務搶佔新模型"首發窗口"對國內雲廠商、智算中心和新興Token算力服務商而言,每一次大模型發佈,都意味著一次新的模型遷移與底層適配。用戶希望第一時間在各種國產AI算力上使用最新模型,但不同芯片的適配鏈路相對獨立,往往需要重複投入大量工程資源。
上線速度因此不僅是技術能力,也直接決定雲服務商能否抓住新模型發佈後的市場窗口。這一痛點對中小型Token算力服務商尤為突出。由於採購規模和技術資源有限,它們往往難以推動芯片廠商針對單一模型開展專項適配,也難以長期維持完整的底層適配團隊,因此更加需要Flag OS這樣的開源第三方平臺提供公共技術支撐。Flag OS Day0適配將新模型從發佈到多芯可用的週期壓縮至24小時以內,使中小型算力服務商能夠基於國產芯片快速上線推理API和MaaS服務,無需重複投入大量人力進行底層開發。目前,騰訊雲HAI社區、超算互聯網等多個雲平臺已將Flag OS適配的模型納入其容器鏡像中心。
開發者可直接拉取鏡像並部署至雲端加速卡,快速構建面向自身業務的MaaS推理服務。這表明Flag OS Day0適配正在從技術驗證進一步走向雲服務交付,縮短國產算力從"支持新模型"到"形成可用服務"的最後一公里。2、讓存量算力持續承接前沿模型:Flag OS釋放硬件投資的長期價值大模型規模持續增長,正在加快AI芯片的迭代節奏。對於以多年週期規劃和建設的AI算力集群基礎設施,能否持續承載最新模型,直接關係到智算中心AI服務器的利用率和產業投資的可持續性。Flag OS希望通過量化、算子優化和跨芯適配,為來自多個芯片廠商的存量AI算力繼續運行前沿模型拓展空間。以Qwen3.8-2.
4T為例,Flag OS-Compressor已支持W8A8量化,將權重和激活由BF16壓縮至INT8,顯著降低模型的顯存佔用與訪存壓力,同時也解決了當下80%以上存量AI算力不能支持FP8的問題。為了讓模型在不同代際的國產AI芯片上部署,通過Flag OS技術棧進一步針對量化後的權重規模、單卡顯存、卡數、內存帶寬以及並行通信方案進行全棧優化,讓存量的當代和上一代AI算力也有機會繼續承載最新的超大規模Mo E模型。對智算中心重資產場景而言,這不僅是延長設備服役週期的問題,更關係到算力投資的長期回報。
通過量化與系統軟件優化彌補部分硬件代際差距,可以提高存量設備利用率,緩解因模型快速演進帶來的硬件更新壓力。其目標並非讓舊硬件獲得與新一代硬件相同的性能,也不是無條件延長所有設備的生命週期,而是在部署條件、模型精度和性能表現均可驗證的前提下,為國產算力持續承接前沿模型提供可持續經濟的選擇。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。
