阿里通義 Qwen3.8-Flash 發佈開源:125B 參數 MoE 模型,訓練成本僅為前代 1/9

作者:問舟 責編:問舟 評論: 8 月 26 日消息,阿里通義千問團隊今晚正式發佈了 Qwen3.8-Flash。通義團隊同時發佈了 Qwen3.8-Flash-Next 的開源權重,Next 新架構將是全新一代 Qwen4 系列模型的雛形。這是一個多模態 MoE 模型,主模型參數量為 125B,額外配備 51B 的 N-gram Embedding,每 token 激活 6B 參數。它原生支持 262,144 tokens 上下文,並可通過 YaRN 擴展至 1M tokens。據介紹,Qwen3.
8-Flash 圍繞四個方向進行了系統升級:在 Attention 方面,採用 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架構。GDN 負責高效壓縮歷史信息,QSA 則通過輕量級 Indexer 在 micro-block 粒度上篩選重要上下文,顯著降低長序列 Attention 開銷。面對 1M token 的超長上下文,QSA 的 Attention Kernel 在 Prefill 和 Decode 階段分別實現最高 7.6 倍和 4.9 倍的加速。
在 Residual 方面,引入 Gated Residual(GR)機制,將殘差流擴展為 4 條並行分支,通過動態 Gate 控制信息讀寫。殘差狀態支持 FP8 存儲,大幅降低訪存開銷。在 Embedding 方面,引入 51B 參數的 N-gram Embedding,利用局部上下文查表擴展模型容量。這些參數可卸載至 Host Memory,通過異步 Prefetch 與模型計算重疊,不長期佔用 GPU 顯存。在 Optimization 方面,採用 Muon Optimizer,並針對正交化精度、參數分工及融合矩陣拆分等策略進行優化。針對新架構重新擬合了 Scaling Law。
性能與成本相比 Qwen3.7-Plus,Qwen3.8-Flash 的訓練成本僅約為前者的九分之一,但在編碼和辦公任務上具備更強能力。在 6B 激活參數下,Qwen3.8-Flash-Next-Base 在 14 個 benchmark 中的 8 個上取得最優結果,包括 MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM 與 MMMU。模型表現純文本:多模態:模型結構:Base 模型表現:可用性與定價從官方獲悉,Qwen3.8-Flash 即將上線千問 AI 平臺,對外提供 API 服務,定價為每百萬 Tokens 輸入 1 元、輸出 3 元。
模型權重已於北京時間 8 月 26 日 23:00 在 Hugging Face 與 ModelScope 平臺開源,同步發佈 FP8 量化版本。Qwen3.8-Flash-Next 默認支持 1M 上下文並內置官方工具。參考資料:技術報告:https://github.com/ QwenLM / Qwen3.8-Flash-Next / blob / main / techreport.pdf技術博客:https://qwen.ai/ blog?id=qwen3.8-flash-nextHugging Face:https://huggingface.co/Qwen/Qwen3.
8-Flash-Next?spm=a2tyo06.30285417.0.0.1d73c921FsyOPe&file=Qwen3.8-Flash-NextModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next?spm=a2ty_o06.30285417.0.0.1d73c921XAP2dV&file=Qwen3.8-Flash-Next 投訴水文 我要糾錯 下載APP,簽到賺金幣兌豪禮
Related
相關文章

MiniMax:正推進 M3 和 H3 的國產芯片適配,大規模國產算力集群將很快上線
作者:沁滄(實習) 責編:沁滄 評論: 感謝網友 麻辣清補涼 的線索投遞!8 月 26 日消息,據證券時報消息,MiniMax 在中期業績電話會上透露,M3 Pro 的參數規模預計提升至約 3T,並進一步擴大強化學習和長程任務訓練,以提高模型的泛化能力和智能上限。

大廠競逐AI辦公助手,蒙牛先跑出一個落地樣本
AGI-Signal2026.08.26 18:58 · 來自北京全文5756字00:00 / 17:29蒙牛讓200名業務骨幹自建AI應用。微軟Copilot嵌入Office,Google Gemini覆蓋Workspace,國內騰訊WorkBuddy、字節豆包、阿里千問辦公等密集迭代,AI辦公助手賽道持續升溫,各方爭奪的是辦公場景的桌面入口。產品能力在提升,功能覆蓋面在擴大,但在企業側究竟能跑出什麼樣的實際效果,目前能拿出完整案例的並不多。蒙牛8月中旬辦了一場AI應用創新大賽的中期路演。

面壁智能:MiniCPM 系列開源模型全球累計下載量突破 5000 萬次
作者:歸瀧 責編:歸瀧 評論: 8 月 26 日消息,面壁智能官方今日宣佈,在面壁智能四週年之際,MiniCPM 系列開源模型全球累計下載量突破 5000 萬次。注:面壁智能於 2022 年 8 月在北京成立,孵化自清華大學自然語言處理實驗室。

硅谷今日最熱具身模型!不用後訓練,看一遍就學會
北美機器人新創Skild AI發布基礎模型S1,主打上下文學習,機器人只需觀看人類示範影片,無需後訓練即可完成煎餅、泡咖啡、植物換盆等長達10分鐘以上的複雜任務,在未見過任務上成功率達66%,遠高於傳統語言提示VLA的9%。相較之下,傳統後訓練需約380次示範才能達到同等水準,顯示機器人學習新技能的成本可望大幅降低。

達卯科技與福建智算方舟達成合作,全棧式算電協同服務在閩落子
達卯科技與福建智算方舟合作,為長樂機場綜保區人工智能智算中心(一期)提供全棧式算電協同服務,涵蓋建設諮詢、平台部署、儲能電站運營及智能運維等全生命週期鏈條。該中心一期規劃15000P算力,將填補東南沿海高端智算供給缺口,並帶動區域數字產業發展。

全棧AI,其實是個陷阱?
字母榜2026.08.26 13:32 · 來自北京全文8282字00:00 / 23:43All in AI並不是終點。文 | 字母榜全棧AI,現在差不多已經成為大廠的標配。幾乎所有科技巨頭都在同一個方向使力:把AI產業鏈上越來越多的環節收入自己手裡。於是模型公司操心芯片、數據中心和電力;雲廠商開始訓練自己的模型;手機廠商在補AI能力;社交平臺也在押注Agent和下一代終端。OpenAI可能是今天“全棧AI”野心最明顯的公司之一。