千問智譜連夜開源,都比DeepSeek便宜,國產大模型價格猛卷

2026年8月26日 16:34
站內 AI 整理稿

編譯 | 程茜 編輯 | 雲鵬 8月27日報道,昨晚,阿里千問大模型團隊開源多模態MoE模型Qwen3.8-Flash-Next,該模型是基於下一代Qwen4架構構建的先導預覽版。Qwen3.8-Flash-Next主模型參數量為125B,額外配備51B的N-gram Embedding,每token激活6B參數,原生支持262144 token上下文,並可通過YaRN擴展至1百萬token。相比於Qwen3.7-Plus,Qwen3.

8-Flash-Next降低了訓練與推理成本,訓練開銷僅約為前者的1/9,但在編程和辦公任務上性能更強,且該模型在千問團隊放出的基準測試中絕大多數都超過DeepSeek-V4-Flash正式版。在價格方面,Qwen3.8-Flash即將上線千問AI平臺,對外提供API服務,每百萬Tokens輸入1元,輸出3元,相比空閒時段的DeepSeek-V4-Flash輸入價格低33.33%,輸出價格低33.33%。昨晚,智譜也開源了GLM-5系列首個原生多模態模型GLM-5.3-Flash(320B-A18B),這也是此前在網上爆火的匿名模型Ox-Alpha(“牛來”模型),同樣將價格打了下來。

其新模型總參數320B,在智譜自研Z.ai Code Bench體感評估中編程表現與Claude Opus 4.8相當,價格更是降到了GLM-5.3的1/10,限時折扣內為GLM-5.3的1/20,為Opus 4.8的1/40。▲Qwen3.8-Flash-Next與DeepSeek-V4系列模型價格對比(製圖) Qwen3.8-Flash將首發上線“千問辦公”,API即將上線。在千問AI平臺上,該模型以qwen3.

8-flash的名稱提供服務,千問AI平臺支持行業標準協議,包括兼容OpenAI的Chat Completions和Responses API,以及兼容Anthropic的接口,同時Qwen API支持Anthropic API、OpenAI Responses協議,可直接配合Claude Code、Codex使用。其博客提到,千問提前釋出結構上的改動,是為了在發佈Qwen4完整模型家族之前,先讓社區對其進行檢驗。在千問的推特評論區下方,不少海外開發者已經迫不及待想要體驗下千問的新模型了,還有網友只是一味誇讚稱“這太強了”、“我們不需要OpenAI”、“Qwen未來有可能超越Opus”。

目前,Qwen3.8-Flash-Next的模型權重在Hugging Face與ModelScope發佈,默認1百萬上下文並內置官方工具的生產版本。技術報告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf Hugging Face開源地址:https://huggingface.co/Qwen/Qwen3.8-Flash-Next 一、十餘項測試超過DeepSeek‑V4‑Flash、Claude‑Opus‑4.6 Qwen3.

8-Flash-Next圍繞Attention、Residual、Embedding 和 Optimization四個方面對模型進行了系統升級,在提升模型能力的同時,進一步優化了計算效率、模型容量和訓練穩定性。▲Qwen3.8-Flash-Next模型架構 千問大模型團隊放出的基準測試結果顯示,Qwen3.8-Flash-Next在智能體、編程、通用能力以及多模態等方面絕大多數都超越了Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max),拿下第一。具體來看在純文本能力方面,Qwen3.

8-Flash-Next在10項任務拿下第一,超過Qwen3.8‑27B、Qwen3.7‑Plus、DeepSeek‑V4‑Flash‑0731、Claude‑Opus‑4.6(Max)。其中編程能力上,Qwen3.8-Flash-Next在智能體編程DeepSWE1.1、SWE‑bench Pro多語言軟件工程上拿下第一,僅在倉庫級代碼生成Repo‑level code generation測試中略遜於DeepSeek。

智能體上,千問新模型在長週期辦公任務、專業工作任務、前沿智能體任務的加權部分得分、真實工具調用測試機中均拿下第一,在前沿智能體任務的一次性完全通關率上得分低於DeepSeek‑V4‑Flash。通用能力上,Qwen3.8-Flash-Next在指令遵循、科學推理、競賽代碼上拿下第一,僅在多學科綜合推理能力上略弱於Claude‑Opus‑4.6。多模態能力方面,該模型13項任務均超過其他三個模型拿下第一。多模態智能體能力中,主要考驗模型是否能看懂截圖,操作手機、電腦,復現APP、網頁開發、多模態工具調用。Qwen3.8-Flash-Next在這一部分中均拿下第一。

通用多模態能力主要考察模型的看圖理解、長視頻、圖表、數學能力,Qwen3.8-Flash-Next在絕大多數測試中均超過其他三個模型,僅在不給特殊推理提示的科研圖標分析測試中,分數低於DeepSeek。千問還放出了Qwen3.8-Flash-Next-Base在6B激活參數的情況下,與Qwen3.8-27B及Qwen3.7-Plus的base模型比較結果,其在14個benchmark中的8個上取得最優結果,其中51B的N-gram embedding參數是確定性尋址的,不進入每token的矩陣乘預算。

當前基礎模型所需的參數量不斷增加,上下文窗口長度不斷增加,核心問題已不再是究竟能把規模做到多大,而是實現規模化的效率有多高。基於此阿里千問大模型團隊進行了架構上的創新,其開源的Qwen3.8-Flash-Next,正是阿里朝這一目標邁進的階段性關鍵成果。該模型是其基於Qwen4架構打造的實驗預覽版模型,核心是重新深度思考現代大語言模型的核心組件在大規模運行場景下如何協同工作。二、四大架構創新,讓新模型更強更穩更划算 Qwen3.

8-Flash-Next主要包含四大創新點: 1、GDN與QSA(通義稀疏注意力)結合,實現高效記憶和精準檢索 傳統全局注意力可以直接訪問所有歷史token,但上下文越長,計算和KV Cache訪存成本越高。其延續Qwen3.5的架構設計採用GDN+Attention的Hybrid架構:每四層中三層使用Gated DeltaNet(GDN),將歷史信息持續壓縮到固定大小的狀態中;另一層保留全局Attention,負責精確檢索全局信息。研究人員對全局Attention進一步引入Qwen Sparse Attention(QSA),通過只關注重要上下文來減少長序列下的計算。

QSA通過壓縮式輕量Indexer在micro-block(微塊)粒度上篩選重要上下文,降低長序列 Attention 開銷。這樣不僅減少了實際Attention的計算量,也降低了“尋找重要上下文”本身的上下文索引成本。可以理解為GDN負責高效“記住”,QSA負責精準“查找”。在1M token上,QSA的Attention Kernel在Prefill和Decode階段分別實現最高7.6倍和4.9倍的加速。在貼近線上高緩存複用場景的實驗設定下(Prefix Cache命中率為90%),Qwen3.8-Flash-Next在1M上下文下的Prefill吞吐達到Qwen3.7-Plus的8.

6倍。2、引入Gated Residual(GR,門控殘差),給信息更多傳遞路徑 傳統Transformer架構中,各層持續在同一條Residual Stream上讀寫信息,隨著網絡加深,早期特徵不斷與後續信息混合,重要信息更容易被逐漸稀釋。GR可以看作兩種思路的結合:一方面延續Hyper-Connection(超連接)將residual stream(殘差流)擴展為多分支的設計,另一方面將GatedNorm的逐元素動態門控融入residual read(殘差讀)。

最終原本單一的residual stream被擴展成4條並行分支,模型可以根據當前內容動態決定從不同分支讀取多少信息,以及向不同分支寫入多少信息。這可以把它理解為把一條信息通道擴展成多條車道:有些分支負責局部信息傳遞,有些則可以把早期信息直接保留到很深的網絡層。研究人員實際分析中也觀察到,其中一條branch(殘差分支)會自然形成連接第一層Attention和大部分中後層的長距離通道。GR 還進一步簡化了Hyper-Connection:當read/write足夠靈活後,額外的branch mixing(分支混合)已經沒有明顯收益,因此可以直接去掉,減少訪存開銷和不穩定因素。

歸一化後的Gate同時能夠有效抑制activation outlier(激活異常值)、提升訓練穩定性;Residual State(殘差狀態)支持使用FP8存儲,進一步降低訪存開銷。3、引入N-gram Embedding,低成本擴展模型容量 研究人員受到Gemma 3n中Per-Layer Embedding(逐層嵌入)和DeepSeek Engram等工作的啟發,進一步引入N-gram Embedding,從Transformer參數之外的維度擴展模型容量。

普通Embedding根據單個token查表;N-gram Embedding則結合當前token與前幾個token組成的局部上下文進行查表,為常見短語和局部模式提供額外表示。其核心優勢是可以增加大量參數,同時幾乎不增加每個token的計算量。Qwen3.8-Flash-Next額外引入了51B N-gram Embedding參數。由於查詢位置可以提前確定,這些參數可以存放在Host Memory中,通過異步Prefetch與模型計算重疊,無需長期佔用GPU顯存。最終,模型只在前部使用一層N-gram Embedding,以較低的額外成本增加了一個大規模的“局部模式記憶庫”。

4、Optimization:優化Muon在大模型訓練中的使用方式 Qwen3.8-Flash-Next使用Muon Optimizer訓練,並圍繞三個關鍵問題進一步優化Muon在大模型訓練中的使用方式:正交化精度、Muon與AdamW的參數分工,以及融合參數矩陣的拆分。對於真正作為二維線性映射的參數,例如Attention、GDN和MoE Expert中的主要權重,研究人員使用Muon;Embedding、MoE Router、GR低秩參數等則繼續使用AdamW。

對於工程實現中融合存儲的QKV、SwiGLU和GDN Projection,先按照實際對應的獨立線性變換進行拆分,再分別執行正交化。針對新的模型結構和Optimizer,研究人員重新擬合了Scaling Law,結果顯示模型可以穩定使用更大的Learning Rate(學習率)和Batch Size(批次大小),進一步提升收斂效率和大規模並行訓練吞吐。其實驗還發現,過去大模型訓練中常見的Batch Size Warmup(批次大小預熱)已經不再必要,從小Batch逐漸增加到目標Batch並沒有改善最終效果,反而需要額外執行18.8%的優化器步數。

因此,在最終訓練配置中,研究人員直接從目標Batch Size開始訓練。三、其餘架構優化,繼承自Qwen3‑Next的成熟架構組件 其餘的架構優化沿用Qwen3-Next所確立、並在Qwen3.5–Qwen3.8系列中不斷打磨的設計: 極致稀疏MoE:在全局負載均衡下,固定激活專家數量而持續增加專家總參數量,可穩定降低訓練loss,因此Qwen3.8-Flash-Next採用較大的專家池,每token只路由少量專家,並配合一個共享專家。

Multi-Token Prediction:MTP模塊以多步方式訓練,保持訓練與推理之間的一致性,從而提升實用場景下speculative decoding(推測解碼)的接受率,同時也提升主幹本身的性能,其中的全注意力層同樣被替換為QSA。訓練穩定性:保留Zero-Centered RMSNorm並對norm weight施加weight decay、注意力輸出門控機制,以及MoE路由參數初始化的歸一化,這些設計使小規模消融結果更可靠,也有助於大規模訓練平穩進行。

結語:率先放出新架構預覽模型,千問要依託社區能力完成版本打磨 隨著企業側長文檔處理、私有化部署、Agent智能體等高價值場景規模化落地,行業對大模型的評價標準,更看重其冷輸入成本、推理帶寬開銷、硬件適配能力、訓練可復現性等工程化指標。Qwen3.8‑Flash‑Next這套綜合架構改進,也證明總參數量已經不再是衡量模型能力的第一指標,激活參數量、冷prefill開銷、硬件適配能力的權重持續提升。此外,千問率先放出下一代架構的預覽版本,真實社區的復現、二次預訓練、FP8部署、長上下文壓測,可以暴露出內部實驗難以覆蓋的問題,以便在正式版本發佈時進行進一步調優。

Related

相關文章

IT之家生成式AI

谷歌 Gemini Live 大升級,整合 Spark 智能體、Gmail 等提升生產力

作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 27 日消息,谷歌今天宣佈對 Gemini Live 進行重大升級,新增多項以提升生產力為核心的集成功能。Gemini Live 是谷歌公司開發的 AI 語音對話應用軟件,現在可以與 Spark 個人 AI 智能體(AI Pro 及更高版本)集成,用戶可以通過自然語音指令,在網頁、Google Drive、Docs 和 Sheets 等服務中設置複雜的多步驟任務。

剛剛
IT之家生成式AI

英偉達 CEO 黃仁勳:在很多任務上我們已實現 AGI,該里程碑已無意義

作者:遠洋 責編:遠洋 評論: 8 月 27 日消息,能夠匹配甚至超越人類智能的 AI,仍是科技行業追逐的重要目標。但在英偉達 CEO 黃仁勳看來,通用人工智能(AGI)這個里程碑本身,如今已經變得沒那麼重要了。黃仁勳在當地時間週三舉行的財報電話會上表示:“對於很多任務來說,我們可以說已經實現了 AGI。

剛剛
量子位生成式AI

基元律動累計融資數千萬美元,推出“中國版OpenRouter”

AI基礎設施公司基元律動宣布完成數千萬美元新一輪融資,由弘暉基金領投,同時推出對標OpenRouter的TokenRhythm API平台,提供一站式多模型調用服務。該平台目前已累積5.4萬名用戶,單日Token調用量超過5000億,並進一步押注Routing Harness基礎設施,以動態組織模型、降低Agent調用成本。

剛剛
IT之家生成式AI

拷走 AI 軟件去創業,北京首例 AIGC 商業秘密行政處罰案開出 10 萬元罰單

作者:汪淼 責編:汪淼 評論: 感謝網友 I'm OK 👌、麻辣清補涼、西窗 的線索投遞!8 月 27 日消息,北京市市場監督管理局今日發文,全市首例 AIGC 領域商業秘密行政處罰案開出 10 萬元罰單。近日,北京市朝陽區市場監管局對全市首例 AIGC 行業商業秘密行政處罰案作出處罰決定,對攜密跳槽、私自複製使用原單位 AI 商業軟件的行為開出 10 萬元罰單。

剛剛
鈦媒體生成式AI

AI的賬單,不只由科技公司買單

國家能源局:《2026年1—7月份全社會用電量同比增長4.7%》,2026年8月21日。2. 工業和信息化部:2026年一季度工業和信息化發展情況,截至3月底我國智能算力規模達1882 EFLOPS(FP16)。3. 數字中國建設峰會:《算力發展的未來趨勢》《破解中小企業算力使用難題》,2026年5月、6月。4. 中國銀行:《中國銀行成為首家參與中國算力平臺生態建設的金融機構》,2026年5月9日。5. 新華社、經濟日報及國家能源局《中國“人工智能+”能源發展報告2026》相關數據。6.

剛剛