阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定
重點摘要
阿里巴巴正式發布新一代旗艦基座大模型Qwen3.8,總參數量達2.4萬億,在編程與專業辦公能力上大幅提升,並在權威榜單Arena中排名全球第二,僅次於Anthropic的Claude系列。Qwen3.8的API已上線千問AI平台,並同步推出「千問辦公」Agent產品,國內定價每百萬Tokens輸入12元、輸出36元,國際價格低於Claude Opus 5。Qwen3.8-Max與27B版本預計下週開源,官方強調其推理效率與速度提升,並已成功適配阿里真武M890超節點。
阿里巴巴於8月3日正式發布新一代基座大模型Qwen3.8,總參數量達到2.4萬億,在程式編寫與專業辦公兩大領域展現顯著能力躍升。根據今日更新的權威第三方評測榜單Arena,阿里Qwen模型整體表現在全球僅次於Anthropic的Claude系列,穩居全球大模型第一梯隊,顯示中國自研模型在國際舞台上已具備高度競爭力。目前Qwen3.8的API服務已正式上線千問AI平台,同時也整合至阿里今日同步推出的Agent產品「千問辦公」,讓開發者與企業用戶可直接取用這款旗艦模型。在開源規劃方面,Qwen3.8-Max預計於下週對外開源,此外也將一併釋出Qwen3.8-27B,進一步擴大開發者生態。
即日起,全球開發者皆可透過千問AI平台取得API服務,國內定價為每百萬Tokens輸入12元、輸出36元,隱式緩存命中時僅需1.5元;在國際市場上,輸入與輸出的價格分別僅為Opus 5的40%與24%,以更具成本效益的方式提供接近同等水準的智能表現。本次發布的Qwen3.8-Max是千問系列中尺寸最大、性能最強的旗艦機型,支援視覺理解功能,上下文長度最高可達1M Tokens。在模型架構設計上,Qwen3.8透過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.
4T,同時僅激活95B參數,在整體性能提升之際,也換來更高的推理效率與更快的回應速度,為大規模商用部署打下良好基礎。在各項權威評測中,Qwen3.8-Max展現全面性的能力突破。在科研復現評測PaperBench這類程式智能體測試中,新模型較上一代大幅提升28.2分,以93.0分成績寫下評測新高;在WideSearch與Agent's Last Exam等通用智能體評測中,則分別取得81.9分與52.4分,位居業界前沿。此外,指令遵循IF Bench評測拿下82.8分,科學推理GPQA Diamond獲得92.6分,展現出均衡且優異的通用能力。在視覺推理BabyVision評測中,Qwen3.
8-Max在無工具輔助的條件下取得82.0分,成績超越部分主流模型近兩倍;而在評估智能體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max以86.1分位居主流模型首位。程式編寫能力是前沿大模型的核心指標之一,Qwen3.8在自主程式設計領域實現了關鍵突破。在權威的CodeArena榜單中,Qwen3.8名列全球第四。兩年前的前沿模型已能撰寫函數、補全代碼,成為程式設計師的重要輔助工具;如今的Qwen3.8更進一步,能從空文件夾出發,自主完成一個原本需要十數天才能交付的真實專案,全程無需人工介入。使用者只需要下達一句「建立一個自進化的智能體Harness」,Qwen3.
8便會像資深工程師一般,從零開始建構循環工程框架,編排智能體自動領取並執行任務,人類工程師還能透過釘釘即時提出新的需求。在實際驗證中,Qwen3.8獨立運行約16天,成功打造出一個具備Hermes Agent等級、真實可用的自進化智能體框架「oh-my-cli」。這個專案目前已完全開源,完整開發過程也公開保存在GitHub倉庫中,任何人都可以查看與複現,展示出大型語言模型從「輔助寫程式」走向「獨立交付軟體專案」的可能性。除了程式能力,Qwen3.8在專業工作任務的執行上同樣表現突出。透過真實環境與算力的聯合強化學習擴展,Qwen3.
8在數百種高價值、高頻率的專業任務中獲得實際表現的提升,並能在主流智能體框架中穩定輸出生產級成果。例如,一支法務助理團隊原本需要一週的時間,才能在數百份法律文件中標註超過千個相關條款,Qwen3.8在一小時內就能完成;籃球數據分析團隊需要逐幀標註160小時以上的比賽錄像,Qwen3.8花費數十分鐘就能精準拆解超過8400個攻防回合,並一次輸出球員戰術畫像與教練報告。在金融領域,一個金融研究團隊需憑藉多年專業知識積累,蒐集資本市場全面而即時的變動,才能依序完成量化策略研究,Qwen3.
8則能自主調動並行的智能體,在連續工作數小時後交付完整的ETF輪動策略,並持續分析回測結果、動態修正參數,最終實現規模化盈利。在長週期任務中,Qwen3.8進一步展現出系統級自主規劃與全棧閉環自適應學習能力。無論面對高精密、強物理約束的數字芯片設計任務,或是在高度動態、博弈激烈的商業模擬運營情境中,Qwen3.8都能透過「執行—反饋—迭代」的自適應閉環機制,在數千輪的超長程交互中,深度重構演算法與策略,表現出接近人類專家的規劃與判斷能力。Qwen3.8在視覺理解方面也將AI的能力極限推升至新的層次。在權威的Vision Arena榜單中,Qwen3.8-Max位列全球第二。
模型不僅能讀懂200頁的財務報告PDF,也能理解超過100小時的長篇影片內容,並進一步將這些視覺資訊反饋至整體工作流程中,輔助模型進行更全面的思考決策。在千問團隊自建的「應用復刻」基準RecreationBench長程任務中,模型在沒有原始程式碼、也無法連接網路的情況下,僅透過交互與反饋理解應用程式,就能從零開始完整復刻整個應用,展示出前沿水準的混合多模態智能體能力,也將視覺程式設計推向新的高度。在基礎設施層面,阿里真武M890超節點已成功適配Qwen3.8,透過芯片、雲平台與千問大模型的全鏈路優化,有效提升推理效率並降低推理成本。在Agentic推理場景中,這項優化最多可實現1.
5倍的性能提升,為Qwen3.8在企業級應用中的大規模部署提供了更扎實的底層支撐。整體而言,Qwen3.8以更快的速度、更穩定的表現與更全面的多模態能力,為全球開發者與企業用戶打開了新一代AI應用的想像空間。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。