阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定

重點摘要
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里Qwen3.
阿里巴巴於8月3日正式發表新一代基座大模型Qwen3.8,這款旗艦級模型以總參數量2.4萬億的規模登場,並在程式編寫與專業辦公兩大核心場景展現明顯升級。根據同日更新的權威第三方榜單Arena顯示,阿里Qwen模型整體表現僅次於Anthropic的Claude系列,穩居全球大模型第一梯隊。目前Qwen3.8的API已於千問AI平台正式上線,同時也同步接入阿里巴巴當日推出的Agent產品「千問辦公」,讓開發者與企業用戶能立即體驗這款新模型的完整能力。在模型發布之際,阿里也同步公開了具體的服務方案。即日起,全球開發者可透過千問AI平台取得Qwen3.
8的API服務,國內定價方面,每百萬Tokens輸入為人民幣12元、輸出為人民幣36元,而隱式緩存命中時的費用僅需1.5元。若以國際市場價格觀察,Qwen3.8輸入與輸出的費用分別僅為Opus5的40%與24%,在提供相近智慧水平的同時,展現出更高的性價比,對開發者而言具備相當吸引力。此次發布的核心型號為千問大模型系列中尺寸最大、性能最強的Qwen3.8-Max。這款旗艦模型支援視覺理解能力,並具備高達1M Tokens的上下文長度,足以應付大量文件與複雜任務的處理需求。在模型架構上,Qwen3.8透過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.
4T,同時僅啟動95B參數,藉此實現更高的推理效率與更快的推理速度,也讓整體性能迎來新一輪突破。從多項權威評測數據來看,Qwen3.8-Max的表現相當突出。在科研復現評測PaperBench等編程智能體評測中,Qwen3.8-Max較上一代模型大幅提升28.2分,以93.0分寫下評測新高;在WideSearch與Agent's Last Exam等通用智能體評測中,新模型分別獲得81.9分與52.4分,位居前沿。此外,Qwen3.8在指令遵循IF Bench評測中斬獲82.8分,科學推理GPQA Diamond則取得92.6分,整體通用能力均名列前茅。
在視覺推理BabyVision評測中,Qwen3.8-Max在無工具條件下取得82.0分,超出部分主流模型近兩倍;而在評估智能體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max更以86.1分位居主流模型首位。編程能力一直是前沿大模型的核心競爭指標,而Qwen3.8在自主編程方面取得了新的突破。在權威的CodeArena榜單中,Qwen3.8位居全球第四。兩年前的前沿模型已經能寫好函數、補全代碼,成為程式設計師的得力助手;如今Qwen3.8更進一步,可以從一個空文件夾出發,自主完成一個時長十數天的真實專案交付,整個過程無需人為干預。
例如,使用者只需說一句「創建一個自進化的智能體Harness」,Qwen3.8就會像資深工程師一樣,從零開始自主搭建循環工程框架,編排智能體自動領取並執行任務,而人類工程師還能透過釘釘隨時向Qwen3.8提出新要求。在長達約16天的獨立編程運行後,Qwen3.8成功打造出一個Hermes Agent等級、真實可用的自進化智能體框架「oh-my-cli」,目前該專案已完全開源,完整過程公開保存在GitHub倉庫中,供所有人檢視。除程式開發外,Qwen3.8也展現出勝任廣泛真實專業任務的能力。面對完全不同的專業任務、評判標準與計算需求,Qwen3.
8透過真實環境與算力的聯合強化學習擴展,實現數百種高價值、高頻專業任務的真實表現提升,在主流的智能體框架中均可穩定可靠地交付生產級成果。以實際場景為例,一支法務助理團隊要在數百份法律文件中標註千餘個相關條款,通常需要一週時間,而Qwen3.8在一小時內就能完成;籃球數據分析團隊需要逐幀標註160小時以上的比賽錄像,Qwen3.8只需數十分鐘就能精準拆解超過8400個攻防回合,並一次輸出球員戰術畫像與教練報告;金融研究團隊原本需要基於數年專業知識累積與全面即時的資本市場資訊,才能完成的量化策略研究,Qwen3.
8則能自主調動並行的智能體,連續工作數小時後交付完整的ETF輪動策略,並持續分析回測、動態修正,最終實現規模化盈利。在長週期任務中,Qwen3.8更湧現出系統級的自主規劃與全棧閉環自適應學習能力。無論是在高精密、強物理約束的數字芯片設計領域,還是在高度動態、博弈激烈的商業模擬運營情境中,Qwen3.8均能透過「執行—反饋—迭代」的自適應閉環,在數千輪的超長程交互中實現演算法與策略的深度重構,展現出接近人類專家的工作節奏與判斷品質。除了強大的文本與推理能力,Qwen3.8也將AI視覺理解能力推向新的極限。在權威的Vision Arena榜單中,Qwen3.8-Max排名全球第二。Qwen3.
8不僅能讀懂200頁的財報PDF、看懂超過100小時的長視頻,更能將這些「看到」的知識與資訊回饋到工作全流程中,協助模型思考得更周全。在千問團隊自建的「應用復刻」基準RecreationBench長程任務中,模型在沒有原始碼、無法聯網的情況下,只透過交互與回饋理解應用程式,卻能從零完整復刻出整個應用。這項成果顯示,Qwen3.8已經展現出前沿水準的混合多模態智能體能力,透過「迭代編程—交互回饋」的反覆循環,將視覺編程推向新的高度。在基礎設施方面,阿里真武M890超節點也已成功適配Qwen3.8。
透過晶片、雲平台與千問大模型的全鏈路優化,能夠顯著提升推理效率並降低推理成本,在Agentic推理場景中最多可實現1.5倍的性能提升。據了解,Qwen3.8-Max預計將於下週開源,同時也會釋出Qwen3.8-27B版本,進一步擴大開放生態,讓更多開發者與研究人員能夠基於這款先進模型進行二次開發與應用創新。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。
NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架
NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。