阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定
重點摘要
阿里巴巴正式發布新一代旗艦基座大模型Qwen3.8,總參數量達2.4萬億,在編程與專業辦公能力上大幅提升,並在權威榜單Arena中排名全球第二,僅次於Anthropic的Claude系列。Qwen3.8的API已上線千問AI平台,並同步推出「千問辦公」Agent產品,國內定價每百萬Tokens輸入12元、輸出36元,國際價格低於Claude Opus 5。Qwen3.8-Max與27B版本預計下週開源,官方強調其推理效率與速度提升,並已成功適配阿里真武M890超節點。
阿里巴巴於8月3日正式發布新一代基座大模型Qwen3.8,總參數量達到2.4萬億,在程式編寫與專業辦公兩大領域展現顯著能力躍升。根據今日更新的權威第三方評測榜單Arena,阿里Qwen模型整體表現在全球僅次於Anthropic的Claude系列,穩居全球大模型第一梯隊,顯示中國自研模型在國際舞台上已具備高度競爭力。 目前Qwen3.8的API服務已正式上線千問AI平台,同時也整合至阿里今日同步推出的Agent產品「千問辦公」,讓開發者與企業用戶可直接取用這款旗艦模型。在開源規劃方面,Qwen3.8-Max預計於下週對外開源,此外也將一併釋出Qwen3.8-27B,進一步擴大開發者生態。即日起,全球開發者皆可透過千問AI平台取得API服務,國內定價為每百萬Tokens輸入12元、輸出36元,隱式緩存命中時僅需1.5元;在國際市場上,輸入與輸出的價格分別僅為Opus 5的40%與24%,以更具成本效益的方式提供接近同等水準的智能表現。 本次發布的Qwen3.8-Max是千問系列中尺寸最大、性能最強的旗艦機型,支援視覺理解功能,上下文長度最高可達1M Tokens。在模型架構設計上,Qwen3.8透過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.4T,同時僅激活95B參數,在整體性能提升之際,也換來更高的推理效率與更快的回應速度,為大規模商用部署打下良好基礎。 在各項權威評測中,Qwen3.8-Max展現全面性的能力突破。在科研復現評測PaperBench這類程式智能體測試中,新模型較上一代大幅提升28.2分,以93.0分成績寫下評測新高;在WideSearch與Agent's Last Exam等通用智能體評測中,則分別取得81.9分與52.4分,位居業界前沿。此外,指令遵循IF Bench評測拿下82.8分,科學推理GPQA Diamond獲得92.6分,展現出均衡且優異的通用能力。在視覺推理BabyVision評測中,Qwen3.8-Max在無工具輔助的條件下取得82.0分,成績超越部分主流模型近兩倍;而在評估智能體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max以86.1分位居主流模型首位。 程式編寫能力是前沿大模型的核心指標之一,Qwen3.8在自主程式設計領域實現了關鍵突破。在權威的CodeArena榜單中,Qwen3.8名列全球第四。兩年前的前沿模型已能撰寫函數、補全代碼,成為程式設計師的重要輔助工具;如今的Qwen3.8更進一步,能從空文件夾出發,自主完成一個原本需要十數天才能交付的真實專案,全程無需人工介入。使用者只需要下達一句「建立一個自進化的智能體Harness」,Qwen3.8便會像資深工程師一般,從零開始建構循環工程框架,編排智能體自動領取並執行任務,人類工程師還能透過釘釘即時提出新的需求。 在實際驗證中,Qwen3.8獨立運行約16天,成功打造出一個具備Hermes Agent等級、真實可用的自進化智能體框架「oh-my-cli」。這個專案目前已完全開源,完整開發過程也公開保存在GitHub倉庫中,任何人都可以查看與複現,展示出大型語言模型從「輔助寫程式」走向「獨立交付軟體專案」的可能性。 除了程式能力,Qwen3.8在專業工作任務的執行上同樣表現突出。透過真實環境與算力的聯合強化學習擴展,Qwen3.8在數百種高價值、高頻率的專業任務中獲得實際表現的提升,並能在主流智能體框架中穩定輸出生產級成果。例如,一支法務助理團隊原本需要一週的時間,才能在數百份法律文件中標註超過千個相關條款,Qwen3.8在一小時內就能完成;籃球數據分析團隊需要逐幀標註160小時以上的比賽錄像,Qwen3.8花費數十分鐘就能精準拆解超過8400個攻防回合,並一次輸出球員戰術畫像與教練報告。在金融領域,一個金融研究團隊需憑藉多年專業知識積累,蒐集資本市場全面而即時的變動,才能依序完成量化策略研究,Qwen3.8則能自主調動並行的智能體,在連續工作數小時後交付完整的ETF輪動策略,並持續分析回測結果、動態修正參數,最終實現規模化盈利。 在長週期任務中,Qwen3.8進一步展現出系統級自主規劃與全棧閉環自適應學習能力。無論面對高精密、強物理約束的數字芯片設計任務,或是在高度動態、博弈激烈的商業模擬運營情境中,Qwen3.8都能透過「執行—反饋—迭代」的自適應閉環機制,在數千輪的超長程交互中,深度重構演算法與策略,表現出接近人類專家的規劃與判斷能力。 Qwen3.8在視覺理解方面也將AI的能力極限推升至新的層次。在權威的Vision Arena榜單中,Qwen3.8-Max位列全球第二。模型不僅能讀懂200頁的財務報告PDF,也能理解超過100小時的長篇影片內容,並進一步將這些視覺資訊反饋至整體工作流程中,輔助模型進行更全面的思考決策。在千問團隊自建的「應用復刻」基準RecreationBench長程任務中,模型在沒有原始程式碼、也無法連接網路的情況下,僅透過交互與反饋理解應用程式,就能從零開始完整復刻整個應用,展示出前沿水準的混合多模態智能體能力,也將視覺程式設計推向新的高度。 在基礎設施層面,阿里真武M890超節點已成功適配Qwen3.8,透過芯片、雲平台與千問大模型的全鏈路優化,有效提升推理效率並降低推理成本。在Agentic推理場景中,這項優化最多可實現1.5倍的性能提升,為Qwen3.8在企業級應用中的大規模部署提供了更扎實的底層支撐。整體而言,Qwen3.8以更快的速度、更穩定的表現與更全面的多模態能力,為全球開發者與企業用戶打開了新一代AI應用的想像空間。
Related
相關文章

當品牌開始爭奪AI的答案:翰智GEO入場
AI已取代搜尋引擎成為用戶獲取資訊的主要管道,品牌在AI問答中的形象變得更重要,GEO(生成式引擎優化)因而興起。央視「3·15」晚會揭露黑帽GEO亂象後,中國信通院發布行業標準,中央網信辦也啟動專項整治,合規與可信成為GEO入場門檻。企業級服務商翰智推出智慧版GEO業務,以可量化、可溯源、可驗收的工程化打法,搶進這條新賽道。

沐曦曦雲 C 系列 GPU 實現 Day 0 適配 MiniMax H3 多模態生成模型
沐曦股份宣布旗下曦雲 C 系列 GPU 完成對稀宇 MiniMax H3 多模態生成模型的 Day 0 適配,可快速部署並運用其多模態創作能力。此系列 GPU 採用自研架構,透過全棧自研 MXMACA 軟體棧,原生相容 PyTorch、TensorFlow 等 40 餘種主流 AI 框架,並支援超過 500 個 AI 模型穩定運行。

數億元!螞蟻AGI研究中心主任大模型創業,拿下新融資
杭州大模型公司西湖心辰宣布完成數億元人民幣B+輪融資,由廣發信德領投,螞蟻集團等老股東支持,資金將投入擴散語言模型研發、多模態實時互動產品迭代及海外市場拓展。該公司由現任螞蟻集團通用人工智能研究中心主任藍振忠創立,專注擴散範式大模型,並已在全球市場建立商業化閉環。

剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude
阿里巴巴突襲發表新一代基座大模型Qwen3.8-Max,總參數量達2.4兆,在編程、專業工作、長程任務與多模態分析等場景表現亮眼,於Arena榜單衝進全球第一梯隊,直逼Anthropic的Claude系列,部分程式能力甚至超過Claude Opus 5。官方並以低於國際大模型的價格策略(輸入每百萬Tokens人民幣12元等)吸引用戶,多位搶先體驗的網友也稱讚其性價比高、能自主完成從需求到交付的完整專案。

Day-0 支持,摩爾線程完成 MiniMax H3 多模態生成模型適配
首頁 > 智能時代>人工智能 Day-0 支持,摩爾線程完成 MiniMax H3 多模態生成模型適配 2026/8/3 13:19:15 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 8 月 3 日消息,今日,MiniMax 正式開源多模態生成模型 MiniMax H3。

阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里Qwen3.