量子位生成式AI

阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定

2026年8月3日 13:08
阿里Qwen3.8正式發佈,編程與辦公再進化,推理更快更穩定

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 阿里Qwen3.

站內 AI 整理稿

阿里巴巴於8月3日正式發表新一代基座大模型Qwen3.8,這款旗艦級模型以總參數量2.4萬億的規模登場,並在程式編寫與專業辦公兩大核心場景展現明顯升級。根據同日更新的權威第三方榜單Arena顯示,阿里Qwen模型整體表現僅次於Anthropic的Claude系列,穩居全球大模型第一梯隊。目前Qwen3.8的API已於千問AI平台正式上線,同時也同步接入阿里巴巴當日推出的Agent產品「千問辦公」,讓開發者與企業用戶能立即體驗這款新模型的完整能力。 在模型發布之際,阿里也同步公開了具體的服務方案。即日起,全球開發者可透過千問AI平台取得Qwen3.8的API服務,國內定價方面,每百萬Tokens輸入為人民幣12元、輸出為人民幣36元,而隱式緩存命中時的費用僅需1.5元。若以國際市場價格觀察,Qwen3.8輸入與輸出的費用分別僅為Opus5的40%與24%,在提供相近智慧水平的同時,展現出更高的性價比,對開發者而言具備相當吸引力。 此次發布的核心型號為千問大模型系列中尺寸最大、性能最強的Qwen3.8-Max。這款旗艦模型支援視覺理解能力,並具備高達1M Tokens的上下文長度,足以應付大量文件與複雜任務的處理需求。在模型架構上,Qwen3.8透過稀疏MoE架構與混合注意力機制的聯合優化,首次將千問大模型的總參數量拓展至2.4T,同時僅啟動95B參數,藉此實現更高的推理效率與更快的推理速度,也讓整體性能迎來新一輪突破。 從多項權威評測數據來看,Qwen3.8-Max的表現相當突出。在科研復現評測PaperBench等編程智能體評測中,Qwen3.8-Max較上一代模型大幅提升28.2分,以93.0分寫下評測新高;在WideSearch與Agent's Last Exam等通用智能體評測中,新模型分別獲得81.9分與52.4分,位居前沿。此外,Qwen3.8在指令遵循IF Bench評測中斬獲82.8分,科學推理GPQA Diamond則取得92.6分,整體通用能力均名列前茅。在視覺推理BabyVision評測中,Qwen3.8-Max在無工具條件下取得82.0分,超出部分主流模型近兩倍;而在評估智能體電腦操作能力的OSWorld-Verified評測中,Qwen3.8-Max更以86.1分位居主流模型首位。 編程能力一直是前沿大模型的核心競爭指標,而Qwen3.8在自主編程方面取得了新的突破。在權威的CodeArena榜單中,Qwen3.8位居全球第四。兩年前的前沿模型已經能寫好函數、補全代碼,成為程式設計師的得力助手;如今Qwen3.8更進一步,可以從一個空文件夾出發,自主完成一個時長十數天的真實專案交付,整個過程無需人為干預。例如,使用者只需說一句「創建一個自進化的智能體Harness」,Qwen3.8就會像資深工程師一樣,從零開始自主搭建循環工程框架,編排智能體自動領取並執行任務,而人類工程師還能透過釘釘隨時向Qwen3.8提出新要求。在長達約16天的獨立編程運行後,Qwen3.8成功打造出一個Hermes Agent等級、真實可用的自進化智能體框架「oh-my-cli」,目前該專案已完全開源,完整過程公開保存在GitHub倉庫中,供所有人檢視。 除程式開發外,Qwen3.8也展現出勝任廣泛真實專業任務的能力。面對完全不同的專業任務、評判標準與計算需求,Qwen3.8透過真實環境與算力的聯合強化學習擴展,實現數百種高價值、高頻專業任務的真實表現提升,在主流的智能體框架中均可穩定可靠地交付生產級成果。以實際場景為例,一支法務助理團隊要在數百份法律文件中標註千餘個相關條款,通常需要一週時間,而Qwen3.8在一小時內就能完成;籃球數據分析團隊需要逐幀標註160小時以上的比賽錄像,Qwen3.8只需數十分鐘就能精準拆解超過8400個攻防回合,並一次輸出球員戰術畫像與教練報告;金融研究團隊原本需要基於數年專業知識累積與全面即時的資本市場資訊,才能完成的量化策略研究,Qwen3.8則能自主調動並行的智能體,連續工作數小時後交付完整的ETF輪動策略,並持續分析回測、動態修正,最終實現規模化盈利。 在長週期任務中,Qwen3.8更湧現出系統級的自主規劃與全棧閉環自適應學習能力。無論是在高精密、強物理約束的數字芯片設計領域,還是在高度動態、博弈激烈的商業模擬運營情境中,Qwen3.8均能透過「執行—反饋—迭代」的自適應閉環,在數千輪的超長程交互中實現演算法與策略的深度重構,展現出接近人類專家的工作節奏與判斷品質。 除了強大的文本與推理能力,Qwen3.8也將AI視覺理解能力推向新的極限。在權威的Vision Arena榜單中,Qwen3.8-Max排名全球第二。Qwen3.8不僅能讀懂200頁的財報PDF、看懂超過100小時的長視頻,更能將這些「看到」的知識與資訊回饋到工作全流程中,協助模型思考得更周全。在千問團隊自建的「應用復刻」基準RecreationBench長程任務中,模型在沒有原始碼、無法聯網的情況下,只透過交互與回饋理解應用程式,卻能從零完整復刻出整個應用。這項成果顯示,Qwen3.8已經展現出前沿水準的混合多模態智能體能力,透過「迭代編程—交互回饋」的反覆循環,將視覺編程推向新的高度。 在基礎設施方面,阿里真武M890超節點也已成功適配Qwen3.8。透過晶片、雲平台與千問大模型的全鏈路優化,能夠顯著提升推理效率並降低推理成本,在Agentic推理場景中最多可實現1.5倍的性能提升。據了解,Qwen3.8-Max預計將於下週開源,同時也會釋出Qwen3.8-27B版本,進一步擴大開放生態,讓更多開發者與研究人員能夠基於這款先進模型進行二次開發與應用創新。

Related

相關文章

智東西生成式AI

數億元!螞蟻AGI研究中心主任大模型創業,拿下新融資

杭州大模型公司西湖心辰宣布完成數億元人民幣B+輪融資,由廣發信德領投,螞蟻集團等老股東支持,資金將投入擴散語言模型研發、多模態實時互動產品迭代及海外市場拓展。該公司由現任螞蟻集團通用人工智能研究中心主任藍振忠創立,專注擴散範式大模型,並已在全球市場建立商業化閉環。

剛剛
量子位生成式AI

剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude

阿里巴巴突襲發表新一代基座大模型Qwen3.8-Max,總參數量達2.4兆,在編程、專業工作、長程任務與多模態分析等場景表現亮眼,於Arena榜單衝進全球第一梯隊,直逼Anthropic的Claude系列,部分程式能力甚至超過Claude Opus 5。官方並以低於國際大模型的價格策略(輸入每百萬Tokens人民幣12元等)吸引用戶,多位搶先體驗的網友也稱讚其性價比高、能自主完成從需求到交付的完整專案。

剛剛
IT之家生成式AI

Day-0 支持,摩爾線程完成 MiniMax H3 多模態生成模型適配

首頁 > 智能時代>人工智能 Day-0 支持,摩爾線程完成 MiniMax H3 多模態生成模型適配 2026/8/3 13:19:15 來源:IT之家 作者:浩渺 責編:浩渺 評論: 感謝IT之家網友 華南吳彥祖 的線索投遞! IT之家 8 月 3 日消息,今日,MiniMax 正式開源多模態生成模型 MiniMax H3。

剛剛
量子位生成式AI

賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發!

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 賽博義父Tibo爆料:谷歌早一年就做出了ChatGPT,硬是沒敢發! Jay 2026-08-03 12:29:44 來源:量子位 終究還是喜提了「美國豆包」 Jay 發自 凹非寺 量子位 | 公眾號 QbitAI 啥,谷歌真比OpenAI還早一年搞出了ChatGPT? 不是谷歌事後找補了,這次是OpenAI自己人,Codex負責人Tibo剛佐證的消息: 那就是早一年版的ChatGPT。最初叫LMChat,後來又換了另一個代號。 谷歌太緊張了,不敢發佈它,而DeepMind則被禁止推出可能衝擊谷歌業務的產品。 但Tibo為啥對這段陳年舊事如此瞭如指掌? 答案是:他當時就在那支谷歌團隊裡。 我當時就是那個團隊的一員。 是的,如今為OpenAI打造「無限Token」的Tibo,正是當年穀歌那個項目的親歷者。 網友都震驚了,Tibo還有這麼一段經歷: 不er,我還以為你只是個Codex的重置按鈕(bushi)。 Jeff Dean:我不甘心啊!! 事情是這樣的,一名Midjourney工程師,最近在X上翻出了前谷歌大腦負責人Jeff Dean的一段舊採訪: 我有時會想Jeff Dean的那次採訪,他說他們在ChatGPT之前就有一個內部的Chatbot,但覺得用它還不如直接用谷歌搜索。 沒想到Tibo親自下場回覆,和Jeff Dean來了波隔空對話: Jeff說的那個項目確實存在,最初叫LMChat,幾乎就是一個早了一年的ChatGPT。 至於為啥沒發出來,Tibo無奈地表示,DeepMind沒這權限啊,LLM會衝擊谷歌搜索,老闆們緊張壞了,不給拍板。

剛剛

生成模型也能端到端訓練了?核心竟是一個for循環

2012年,AlexNet以一場壓倒性的勝利終結了一個時代。在此之前,圖像識別依賴於人工精心設計的一層層特徵提取流程;AlexNet則證明了一件後來被反覆驗證的事:將整個任務端到端地交給模型自己學習,幾乎總能勝過人類設計的分階段流水線。從圖像分類到目標檢測再到圖像分割,深度學習的每一次躍遷背後,都離不開「讓它自己一口氣學完」這個核心思路。 然而,有一個領域始終是例外:生成模型。當今最強、最具擴展性的生成模型,無論是自迴歸還是擴散模型,都不是端到端的。

剛剛