量子位模型更新

Artificial Analysis榜單:阿里Qwen3.8Agentic能力得分全球第一

2026年8月6日 15:50
Artificial Analysis榜單:阿里Qwen3.8Agentic能力得分全球第一

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> Artificial Analysis榜單:阿里Qwen3.

站內 AI 整理稿

國際權威AI評測機構Artificial Analysis今日正式公布最新一期智能體能力排行榜,阿里巴巴通義千問團隊研發的Qwen3.8-Max模型一舉奪下全球第一,在Agentic Index項目中超越業界長期佔據領先地位的Claude Opus5與GPT5,成為該榜單歷史上首個來自中國的冠軍模型。這項成績不僅刷新了中國AI模型在智能體領域的標杆,更標誌著國產大模型在複雜任務自主執行能力上已邁入全球頂尖水準。

Artificial Analysis是業界高度關注的第三方評測平台,其推出的Agentic Index又稱「智能體指數」,專門用來衡量AI模型在真實場景中調用工具、規劃行動與解決問題的綜合能力。不同於傳統的問答或文本生成測試,Agentic Index更側重模型能否自主理解任務目標、選擇合適的API或外部工具、執行多步驟推理,並在過程中適時調整策略。這項能力被視為AI從「對話助手」走向「專業代理人」的關鍵門檻,也是企業級應用落地的核心指標。長期以來,Agentic Index榜單的冠軍寶座幾乎被海外頂尖模型壟斷。

Claude Opus5由Anthropic開發,其在前幾代版本中就以強大的工具使用和邏輯推理著稱;GPT5則是OpenAI的旗艦產品,在多項AI能力測試中穩居前列。這兩款模型輪流佔據榜首,讓其他競爭者難以望其項背。在中國模型中,此前最好的成績來自Kimi K3,曾以50.4分的表現登上該榜單,但距離冠軍仍有明顯差距。如今Qwen3.8-Max一舉超越這些強敵,無疑是中國AI技術實力的一次重要突破。據了解,Qwen3.8-Max是阿里巴巴通義千問團隊推出的最新旗艦模型,延續了Qwen系列一貫的高性能與開源生態優勢。

該模型採用混合專家(MoE)架構,在保持推理效率的同時大幅擴展了參數規模與任務處理能力。尤其在智能體場景中,Qwen3.8-Max能夠精準理解用戶指令,自動調用搜尋引擎、計算器、數據庫、代碼執行器等多種工具,並根據中間結果動態調整下一步行動,有效完成從資訊檢索到報告生成的完整閉環。這使得它在需要多步協作與複雜判斷的場景中表現突出。業內人士分析,智能體能力的提升是AI從「對話」進化到「行動」的關鍵。過去,模型擅長生成文字,但無法真正執行任務;如今,像Qwen3.8-Max這樣的模型已經能夠自主操作網頁、填寫表單、分析數據,甚至串聯多個軟體服務。

這意味著AI不僅能回答問題,還能直接幫助用戶完成工作流程中的實際操作,例如自動化客服、智能運維、科學研究輔助等。Artificial Analysis的榜單正是從這一角度出發,持續追蹤各模型在真實工具使用場景下的表現。阿里巴巴在AI領域的布局向來注重技術落地與開源生態。通義千問團隊自2023年推出首代Qwen模型以來,持續迭代,並陸續開源多個版本,吸引全球開發者基於其進行二次開發與應用部署。Qwen3.8-Max的問世,不僅在評測榜單上取得佳績,更在業界獲得了廣泛關注。阿里雲此前已宣布將該模型整合至其企業級AI服務平台,支持用戶快速構建智能體應用。

此次登上Artificial Analysis榜首,進一步驗證了阿里在AI基礎模型與智能體技術上的積累。值得關注的是,Agentic Index的評測重點並非單純的模型參數大小,而是模型在真實工具環境中的表現。這對模型的理解能力、推理深度、錯誤恢復機制以及對外部API的適配能力都提出了極高要求。Qwen3.8-Max能在這些維度上超越Claude Opus5和GPT5,顯示出阿里在模型訓練策略與工程優化上的獨到之處。儘管目前具體分數尚未公開,但榜單排名已足以說明其在智能體領域的領先地位。從全球AI競爭格局來看,智能體能力正成為下一階段模型比拼的核心賽道。

OpenAI、Anthropic、Google等巨頭都在全力推進模型從「對話」到「行動」的躍遷,而中國廠商也並未落後。繼Kimi K3取得突破後,Qwen3.8-Max的奪冠意味著中國AI模型在這一關鍵領域已具備與國際頂尖模型正面競爭的能力。未來,隨著更多模型加入智能體評測,各廠商之間的技術差距將進一步縮小,而用戶也將迎來更強大、更實用的AI助手。Artificial Analysis的榜單同時也提醒業界,模型的智能體能力並非靜態,而是需要持續迭代與場景驗證。阿里方面表示,通義千問團隊將繼續優化Qwen系列模型,特別是在多工具協同、長上下文記憶以及安全可控等方面,以滿足更多專業場景的需求。

此次Qwen3.8-Max的成績,不僅是對其一貫技術路線的肯定,也為中國AI產業在國際舞台上增添了新的亮點。可以預見,在智能體這個新賽道上,競爭將更加激烈,而屬於中國模型的時刻才剛剛開始。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

45 分鐘前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

46 分鐘前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

1 小時前