量子位生成式AI

剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude

2026年8月3日 13:50
剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude

重點摘要

阿里巴巴突襲發表新一代基座大模型Qwen3.8-Max,總參數量達2.4兆,在編程、專業工作、長程任務與多模態分析等場景表現亮眼,於Arena榜單衝進全球第一梯隊,直逼Anthropic的Claude系列,部分程式能力甚至超過Claude Opus 5。官方並以低於國際大模型的價格策略(輸入每百萬Tokens人民幣12元等)吸引用戶,多位搶先體驗的網友也稱讚其性價比高、能自主完成從需求到交付的完整專案。

站內 AI 整理稿

阿里巴巴日前無預警發表新一代基座大模型 Qwen3.8-Max,總參數量高達 2.4 兆,主打在編程、專業工作、長程任務與多模態智能體等場景的全面進化。模型一登場便在權威第三方評測榜單 Arena 中一舉擠進全球第一梯隊,整體表現直逼 Anthropic 的 Claude 系列,其中在編程領域甚至超越 Claude Opus 5 與 Fable 5 的 High 版本,引發市場高度關注。這款新模型的定價策略同樣來勢洶洶。官方公布的費率顯示,國內每百萬 Tokens 輸入為 12 元、輸出為 36 元,隱式緩存命中時輸入價格更僅需 1.

5 元;至於國際價格,輸入與輸出費用分別僅為 Opus 5 的 40% 與 24%。如此一來,等於以相對親民的價格,提供接近頂級模型的表現,讓「性能強」與「負擔得起」這兩項條件首次同時成立。事實上,在正式發表之前,已有不少開發者搶先體驗 Qwen3.8-Max 預覽版。有人用它從零開始復刻出一版《憤怒的小鳥》,實際使用一週後,額度消耗不到九成,並直言價格確實合適;也有創作者僅靠一條提示詞,就成功打造出完整且可互動的開發者作品集,對整體成果讚譽有加。更有測試者觀察到,Qwen3.8-Max 在基準測試中的數據甚至碾壓競品 5.6-Sol,讓外界對其他閉源高價模型的期望產生動搖。

為了實際驗證這款模型的能耐,媒體也針對其主打能力進行多輪實測。首先考驗的是 AI Coding 能力,在一份接近正式產品規格的需求文件要求下,Qwen3.8-Max 歷時約五分鐘,便交付了一個具備完整功能的 AI 資訊網頁。過程中從需求拆解、技術選型、項目結構到功能實作,每個環節都井然有序。最令人驚艷的是,模型還額外整理了一份「問題與解決記錄」,將開發過程中遇到的報錯與修復過程一一列出,甚至在交付前自行執行功能驗收,從安裝依賴、本地啟動到生產建置與預覽,全面確認專案可運行性,全程無需人工介入。除了程式開發,長文本交叉分析也是 Qwen3.8-Max 的強項。

測試團隊餵入一篇由 AI 大神卡帕西參與撰寫、厚達數十頁的學術論文,內容涵蓋正文、圖表與附錄,並要求模型比較 ILSVRC 與 PASCAL VOC 兩套電腦視覺評測基準的難易度。這道題目的困難之處在於,答案分散於章節、表格與圖表之中,必須進行跨區塊比對才能得出結論。Qwen3.8-Max 只花了約 33 秒,便給出明確判斷:若只看整體平均值,PASCAL VOC 似乎較難,但若深入檢視可比類別與 ILSVRC 的困難子集,ILSVRC 在多項定位難度指標上反而更接近甚至超越 PASCAL。模型不僅論述有據,還自動生成了一份詳盡的分析報告,將原文表格直接抽出作為佐證,定位精準度令人印象深刻。

多模態內容理解同樣是此次測試重點。媒體將一集長度接近 70 分鐘的影片播客交給 Qwen3.8-Max,內容涵蓋 Sam Altman 從 AI 創業一路談到 OpenAI 戰略與未來社會等龐雜主題。模型在短短兩三分鐘內,便生成了一份依核心觀點劃分的完整主題時間軸,每個話題都採用「先總結、再展開」的結構,並一一對應到原始片段的時間戳。這項能力讓使用者可以直接跳轉至感興趣的段落,省去大量手動查找的時間。從實際表現來看,Qwen3.8-Max 的定位已經不只是「生成工具」,而是具備端到端交付能力的 AI 助手。

它能從零開始推進一項完整工程,過程中自主解決問題,最終交出可運行、可驗證的成果,這樣的整合能力在目前模型市場中實屬罕見。而這樣的底氣,來自於阿里在開源領域的長期布局。自 2023 年啟動開源以來,Qwen 家族已累計釋出超過 400 個模型,衍生模型數量突破 20 萬個,總下載量超過 10 億次,是目前全球規模最龐大的開源大模型體系。更重要的是,Qwen 的迭代節奏幾乎未曾停歇。從 Qwen3、Qwen3.5 到如今的 Qwen3.8,每一代都讓更多應用場景從「想像」走向「實用」:從基礎推理延伸到程式開發、專業工作、多模態理解與長程 Agent 任務,進而推展至如今的端到端交付。

這種穩健而密集的更新頻率,放眼全球也少有敵手,也讓「模型能力、場景覆蓋與價格」這組過去難以兼得的三角關係,首次有了同時滿足的可能性。目前,Qwen3.8 的 API 已正式上線千問 AI 平台,同時也接入阿里同步推出的 Agent 產品「千問辦公」,有興趣的使用者可直接前往相關平台實際體驗。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

45 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

3 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前