剛剛,阿里Qwen3.8-Max來了!衝進全球第一梯隊,模型表現直逼Claude

重點摘要
阿里巴巴突襲發表新一代基座大模型Qwen3.8-Max,總參數量達2.4兆,在編程、專業工作、長程任務與多模態分析等場景表現亮眼,於Arena榜單衝進全球第一梯隊,直逼Anthropic的Claude系列,部分程式能力甚至超過Claude Opus 5。官方並以低於國際大模型的價格策略(輸入每百萬Tokens人民幣12元等)吸引用戶,多位搶先體驗的網友也稱讚其性價比高、能自主完成從需求到交付的完整專案。
阿里巴巴日前無預警發表新一代基座大模型 Qwen3.8-Max,總參數量高達 2.4 兆,主打在編程、專業工作、長程任務與多模態智能體等場景的全面進化。模型一登場便在權威第三方評測榜單 Arena 中一舉擠進全球第一梯隊,整體表現直逼 Anthropic 的 Claude 系列,其中在編程領域甚至超越 Claude Opus 5 與 Fable 5 的 High 版本,引發市場高度關注。這款新模型的定價策略同樣來勢洶洶。官方公布的費率顯示,國內每百萬 Tokens 輸入為 12 元、輸出為 36 元,隱式緩存命中時輸入價格更僅需 1.
5 元;至於國際價格,輸入與輸出費用分別僅為 Opus 5 的 40% 與 24%。如此一來,等於以相對親民的價格,提供接近頂級模型的表現,讓「性能強」與「負擔得起」這兩項條件首次同時成立。事實上,在正式發表之前,已有不少開發者搶先體驗 Qwen3.8-Max 預覽版。有人用它從零開始復刻出一版《憤怒的小鳥》,實際使用一週後,額度消耗不到九成,並直言價格確實合適;也有創作者僅靠一條提示詞,就成功打造出完整且可互動的開發者作品集,對整體成果讚譽有加。更有測試者觀察到,Qwen3.8-Max 在基準測試中的數據甚至碾壓競品 5.6-Sol,讓外界對其他閉源高價模型的期望產生動搖。
為了實際驗證這款模型的能耐,媒體也針對其主打能力進行多輪實測。首先考驗的是 AI Coding 能力,在一份接近正式產品規格的需求文件要求下,Qwen3.8-Max 歷時約五分鐘,便交付了一個具備完整功能的 AI 資訊網頁。過程中從需求拆解、技術選型、項目結構到功能實作,每個環節都井然有序。最令人驚艷的是,模型還額外整理了一份「問題與解決記錄」,將開發過程中遇到的報錯與修復過程一一列出,甚至在交付前自行執行功能驗收,從安裝依賴、本地啟動到生產建置與預覽,全面確認專案可運行性,全程無需人工介入。除了程式開發,長文本交叉分析也是 Qwen3.8-Max 的強項。
測試團隊餵入一篇由 AI 大神卡帕西參與撰寫、厚達數十頁的學術論文,內容涵蓋正文、圖表與附錄,並要求模型比較 ILSVRC 與 PASCAL VOC 兩套電腦視覺評測基準的難易度。這道題目的困難之處在於,答案分散於章節、表格與圖表之中,必須進行跨區塊比對才能得出結論。Qwen3.8-Max 只花了約 33 秒,便給出明確判斷:若只看整體平均值,PASCAL VOC 似乎較難,但若深入檢視可比類別與 ILSVRC 的困難子集,ILSVRC 在多項定位難度指標上反而更接近甚至超越 PASCAL。模型不僅論述有據,還自動生成了一份詳盡的分析報告,將原文表格直接抽出作為佐證,定位精準度令人印象深刻。
多模態內容理解同樣是此次測試重點。媒體將一集長度接近 70 分鐘的影片播客交給 Qwen3.8-Max,內容涵蓋 Sam Altman 從 AI 創業一路談到 OpenAI 戰略與未來社會等龐雜主題。模型在短短兩三分鐘內,便生成了一份依核心觀點劃分的完整主題時間軸,每個話題都採用「先總結、再展開」的結構,並一一對應到原始片段的時間戳。這項能力讓使用者可以直接跳轉至感興趣的段落,省去大量手動查找的時間。從實際表現來看,Qwen3.8-Max 的定位已經不只是「生成工具」,而是具備端到端交付能力的 AI 助手。
它能從零開始推進一項完整工程,過程中自主解決問題,最終交出可運行、可驗證的成果,這樣的整合能力在目前模型市場中實屬罕見。而這樣的底氣,來自於阿里在開源領域的長期布局。自 2023 年啟動開源以來,Qwen 家族已累計釋出超過 400 個模型,衍生模型數量突破 20 萬個,總下載量超過 10 億次,是目前全球規模最龐大的開源大模型體系。更重要的是,Qwen 的迭代節奏幾乎未曾停歇。從 Qwen3、Qwen3.5 到如今的 Qwen3.8,每一代都讓更多應用場景從「想像」走向「實用」:從基礎推理延伸到程式開發、專業工作、多模態理解與長程 Agent 任務,進而推展至如今的端到端交付。
這種穩健而密集的更新頻率,放眼全球也少有敵手,也讓「模型能力、場景覆蓋與價格」這組過去難以兼得的三角關係,首次有了同時滿足的可能性。目前,Qwen3.8 的 API 已正式上線千問 AI 平台,同時也接入阿里同步推出的 Agent 產品「千問辦公」,有興趣的使用者可直接前往相關平台實際體驗。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。