何夕2077模型更新

阿里新模型跑分疑似洩露

2026年7月20日 00:00

重點摘要

阿里新模型跑分疑似洩露。 內測消息稱Qwen3.8-Max衝榜。編碼表現���僅落後最強模型一截。即刻測試披露原帖提到四百任務。協作任務據稱已經壓過Opus。相關成績仍等待官方最終確認。

站內 AI 整理稿

# 阿里新模型跑分疑似洩露,Qwen3.8-Max 據傳編碼能力逼近最強、協作超車 Opus

中國 AI 大模型領域近日再掀波瀾。據業內知名人士「何夕2077」披露,阿里巴巴旗下語言模型團隊正準備推出的新一代旗艦模型「Qwen3.8-Max」,其內部評測跑分成績疑似在官方正式發布前提前外流,消息一出立刻在 AI 圈引發廣泛討論與關注。由於該模型被視為阿里巴巴在大語言模型戰場上對抗 GPT-4 及 Claude 3 系列的重要籌碼,此次成績曝光格外受到市場矚目。 根據「何夕2077」釋出的資訊,Qwen3.8-Max 目前已完成多項內部基準測試,據稱已接近登上主流評測排行榜的階段。這些外流的數據並非來自官方公告,而是透過即時測試平台上的原始帖子流出。消息指出,該模型在多達四百項任務的評測中接受了檢驗,任務場景涵蓋範圍極廣,從程式碼生成、邏輯推理到多輪對話與長文本理解均有涉及,整體評估規模遠超一般模型的標準測試項目。 在具體成績方面,最受外界關注的莫過於編碼能力的表現。據該洩露資訊描述,Qwen3.8-Max 在編碼任務中僅落後當前業界最強模型「一小段差距」。考慮到目前頂尖編碼模型包含 GPT-4-Turbo 與 Claude 3 Opus 等強勁對手,能夠在編碼領域達成如此接近的成績,意味著阿里巴巴在程式語言理解與生成方面的技術儲備已達到世界一流水準。此外,若該成績屬實,也代表開源或半開源陣營與閉源頂尖模型之間的差距正在顯著縮小。 更令業界震動的另一項資訊是,Qwen3.8-Max 在「協作任務」方面的表現據傳已超越先前業界的標竿模型 Opus。所謂協作任務,通常泛指模型在複雜指令理解、角色扮演、細膩語境感知以及需要多步推理的人機協作場景中的表現。由於 Claude 3 Opus 向來以「協作感」與「遵循複雜指令」的細膩度著稱,甚至被不少開發者視為在工作流整合上的首選模型,若 Qwen3.8-Max 確實在該維度實現超越,將是中國國產大模型在「質感」與「實用性」上的一次重要突破。 然而,針對這份流傳甚廣的內部評測數據,阿里巴巴官方截至目前為止並未發表任何確認或否認的聲明。一名不願具名的業內人士分析指出,此類「洩露」在 AI 業界並不罕見,有時確實為內部測試人員不慎流出,有時也帶有為產品預熱的試探性質。但無論動機為何,該洩露資訊已經成功將公眾與投資者的目光再次聚焦在阿里雲旗下的通義千問系列模型發展進程上。 值得注意的是,若將此次洩露的成績對比阿里巴巴過往發布的 Qwen 系列模型,可以觀察到一條清晰的技術躍遷曲線。從最初的 Qwen-7B 到 Qwen1.5 系列,再到傳聞中的 3.8-Max,阿里巴巴在模型架構、訓練資料質量以及強化學習對齊方面持續投入了龐大資源。如果跑分數據屬實,這意味著阿里巴巴可能已經在 MoE(混合專家模型)架構或更大規模的訓練集群調度上取得關鍵進展,從而實現了性能的飛躍。 不過,也有業界專家對這份「洩露成績」表達了謹慎態度。有觀點認為,評測基準雖然涵蓋四百項任務,但這類內部測試的環境與題目設定與第三方獨立評測可能存在差異,真實實力仍需經歷 LMSYS Chatbot Arena 等大規模盲測排行榜的考驗。此外,「編碼任務落後一小段」與「協作超越 Opus」這兩項描述本身略顯模糊,缺乏具體量化分數的支撐,在官方公布完整報告之前,外界仍應審慎看待。 對整個 AI 產業而言,此次阿里新模型跑分的流出也再次印證了 2025 年大模型軍備競賽的白熱化程度。隨著 OpenAI、Google、Anthropic 及中國的百度、字節跳動等巨頭持續迭代產品,任何一個百分點的效能提升都可能成為市場競爭的勝負手。若 Qwen3.8-Max 最終證實確有接近或部分超越頂尖閉源模型的實力,不僅將重塑全球開源大模型的競爭格局,也可能加速企業級客戶從國外模型向國產模型的遷移。 對於開發者社群而言,這則消息更是一劑強心針。過去一段時間,中國國產模型在多模態領域進展迅速,但在純文字編碼與複雜協作的細膩度上始終與海外頂尖產品存在「隱形鴻溝」。如果 Qwen3.8-Max 真的填補了這塊拼圖,那將意味著中國開發者有望在不久後使用到媲美 GPT-4 等級的國產模型,從而大幅降低應用開發過程中的 API 依賴與成本。 綜上所述,雖然「何夕2077」的爆料為市場帶來了豐富的想像空間,但最終結論仍需等待阿里巴巴的官方公告。按照業界慣例,如此重大的模型發布通常會在數周內正式亮相。屆時,所有未經證實的傳言都將迎來真相的檢驗。在此期間,建議各方保持理性觀察,一方面肯定國產模型取得的長足進步,另一方面也耐心等待更具透明度的第三方評測結果出爐。畢竟,在 AI 領域,真正的實力從來不需要隱藏在洩露的帖子背後——它終將在實際應用與公開測試中展現出最真實的模樣。

Related

相關文章

IT之家模型更新

月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部

首頁 > 智能時代>人工智能 月之暗面喊話馬斯克:歡迎加入“2 萬億 +”俱樂部 2026/7/20 22:20:14 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 7 月 20 日消息,近日,月之暗面發佈的新一代開源大模型 Kimi K3 登頂全球榜單,引發廣泛關注。7 月 18 日上午,埃隆 · 馬斯克(Elon Musk)在社交平臺發文稱,旗下 2 萬億參數模型在各方面都優於當前的 1.

1 小時前

WAIC之夜:Token堆不出“AI原生”組織

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作WAIC之夜:Token堆不出“AI原生”組織36氪的朋友們·2026年07月20日 21:09Tokenmaxing的終局與新序章 2026年上半年,AI行業最熱的兩個詞是Agent和Tokenmaxing。前者意味著模型開始從“回答問題”走向“完成任務”,後者希望通過更長上下文、更多推理步驟和更高的Token消耗,換取更復雜的任務能力。 但Tokenmaxing很快暴露出另一面。為了讓公司成為更“AI原生”的組織,一些企業把Token消耗量當作轉型指標,甚至納入團隊KPI。調用量不斷增長,實際產出、任務完成率和商業回報卻未必同步提升。行業由此開始重新討論:Token真正的價值,究竟來自消耗規模,還是來自它所進入的產品、工作流和組織系統? 7月17日晚,在2026世界人工智能大會(WAIC)舉辦期間,由騰訊新聞、騰訊科技主辦,騰訊華東總部、騰訊雲智能特別支持的“騰訊WAIC之夜”在上海舉行。騰訊科技高級編輯、AI未來指北主理人郭曉靜主持首場圓桌,崑崙萬維董事長兼CEO方漢、出門問問創始人兼CEO李志飛、沐曦股份聯合創始人、CTO楊建,圍繞模型、產品與組織三個層面,討論了Tokenmaxing退潮後浮現出的新問題。

2 小時前

AI巨頭正在爭奪人類的錯題本

AI 巨頭之間的競賽正從算力、數據量,延伸到一個更細膩的戰場——人類的「錯題本」。過去,大規模、高品質的標註數據是模型訓練的關鍵,但隨著參數量與訓練資料逐漸飽和,業界開始意識到,單純的「正確答案」不再能拉開差距;真正能帶來複利效應的,是那些經過反饋修正的錯誤。每一次人類犯錯後被指正、被記錄的過程,都相當於為模型提供了一面鏡子,讓它更精準地理解邊界與上下文。

2 小時前
IT之家模型更新

OpenAI 高管批 Kimi K3 開源,硅谷多方駁斥其觀點

OpenAI 戰略負責人 Dean Ball 批評中國公司月之暗面的開源模型 Kimi K3,認為其可能帶來風險,並建議透過監管手段製造不確定性。此舉引發硅谷多位人士反駁,包括風險投資人 David Sacks,批評 OpenAI 試圖利用監管消滅開源競爭對手,並強調開放競爭的重要性。

3 小時前

WAICA正式啟航:打破全球AI學術版圖,上海迎來關鍵拼圖

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

4 小時前