阿里新模型跑分疑似洩露
重點摘要
阿里新模型跑分疑似洩露。 內測消息稱Qwen3.8-Max衝榜。編碼表現���僅落後最強模型一截。即刻測試披露原帖提到四百任務。協作任務據稱已經壓過Opus。相關成績仍等待官方最終確認。
# 阿里新模型跑分疑似洩露,Qwen3.8-Max 據傳編碼能力逼近最強、協作超車 Opus
中國 AI 大模型領域近日再掀波瀾。據業內知名人士「何夕2077」披露,阿里巴巴旗下語言模型團隊正準備推出的新一代旗艦模型「Qwen3.8-Max」,其內部評測跑分成績疑似在官方正式發布前提前外流,消息一出立刻在 AI 圈引發廣泛討論與關注。由於該模型被視為阿里巴巴在大語言模型戰場上對抗 GPT-4 及 Claude 3 系列的重要籌碼,此次成績曝光格外受到市場矚目。根據「何夕2077」釋出的資訊,Qwen3.8-Max 目前已完成多項內部基準測試,據稱已接近登上主流評測排行榜的階段。這些外流的數據並非來自官方公告,而是透過即時測試平台上的原始帖子流出。
消息指出,該模型在多達四百項任務的評測中接受了檢驗,任務場景涵蓋範圍極廣,從程式碼生成、邏輯推理到多輪對話與長文本理解均有涉及,整體評估規模遠超一般模型的標準測試項目。在具體成績方面,最受外界關注的莫過於編碼能力的表現。據該洩露資訊描述,Qwen3.8-Max 在編碼任務中僅落後當前業界最強模型「一小段差距」。考慮到目前頂尖編碼模型包含 GPT-4-Turbo 與 Claude 3 Opus 等強勁對手,能夠在編碼領域達成如此接近的成績,意味著阿里巴巴在程式語言理解與生成方面的技術儲備已達到世界一流水準。此外,若該成績屬實,也代表開源或半開源陣營與閉源頂尖模型之間的差距正在顯著縮小。
更令業界震動的另一項資訊是,Qwen3.8-Max 在「協作任務」方面的表現據傳已超越先前業界的標竿模型 Opus。所謂協作任務,通常泛指模型在複雜指令理解、角色扮演、細膩語境感知以及需要多步推理的人機協作場景中的表現。由於 Claude 3 Opus 向來以「協作感」與「遵循複雜指令」的細膩度著稱,甚至被不少開發者視為在工作流整合上的首選模型,若 Qwen3.8-Max 確實在該維度實現超越,將是中國國產大模型在「質感」與「實用性」上的一次重要突破。然而,針對這份流傳甚廣的內部評測數據,阿里巴巴官方截至目前為止並未發表任何確認或否認的聲明。
一名不願具名的業內人士分析指出,此類「洩露」在 AI 業界並不罕見,有時確實為內部測試人員不慎流出,有時也帶有為產品預熱的試探性質。但無論動機為何,該洩露資訊已經成功將公眾與投資者的目光再次聚焦在阿里雲旗下的通義千問系列模型發展進程上。值得注意的是,若將此次洩露的成績對比阿里巴巴過往發布的 Qwen 系列模型,可以觀察到一條清晰的技術躍遷曲線。從最初的 Qwen-7B 到 Qwen1.5 系列,再到傳聞中的 3.8-Max,阿里巴巴在模型架構、訓練資料質量以及強化學習對齊方面持續投入了龐大資源。
如果跑分數據屬實,這意味著阿里巴巴可能已經在 MoE(混合專家模型)架構或更大規模的訓練集群調度上取得關鍵進展,從而實現了性能的飛躍。不過,也有業界專家對這份「洩露成績」表達了謹慎態度。有觀點認為,評測基準雖然涵蓋四百項任務,但這類內部測試的環境與題目設定與第三方獨立評測可能存在差異,真實實力仍需經歷 LMSYS Chatbot Arena 等大規模盲測排行榜的考驗。此外,「編碼任務落後一小段」與「協作超越 Opus」這兩項描述本身略顯模糊,缺乏具體量化分數的支撐,在官方公布完整報告之前,外界仍應審慎看待。
對整個 AI 產業而言,此次阿里新模型跑分的流出也再次印證了 2025 年大模型軍備競賽的白熱化程度。隨著 OpenAI、Google、Anthropic 及中國的百度、字節跳動等巨頭持續迭代產品,任何一個百分點的效能提升都可能成為市場競爭的勝負手。若 Qwen3.8-Max 最終證實確有接近或部分超越頂尖閉源模型的實力,不僅將重塑全球開源大模型的競爭格局,也可能加速企業級客戶從國外模型向國產模型的遷移。對於開發者社群而言,這則消息更是一劑強心針。過去一段時間,中國國產模型在多模態領域進展迅速,但在純文字編碼與複雜協作的細膩度上始終與海外頂尖產品存在「隱形鴻溝」。如果 Qwen3.
8-Max 真的填補了這塊拼圖,那將意味著中國開發者有望在不久後使用到媲美 GPT-4 等級的國產模型,從而大幅降低應用開發過程中的 API 依賴與成本。綜上所述,雖然「何夕2077」的爆料為市場帶來了豐富的想像空間,但最終結論仍需等待阿里巴巴的官方公告。按照業界慣例,如此重大的模型發布通常會在數周內正式亮相。屆時,所有未經證實的傳言都將迎來真相的檢驗。在此期間,建議各方保持理性觀察,一方面肯定國產模型取得的長足進步,另一方面也耐心等待更具透明度的第三方評測結果出爐。畢竟,在 AI 領域,真正的實力從來不需要隱藏在洩露的帖子背後——它終將在實際應用與公開測試中展現出最真實的模樣。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。