Qwen3.8,登頂英偉達榜單!
重點摘要
智東西 作者 | 程茜 編輯 | 雲鵬 智東西7月22日報道,昨日,阿里千問最新發布的Qwen3.8預覽版模型在英偉達評估AI進行算子優化的榜單上登頂,排名超過騰訊混元、人類開發者、Cursor。 榜單中SOL得分指的是GPU的峰值算力與HBM帶寬共同決定的理論性能極限。
# 阿里千问Qwen3.8登顶英伟达算子优化榜,超人类开发者与Cursor
7月21日,阿里巴巴千问大模型团队推出的Qwen3.8预览版在英伟达最新发布的GPU算子优化基准评测中一举夺魁,超越了腾讯混元、人类开发者以及AI编程明星产品Cursor,引发业界广泛关注。这一结果意味着AI模型在底层硬件优化领域已展现出接近甚至超越人类专家的潜力。 ## 英伟达基准评测转向“理论极限”标尺
今年3月,英伟达推出了全新的SOL-ExecBench基准测试套件,专门用于评估AI智能体、编译器和自动内核生成工具所编写的GPU算子(Kernel)性能。与传统基准只关注相对软件基线的加速比不同,SOL-ExecBench引入“Speed-of-Light(SOL)”概念——由GPU的峰值算力和HBM显存带宽共同决定的理论性能极限。模型得分越接近1,代表其生成的算子越接近硬件的绝对效率上限,从而避免算力与能源的浪费。 该套件面向英伟达Blackwell B200架构,包含235项CUDA内核优化任务,提取自124个商用及前沿AI模型,涵盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,精度格式包括BF16、FP8、NVFP4。英伟达同时提供了SOLAR工具,从FLOP数量、字节数、峰值吞吐量等维度分析出硬件的SOL界限,并结合评分基准给出得分:0.5表示与基准相当,1.0则为硬件极限。为确保可比性,所有提交均在真实B200 GPU上隔离执行,GPU时钟锁定在1500MHz。 ## 榜单排名揭晓:Qwen3.8超越腾讯混元与人类专家
在SOL-ExecBench的FlashInfer-Bench子集上,Qwen3.8预览版排名第一,得分领先。该子集专门用于测试和优化大语言模型推理系统中的GPU算子,包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题,覆盖BF16和FP8精度,每个问题提供7-48个动态形状输入配置,真实模拟生产环境。典型任务涵盖融合注意力(Fused Attention)、FP8混合专家(MoE)和RMSNorm等核心推理算子。 紧随其后排名第二的是腾讯混元Hyra,第四名是人类开发者Amir M. Mir,第六名为美国AI创企doubleAI的全自动GPU内核生成智能体系统,而近来备受关注的AI编程独角兽Cursor仅位列第十。这一结果突显了专业AI模型在算子优化这一高度技术化领域中的竞争力。 ## 模型自主进化能力成为关键
千问团队指出,Kernel优化是少数提供清晰、客观、可量化反馈信号的工程任务:运行时间和带宽利用率可以精确测量,与硬件理论极限的差距没有歧义,每轮优化结果又可作为下一轮起点。这意味着模型无需人类标注,仅通过与真实硬件环境交互,就能自主产生训练信号、评估输出质量并持续改进。 在SOL-ExecBench上表现靠前,意味着模型具备一系列高级能力:长程因果推理——优化决策之间存在复杂依赖链,局部改动可能影响全局;工具使用与策略规划——根据每次执行反馈动态调整优化方向;稀疏反馈下的探索能力——在大量无效方向中识别真正有价值的路径;以及系统抽象与具体实现之间的双向翻译——从算法语义到底层硬件指令,再反向推导优化方向。 ## 训练与推理双管齐下,千问团队披露方法论
在训练侧,千问团队构建了基于沙盒的真实GPU环境,为模型提供丰富硬件文档与可交互工作空间,使其通过真实编译、执行与性能测量获取物理奖励信号,而非依赖模拟器或代理指标。研究团队还系统性收集了大规模工程级Kernel优化代码作为训练数据,涵盖广泛的优化模式与硬件适配策略。针对Kernel优化需超长工具调用序列的特点——单次优化可能涉及数百轮编译-执行-分析循环——千问对强化学习基础设施进行了专项优化,以高效支持超长多轮工具调用的训练。 在推理侧,团队使用了阿里巴巴Atrex Kernel Agent框架来承载完整的分析迭代流程与经验沉淀机制。评测中,Qwen3.8完成了平均29354轮工具调用的持续迭代,每轮对Kernel实现进行编译、执行、性能分析与策略调整,逐步将性能推向硬件理论极限。数万轮迭代中保持方向一致且不陷入局部震荡,正是其长程持续优化能力区别于普通代码生成的核心所在。 ## 从手写算子到AI自动生成调优,底层算力优化范式加速转变
Qwen3.8的登顶表明,AI模型已具备承担底层算力优化复杂工程任务的能力,能够直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。这有望进一步压缩人工介入算子开发的环节,让大模型在理解硬件架构、推演访存瓶颈、自主迭代调参方面释放更大价值。 千问团队于7月19日宣布,将很快发布并开源Qwen3.8,该模型参数规模达2.4T,可能是仅次于Fable 5的最强模型。Qwen3.8-Max-Preview版本也已更新,前端表现进一步优化。业界分析认为,随着模型能力的持续升级,模型侧与编译层在算力优化方面将形成双向反馈,硬件规格、算子实现、模型架构三者协同演进的趋势有望成为常态,并加速AI基础设施建设向更高效、更智能的方向演进。
Related
相關文章

算力成生死線,巨頭瘋搶“超節點”
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務尋求報道36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI自助報道廣東最新創投汽車科技專精特新直播視頻專題活動搜索尋求報道我要入駐城市合作算力成生死線,巨頭瘋搶“超節點”中國企業家雜誌·2026年07月23日 10:55超節點狂飆背後,大模型的基礎設施戰爭。超節點A++輪廣東省2011-04三維視覺技術團隊和解決方案提供商36氪報道智能硬件高新技術企業我要聯繫 剛剛結束的WAIC(世界人工智能大會)上,“超節點”的風頭蓋過了大模型,佔領了展館的中心位置。 “超節點”(Super Node)顧名思義,指在物理上由多個計算節點(如AI加速卡/NPU/GPU)通過高效互聯協議緊密連接組成的,具備“一臺計算機”特徵的計算系統。 隨著AI大模型算力需求劇增,算力需求正在從“單機八卡”向“萬卡/十萬卡”的集群演變。在算力普遍緊缺的背景下,頭部雲廠商、大模型廠商、政企客戶不約而同地將規模算力採購錨定為標配,也直接推動了超節點的規模化商用。 在資本市場,超節點正在成為“造富機器”。7月1日到22日,《中國企業家》統計:紫光股份股價累計上漲58%,市值1300億元;浪潮信息上漲41%,市值近1400億元。 與之伴生的,是超節點產能的上揚。5月,一位服務器廠商高管告訴《中國企業家》:從2026年下半年到2027年,超節點都會呈現出快速上量的趨勢。“如果GPU、存儲等供應

AISI 報告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行為
首頁 > 智能時代>人工智能 AISI 報告 GPT-5.6 Sol 等 5 款 AI 模型均存“作弊”行為 2026/7/23 10:51:59 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 23 日消息,英國 AI 安全研究所(AISI)於 7 月 21 日發佈博文,測試 OpenAI 與 Anthropic 旗下的 5 款前沿 AI 模型,發現所有模型均存在“作弊”

國內首部獲證上線的 AIGC 網絡故事片:《奇譚:紙刃渡荒墟》在愛奇藝開播
首頁 > 智能時代>人工智能 國內首部獲證上線的 AIGC 網絡故事片:《奇譚:紙刃渡荒墟》在愛奇藝開播 2026/7/23 10:44:59 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 23 日消息,愛奇藝今日宣佈獨家上線 AIGC 網絡故事片《奇譚:紙刃渡荒墟》。

科大訊飛發佈星火Token Factory,打造企業級AI模型智能路由與治理新底座
# 科大讯飞发布星火Token Factory,企业级AI模型智能路由与治理平台正式亮相 2026年7月19日,科大讯飞正式推出星火Token Factory,定位为企业级AI模型智能路由与治理平台,旨在帮助企业构建面向未来的人工智能基础设施。随着大模型应用从单点试点走向多业务、多场景规模化落地,企业对模型资源统一管理、成本优化和安全治理的需求日益迫切,星火Token Factory的发布恰逢其时。 当前,企业在部署大模型时面临一系列运营挑战。

AI 瀏覽器,要換一種活法了
AI 瀏覽器,要換一種活法了 隨著 GPT-5.6 的發布與產品線調整,OpenAI 近期決定取消 Atlas 瀏覽器項目,將其功能併入 ChatGPT 桌面應用,這一舉動在業界掀起波瀾。曾經被視為「AI 原生瀏覽器」代表的 Atlas,在誕生不到一年後便從獨立產品轉向生態整合,背後不僅是用戶習慣的現實壓力,也暴露了 AI 瀏覽器在安全層面的新挑戰。從矽谷到中國,各大廠商對瀏覽器的 AI 化探索正走向分化,瀏覽器在 AI 時代的定位正在被重新定義。

月之暗面黃震昕:Kimi K3 性能躍升並非對現有任何模型蒸餾復刻
首頁 > 智能時代>人工智能 月之暗面黃震昕:Kimi K3 性能躍升並非對現有任何模型蒸餾復刻 2026/7/23 9:53:28 來源:IT之家 作者:汪淼 責編:汪淼 評論: IT之家 7 月 23 日消息,月之暗面於 7 月 16 日上線推出 Kimi K3 模型,是 Kimi 迄今能力最強的模型,擁有 2.