智東西生成式AI

Qwen3.8,登頂英偉達榜單!

2026年7月22日 10:13

重點摘要

智東西 作者 | 程茜 編輯 | 雲鵬 智東西7月22日報道,昨日,阿里千問最新發布的Qwen3.8預覽版模型在英偉達評估AI進行算子優化的榜單上登頂,排名超過騰訊混元、人類開發者、Cursor。 榜單中SOL得分指的是GPU的峰值算力與HBM帶寬共同決定的理論性能極限。

站內 AI 整理稿

# 阿里千问Qwen3.8登顶英伟达算子优化榜,超人类开发者与Cursor

7月21日,阿里巴巴千问大模型团队推出的Qwen3.8预览版在英伟达最新发布的GPU算子优化基准评测中一举夺魁,超越了腾讯混元、人类开发者以及AI编程明星产品Cursor,引发业界广泛关注。这一结果意味着AI模型在底层硬件优化领域已展现出接近甚至超越人类专家的潜力。 ## 英伟达基准评测转向“理论极限”标尺

今年3月,英伟达推出了全新的SOL-ExecBench基准测试套件,专门用于评估AI智能体、编译器和自动内核生成工具所编写的GPU算子(Kernel)性能。与传统基准只关注相对软件基线的加速比不同,SOL-ExecBench引入“Speed-of-Light(SOL)”概念——由GPU的峰值算力和HBM显存带宽共同决定的理论性能极限。模型得分越接近1,代表其生成的算子越接近硬件的绝对效率上限,从而避免算力与能源的浪费。

该套件面向英伟达Blackwell B200架构,包含235项CUDA内核优化任务,提取自124个商用及前沿AI模型,涵盖大语言模型、扩散模型、计算机视觉、音频、视频以及混合架构,精度格式包括BF16、FP8、NVFP4。英伟达同时提供了SOLAR工具,从FLOP数量、字节数、峰值吞吐量等维度分析出硬件的SOL界限,并结合评分基准给出得分:0.5表示与基准相当,1.0则为硬件极限。为确保可比性,所有提交均在真实B200 GPU上隔离执行,GPU时钟锁定在1500MHz。## 榜单排名揭晓:Qwen3.8超越腾讯混元与人类专家

在SOL-ExecBench的FlashInfer-Bench子集上,Qwen3.8预览版排名第一,得分领先。该子集专门用于测试和优化大语言模型推理系统中的GPU算子,包含26个来源于Llama-3.1-8B、Qwen3-30B-A3B、DeepSeek-V3/R1的问题,覆盖BF16和FP8精度,每个问题提供7-48个动态形状输入配置,真实模拟生产环境。典型任务涵盖融合注意力(Fused Attention)、FP8混合专家(MoE)和RMSNorm等核心推理算子。紧随其后排名第二的是腾讯混元Hyra,第四名是人类开发者Amir M.

Mir,第六名为美国AI创企doubleAI的全自动GPU内核生成智能体系统,而近来备受关注的AI编程独角兽Cursor仅位列第十。这一结果突显了专业AI模型在算子优化这一高度技术化领域中的竞争力。## 模型自主进化能力成为关键

千问团队指出,Kernel优化是少数提供清晰、客观、可量化反馈信号的工程任务:运行时间和带宽利用率可以精确测量,与硬件理论极限的差距没有歧义,每轮优化结果又可作为下一轮起点。这意味着模型无需人类标注,仅通过与真实硬件环境交互,就能自主产生训练信号、评估输出质量并持续改进。 在SOL-ExecBench上表现靠前,意味着模型具备一系列高级能力:长程因果推理——优化决策之间存在复杂依赖链,局部改动可能影响全局;工具使用与策略规划——根据每次执行反馈动态调整优化方向;稀疏反馈下的探索能力——在大量无效方向中识别真正有价值的路径;以及系统抽象与具体实现之间的双向翻译——从算法语义到底层硬件指令,再反向推导优化方向。 ## 训练与推理双管齐下,千问团队披露方法论

在训练侧,千问团队构建了基于沙盒的真实GPU环境,为模型提供丰富硬件文档与可交互工作空间,使其通过真实编译、执行与性能测量获取物理奖励信号,而非依赖模拟器或代理指标。研究团队还系统性收集了大规模工程级Kernel优化代码作为训练数据,涵盖广泛的优化模式与硬件适配策略。针对Kernel优化需超长工具调用序列的特点——单次优化可能涉及数百轮编译-执行-分析循环——千问对强化学习基础设施进行了专项优化,以高效支持超长多轮工具调用的训练。在推理侧,团队使用了阿里巴巴Atrex Kernel Agent框架来承载完整的分析迭代流程与经验沉淀机制。评测中,Qwen3.

8完成了平均29354轮工具调用的持续迭代,每轮对Kernel实现进行编译、执行、性能分析与策略调整,逐步将性能推向硬件理论极限。数万轮迭代中保持方向一致且不陷入局部震荡,正是其长程持续优化能力区别于普通代码生成的核心所在。## 从手写算子到AI自动生成调优,底层算力优化范式加速转变

Qwen3.8的登顶表明,AI模型已具备承担底层算力优化复杂工程任务的能力,能够直接对接真实硬件环境采集运行反馈,形成从算子生成到性能调优的自动化闭环。这有望进一步压缩人工介入算子开发的环节,让大模型在理解硬件架构、推演访存瓶颈、自主迭代调参方面释放更大价值。 千问团队于7月19日宣布,将很快发布并开源Qwen3.8,该模型参数规模达2.4T,可能是仅次于Fable 5的最强模型。Qwen3.8-Max-Preview版本也已更新,前端表现进一步优化。业界分析认为,随着模型能力的持续升级,模型侧与编译层在算力优化方面将形成双向反馈,硬件规格、算子实现、模型架构三者协同演进的趋势有望成为常态,并加速AI基础设施建设向更高效、更智能的方向演进。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

1 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

2 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

2 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

2 小時前