量子位生成式AI

GPT-5.6-sol入榜DRACO:OpenSquilla集成方案仍在Brave組質量、成本雙領先

2026年7月14日 13:26
GPT-5.6-sol入榜DRACO:OpenSquilla集成方案仍在Brave組質量、成本雙領先

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> GPT-5.

站內 AI 整理稿

**DRACO 最新评测:OpenSquilla 多模型集成方案在质量与成本上双超 GPT-5.6-sol**

近日,权威 AI 评测平台 DRACO 公布了其 Brave Search 组公开评测的最新结果。海外旗舰模型 GPT-5.6-sol 首次入榜即表现不俗,但整体排名却未能登顶——由 OpenSquilla 团队推出的 0.5.0 Preview 多模型集成方案以质量分 64.09、平均任务成本仅 0.12 美元的成绩位列该组第一,同时在质量与成本两项核心指标上均实现领先。这一结果引发了业界对 Agent 任务竞争格局的重新思考:当最强单模型不再是唯一解,“如何组织模型”正成为新的胜负手。

DRACO 是当前衡量 AI 模型在复杂 Agent 任务中综合能力的重要基准之一,其 Brave Search 组将信息检索、多步推理、指令跟随等能力融为一体,旨在模拟真实环境下智能体完成实际任务的效率与准确性。该评测不仅关注模型输出的质量,也把任务执行成本纳入核心评价维度,从而更贴近产业应用端对“性价比”的追求。正因如此,本次评测结果具有强烈的现实指向性。在最新一期榜单中,GPT-5.6-sol 取得了 63.99 的质量得分,平均单次任务成本为 1.71 美元,展现了其作为顶尖单模型在复杂搜索类任务中的强大能力。然而,OpenSquilla 0.5.

0 Preview 集成方案以略高 0.10 分的质量分(64.09)胜出,而平均任务成本仅为 0.12 美元——大约是 GPT-5.6-sol 的十四分之一。这一成本优势在规模化部署中意味着巨大的资源节省,也使得该方案成为当前评测中综合效率最高的解决方案。除了与 GPT-5.6-sol 的对比,OpenSquilla 方案的成本优势同样体现在对其他海外旗舰模型的“碾压”上。以另一款知名模型 Fable 5 为例,其平均任务成本为 1.21 美元,而 OpenSquilla 的成本仅为前者的十分之一左右。此外,Opus 4.8、GPT-5.

5 等模型也均被纳入了该组的对比范围,OpenSquilla 在成本控制上的领先堪称断层式。那么,OpenSquilla 集成方案到底用了哪些模型?官方透露,该方案由四个国产模型——DeepSeek、GLM、Kimi、Qwen 并行完成提案生成,再交由另一个模型进行聚合输出。整个架构中没有动用任何海外旗舰模型,而是依靠中国开源与闭源模型的协同配合,取得了质量与成本的双优。这种“并行提案 + 聚合决策”的范式,既利用了不同模型在特定子任务上的专长,又通过聚合机制保证了最终输出的一致性和准确性。

从技术角度看,多模型集成方案之所以能够以极低成本实现高质量,关键在于避免了单一模型在每一个子任务上的“全能”要求。传统单一旗舰模型虽然能力全面,但往往需要大量算力支撑,且在处理某些特定环节时难免存在效率浪费。而 OpenSquilla 的并行提案策略允许多个模型各自发挥优势、互相补充,从而在不牺牲结果质量的前提下大幅降低总计算开销。这实际上是在系统层面重新定义了“性能”的范畴。在评测覆盖的模型列表中,OpenSquilla 不仅是质量分第一,同时也是平均成本最低的方案,两项指标均位列榜首。

这一结果的意义不只在榜单本身,更在于它印证了一个正在加速演变的趋势:AI Agent 的竞争正在从“谁的模型参数最大、单点能力最强”,向“谁的架构设计最优、组织模型的方式最聪明”转变。换言之,算力堆砌固然重要,但系统级的整合与调度正在成为更关键的能力壁垒。OpenSquilla 团队表示,0.5.0 Preview 版本仍处于持续迭代中,此次评测结果验证了“集成国产模型即可对抗甚至超越旗舰海外模型”的可能。未来,团队计划进一步优化模型间的任务分配算法和聚合策略,探索更高效的非对称组合方案,力争在更多 DRACO 子任务组中复制这一成功模式。

这一方向也为其他开发团队提供了参考:善用现有模型资源、通过组合创新释放更大潜力,或许是一条更务实且高效的技术路径。本次评测引发的讨论也扩展到了产业层面。多家分析机构指出,随着 Agent 类应用逐步进入生产环境,模型调用成本直接决定了解决方案的可落地性。OpenSquilla 方案如果能够持续保持“质量接近或持平旗舰、成本仅为其一个零头”的表现,将使更多中小企业有能力采用高质量的智能搜索与 Agent 能力,而不必承担昂贵的单模型推理开支。这无疑将加速 AI 技术在垂直领域的渗透。

同样值得关注的是,OpenSquilla 集成方案中全部使用了国产模型,这在中国 AI 产业“自主可控”的大背景下具有较强的示范意义。它表明,在复杂任务场景中,国产模型通过系统级协同,完全有能力与国际顶尖模型同台竞技,甚至在某些维度实现超越。这也为中国 AI 在大模型应用层面寻找差异化优势提供了新的思路。综合来看,DRACO 本次 Brave Search 组评测的结果,标志着 AI Agent 发展进入了一个新阶段。模型本身的能力依然重要,但如何以更聪明的方式组织多个模型协同工作,已成为决定最终效果与成本的关键。OpenSquilla 0.5.

0 Preview 的亮眼成绩正是这种“系统大于部分之和”理念的生动注脚。随着即将到来的 2026 年世界人工智能大会(7月17日-20日,上海)临近,围绕 Agent 集成架构、多模型协同等话题将成为业界关注的焦点,而此次评测结果无疑已提前点燃了这一轮讨论的热度。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

26 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前