量子位AI Agent

OpenSquilla發佈0.5.0 Preview:多模型集成登頂DRACO雙榜,對比名單中出現最新旗艦Fable 5

2026年7月6日 17:40
OpenSquilla發佈0.5.0 Preview:多模型集成登頂DRACO雙榜,對比名單中出現最新旗艦Fable 5

重點摘要

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> OpenSquilla發佈0.5.

站內 AI 整理稿

# OpenSquilla發佈0.5.0 Preview:多模型集成登頂DRACO雙榜,對比名單中出現最新旗艦Fable 5

開源AI Agent項目OpenSquilla於近日正式發佈0.5.0 Preview 1版本,此次更新的核心亮點在於導入「多模型集成協作」機制,透過Harness層將多個國產模型組織為協作隊伍,以並行提案方式運行,再由單一模型聚合輸出最終結果。這項被團隊命名為「Agentic Routing」的路由架構,不僅在DRACO深度研究榜單的兩大搜尋引擎分組中均奪下平均分數第一,更因為對比名單中出現了尚未正式公開的最新旗艦模型「Fable 5」,引發技術圈高度關注。

根據OpenSquilla團隊同步發佈的《Agentic Routing》技術報告,這套harness原生路由設計的核心目的,是將日常agent流量轉化為可自我進化的數據飛輪。不同於傳統靜態路由或單純的模型切換,OpenSquilla 0.5.0 Preview 1在Harness層同時調度DeepSeek v4、GLM-5、Qwen-3與Doubao-2.0等四個國產模型,讓它們針對同一任務分別提出解決方案,再由聚合模型進行最終輸出決策。值得注意的是,這個協作陣容中完全沒有納入任何海外旗艦模型,展現出國產模型在協同運作下的潛在競爭力。

OpenSquilla團隊在技術報告中進一步闡述,Agentic Routing的設計哲學在於「不依賴單一強大模型,而是透過多模型的智慧分工與互相校驗,來達到超越個體表現的整體效果」。這種作法不僅能降低對特定高成本模型的依賴,也能在維持輸出品質的同時,有效控制營運成本。團隊表示,隨著系統持續接收實際agent流量,路由決策與模型輸出的反饋將不斷優化Harness層的調度策略,形成一個持續自我強化的數據循環,這正是數據飛輪機制的核心價值。最新公佈的DRACO深度研究榜單成為此次發佈的最佳背書。該榜單按搜尋引擎分組,對比各AI方案的「平均分數」與「平均成本」。

OpenSquilla的整合方案在兩組中均奪冠:在Brave Search組中,平均分數達64.2分,平均成本僅0.14美元;在Google Search組中,平均分數達68.1分,平均成本僅0.17美元。這些數據不僅代表了OpenSquilla在任務執行品質上的優勢,更凸顯其成本效益的強勁競爭力。榜單中最受關注的亮點莫過於對比名單中的「Fable 5」。這款尚未由官方正式發表的旗艦模型,在兩組榜單中均展現出頂尖水準的表現,與OpenSquilla的整合方案形成直接對比。在Brave Search組中,Fable 5的平均分數為62.3分,平均成本為0.

52美元;在Google Search組中,平均分數同樣為62.3分,平均成本則為0.55美元。雖然Fable 5的表現仍然優於榜單上許多其他對比方案,但OpenSquilla憑藉多模型協作策略,在分數上以64.2分及68.1分雙雙超越,且成本僅為Fable 5的三分之一至四分之一。這項對比結果,讓業界開始重新審視「單一旗艦模型」與「多模型協作」之間的路線優劣。除了DRACO雙榜的亮眼成績,OpenSquilla此次Preview版本的發佈也預示著正式版本的輪廓逐漸清晰。根據團隊釋出的開發時程,0.5.0 Preview 1並非最終版本,而是作為通往正式版本的重要里程碑。

團隊在技術報告中同時預告,正式版本將隨後發佈,屆時預計會進一步強化Harness層的路由策略、提升聚合模型的判斷能力,並針對不同應用場景提供更細緻的調校選項。業界分析指出,OpenSquilla這次的發佈策略相當明確:以完全國產模型陣容為基礎,透過系統層級的創新來補足個別模型與海外旗艦之間的差距。在當前AI模型軍備競賽的背景下,多數開源專案仍以單一模型的性能提升為主要方向,OpenSquilla則選擇了截然不同的路徑——從系統架構與路由邏輯著手,用協作取代單打獨鬥。這種作法的優勢在於,它不受限於單一模型的迭代速度,反而能隨著加入協作的模型數量與種類增加而持續放大效益。

從實際應用角度來看,OpenSquilla 0.5.0 Preview 1所展示的多模型集成協作,對於需要高可靠性與穩定輸出的企業級Agent應用尤其具有吸引力。藉由多模型並行提案與聚合決策,系統能夠在單一模型出現偏差或弱項時,由其他模型互補,從而提高整體任務完成率與回答品質。而透過Agentic Routing機制自動累積的流量數據與路由決策記錄,更為後續的調校與優化提供了寶貴的真實場域資料。在成本結構方面,此次DRACO榜單公布的數據也清楚顯示,OpenSquilla在Google Search組中以0.17美元的平均成本達成68.1分,代表每提升1分平均僅需花費約0.

0025美元;相比之下,Fable 5以0.55美元達成62.3分,每提升1分的成本約為0.0088美元。這項成本效益的顯著差距,可能成為許多開發者與企業在選擇AI Agent解決方案時的關鍵考量。隨著OpenSquilla 0.5.0 Preview 1的釋出與Agentic Routing技術報告的公開,開源AI Agent領域的競爭態勢已經出現新的變數。當模型本身的性能差距逐步縮小,系統架構與路由策略的創新或許將成為下一階段決勝的關鍵戰場。而OpenSquilla這套完全以國產模型為基底、卻能登頂DRACO雙榜的整合方案,無疑為這條路線提供了一個具說服力的實證。

技術社群正密切關注正式版本的進一步優化,以及後續是否會有更多模型加入這個協作生態。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

3 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

9 小時前