Agent 下半場的隱秘戰爭發生在 Harness 調度層

2026年7月10日 14:45
Agent 下半場的隱秘戰爭發生在 Harness 調度層

重點摘要

DRACO 公開基準測試顯示,開源框架 OpenSquilla 0.0 透過並行提案架構調度四個國產模型,在複雜任務中獲得 85 分,超越旗艦模型 Fable5 的 59.8 分,且成本僅約後者三分之一。這項結果凸顯調度層在 Agent 下半場的關鍵角色,透過多模型協作能以更低成本提升任務品質,挑戰單一最強模型的傳統思維。

站內 AI 整理稿

在 Agent 應用的下半場,一場圍繞調度層的隱秘戰爭正悄然打響。當外界目光仍停留在單一模型的參數規模與跑分成績時,一些團隊已經開始將重心轉向如何組合與調度多個模型,以更低的成本換取更高的任務品質。近期 DRACO 公布的一項公開基準測試,便清楚地展現了這一趨勢的潛力。該評測涵蓋 100 道高難度的研究與分析任務,意在檢驗不同方案在複雜場景下的真實表現。測試中,開源 Agent 框架 OpenSquilla 0.0 採用了一種稱為「並行提案架構」的設計,將 DeepSeek、GLM、Kimi、Qwen 四個國產模型組織起來,讓它們各自獨立生成提案,最後再由一個聚合模型統整輸出。

這套架構最終拿下 85 分的質量評分,略高於最新旗艦模型 Fable5 的 59.8 分。更引人注意的是成本的懸殊差距。單任務平均成本,OpenSquilla 方案約為 Fable5 的三分之一,分別落在 0.XX 美元級別。在另一組對比中,這套多模型集成方案相較於單獨運行的 Claude Opus 4.5,不僅質量分更高,成本更大幅降低約 86% 至 92%。這樣的數據組合,讓業界開始重新思考一個根本問題:當任務複雜到一定程度時,是否還應該默認把執行權交給單一最強模型?OpenSquilla 的設計思路,本質上是將調度層的價值推到前線。

傳統 Agent 架構多半依賴一個頂尖模型「一個人扛下所有」,但這種做法不僅成本高昂,在面對跨領域、多步驟的分析任務時,單一模型的理解邊界也容易形成瓶頸。透過調度層,系統可以同時利用不同模型各自擅長的領域——比如 DeepSeek 在數學推理上的優勢、GLM 在中文語義理解上的細膩、Kimi 對長文本的歸納能力、Qwen 在通用知識上的覆蓋——再經由聚合層做品質控管,形成「多專家會診」的效果。DRACO 的評測結果並非孤例。業界越來越多實驗指出,模型間的協作若能透過精細的調度機制來實現,往往能在品質與成本之間取得更理想的平衡。

尤其對於企業級應用,任務量動輒成千上萬,成本差距累積下來便是一筆可觀的數字。OpenSquilla 這類框架的出現,等於提供了一條不需要等待下一代旗艦模型降價,就能立刻提升性價比的捷徑。當然,這一做法也面臨挑戰。並行提案架構意味著每次任務都需要同時調用多個模型,網路延遲與推理延時會疊加;聚合模型的品質也直接影響最終輸出,若聚合層本身能力不足,反而可能抹平各模型各自的長處。此外,任務的分發邏輯、輸入輸出的標準化、以及模型間的競爭與互補關係,都需要在調度層中做細緻設計。OpenSquilla 0.0 作為開源框架,其內部實作細節尚未完全公開,但已足以引發外界對調度層策略的關注。

從更大的背景來看,國產模型在單點能力上與國際前沿的差距正在縮小,但真正能讓這些模型「抱團作戰」的調度層工具,卻長期處於被低估的狀態。這次評測中四個國產模型的組合,不僅跑出比旗艦模型更高的分數,還大幅壓低了成本,某種程度證明了「組合能力」比「單點能力」更具策略意義。這也呼應了近期許多開發者的觀察:Agent 下半場的競爭,焦點可能不再只是誰的模型最強,而是誰能把現有模型用得最好。對於大型語言模型的落地場景,調度層正在成為一個隱密的決勝點。OpenSquilla 這類框架的出現,讓中小團隊也能以較低門檻嘗試多模型協作,而不必被單一模型的高昂 API 費用綁架。

業界預期,未來將有更多類似架構湧現,甚至可能催生專門針對調度層優化的商業服務。Harness 一詞,在技術圈中原本常指持續交付與部署的控管工具,如今在 Agent 領域被賦予了新的含義——一個能統籌多模型資源、動態分配任務、並確保輸出品質的中樞。回到 DRACO 的評測本身,它揭露的不只是 OpenSquilla 的表現,更是一個轉折信號:當調度層變得足夠聰明,單一模型的強弱就不再是唯一瓶頸。對於開發者而言,與其追著最新旗艦模型的跑分數字跑,不如靜下心來思考如何透過調度,把手邊已有的模型潛力全部擰出來。這場隱秘戰爭的勝負,或許就藏在調度層的每一行程式碼與每一次路由決策之中。

Related

相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?

專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

剛剛

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議

一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

剛剛
鈦媒體AI Agent

騰訊是在“賽馬”,還是在打造 “Agent工廠”?

騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。

38 分鐘前
TechWebAI Agent

ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯

2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

2 小時前
量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

7 小時前