何夕2077AI Agent

SuperScout實現低成本路由

2026年8月7日 00:00

重點摘要

**SuperScout實現低成本路由:先「偵察」程式庫再派工,編碼代理成本降至五分之一** **——7B搜尋模型結合隱藏狀態路由,在SWE-bench Pro上以五分之一成本追平最佳單一模型表現** (綜合arXiv最新論文報導)在軟體工程自動化領域,前沿大型語言模型(LLM)雖能解決倉庫級軟體問題,但每一次嘗試都所費不貲。現有的路由系統僅從問題文字本身選擇模型,往往無法準確預判任務難度與所需資源。

站內 AI 整理稿

**SuperScout實現低成本路由:先「偵察」程式庫再派工,編碼代理成本降至五分之一**

**——7B搜尋模型結合隱藏狀態路由,在SWE-bench Pro上以五分之一成本追平最佳單一模型表現**

(綜合arXiv最新論文報導)在軟體工程自動化領域,前沿大型語言模型(LLM)雖能解決倉庫級軟體問題,但每一次嘗試都所費不貲。現有的路由系統僅從問題文字本身選擇模型,往往無法準確預判任務難度與所需資源。為此,來自學術界的研究團隊提出了一種名為「SuperScout」的新穎系統,其核心概念是「先偵察倉庫,再進行路由」——在指派任務給昂貴的修復模型之前,先由一個輕量級搜尋模型深入探索程式碼庫,產出結構化的交接資訊,並以此為依據,將任務分配給最合適的修復器。這項研究已以預印本形式發表於arXiv(編號2608.04804),並在SWE-bench Pro基準測試上展現了驚人的成本效益。 **現有路由機制的瓶頸:只看問題,不看程式碼**

傳統的編碼代理路由系統,通常依賴於從問題陳述(issue text)中提取特徵,再透過分類器或規則來選擇要呼叫的模型。這種方法雖然簡單,卻存在根本性的缺陷:問題陳述往往無法充分反映倉庫內部的複雜性。一個看似簡單的錯誤報告,可能涉及多個檔案、跨模組的依賴關係,甚至隱藏著歷史遺留的技術債。僅憑文字判斷,容易將簡單任務分配給過於昂貴的模型,或將複雜任務分配給能力不足的模型,造成資源浪費或任務失敗。此外,現有路由系統在新增一個修復模型時,往往需要重新訓練整個路由器,缺乏擴展性。 **SuperScout的創新:偵察先行,交接為憑**

SuperScout的設計哲學是「讓資訊流動,而非讓模型猜測」。其運作流程分為兩個階段。第一階段,由一個僅有70億參數的輕量級搜尋模型「SuperScout-7B」負責「偵察」任務。這個搜尋器會深入倉庫,閱讀相關檔案、追蹤函數呼叫、檢查測試案例,並嘗試提出可能的修復方案。它的輸出並非直接修復,而是一份結構化的「交接文件」(handoff),其中包含了對問題的定位、可能涉及的檔案、初步的修復思路,以及它對自身判斷的「信心」程度。 關鍵在於,這份交接文件中的「可重現性聲明」會經過沙盒(sandbox)驗證。也就是說,搜尋器提出的任何「我認為修改這個檔案可以解決問題」的聲明,都會在一個隔離的環境中實際執行測試,以確認其真實性。如果聲明無法通過驗證,這些虛假或不可靠的資訊會在交接給修復器之前被系統性地剝離。這項設計確保了交接文件的品質,避免了將搜尋器的錯誤判斷傳遞給後續的昂貴模型。 **第二階段:基於隱藏狀態的「簡歷式」路由**

在搜尋器完成偵察並產出交接文件後,系統進入第二階段:路由決策。這裡的關鍵創新在於,路由器並非直接讀取交接文件的文字內容,而是接收搜尋器在產生交接文件過程中的「隱藏狀態」(hidden states)——也就是神經網路內部對倉庫理解的中間表示。這些隱藏狀態,加上原始的任務文字,共同輸入到一個「基於簡歷的」(resume-based)路由器中。 這個路由器會根據這些資訊,將任務分配給四個「前沿修復器」(frontier fixers)中的一個。這四個修復器是不同規模或不同能力的頂尖模型,例如可能包含GPT-5、Claude 4、Gemini Ultra等(論文中未具體指名)。路由器的決策邏輯是「成本感知」的:它會嘗試預測哪個修復器能以最低的成本成功解決問題。如果任務簡單,路由器會傾向選擇最便宜的修復器;如果任務複雜,則會選擇更昂貴但能力更強的模型。 **實驗結果:成本降低五倍,解決率持平**

研究團隊在SWE-bench Pro基準測試的完整Python子集(266個任務)上,並使用了官方設定的「封頂預算」層級進行評估。結果顯示,SuperScout的表現令人矚目:

- **解決率**:SuperScout成功解決了159個任務,而最佳單一模型(不經路由)解決了158個任務。兩者幾乎持平,但SuperScout的總成本僅為最佳單一模型的**約五分之一**。這意味著,在相同的預算下,SuperScout可以處理更多的任務,或者將節省的成本用於其他環節。 - **與隨機流量分配比較**:SuperScout的表現也優於「隨機流量分配」的基線(即不進行智慧路由,隨機將任務分配給四個模型)。這證明了路由決策本身確實帶來了效益。 **關鍵發現:交接文件才是主要功臣,而非路由決策**

然而,論文中最引人注目的發現,來自於一個「無路由消融」實驗。研究團隊將SuperScout的路由器移除,改為「永遠使用最便宜的修復器,並附上交接文件」的策略。結果顯示,這個「無路由」系統在SWE-bench Pro上與完整的SuperScout系統「打成平手」,解決率幾乎相同。 這項結果極具啟發性:它表明,**SuperScout所帶來的成本節省與性能提升,主要來自於「先偵察倉庫並產生交接文件」這一行為,而非最終的路由決策本身**。換句話說,交接文件本身已經包含了足夠的資訊,使得即使是最便宜的修復器,也能在獲得這些資訊後,表現得與昂貴的修復器一樣好。路由決策在當前基準上並未帶來額外的增益,但這也暗示了,如果路由器的決策更加精準,或是在更困難的任務分佈上,其價值可能才會顯現。 **機制分析:交接文件「重新分配」而非「增加」解決能力**

為了深入理解交接文件的作用機制,研究團隊進行了一項配對校準研究(paired calibration study)。他們將任務分組,並比較了不同修復器在「有交接文件」與「無交接文件」情況下的表現。結果發現了一個有趣的現象:

- 交接文件**顯著提升了三個較便宜的修復器的解決能力**,但**略微損害了最強模型(最貴的那個)的表現**。 這表明,交接文件的作用是「重新分配」解決能力,而非「增加」整體能力。它將原本只有最強模型才能解決的任務,轉化為較弱模型也能解決的任務。這可能是因為,交接文件提供了強烈的「提示」或「線索」,讓較弱的模型更容易找到正確的修復方向。然而,對於最強模型而言,這些額外的提示可能反而限制了其探索空間,或者引入了不必要的偏見,導致其表現略微下降。不過,論文中也指出,由於樣本量僅有99個,這些每修復器的效果僅具有「方向性」意義,尚未達到統計顯著性。 **路由器的隱藏狀態具有價值,但交接文件文字本身沒有**

另一個有趣的發現是,在路由器的訓練與校準中,搜尋器的「隱藏狀態」對成本路由的預測有顯著幫助,但交接文件的「文字內容」本身卻沒有。這意味著,路由器的決策能力,可能更多地來自於搜尋器在探索倉庫過程中所形成的「內部表徵」(即隱藏狀態),這些表徵捕捉了任務的複雜度、倉庫的結構等資訊,而這些資訊是交接文件的文字形式無法完全傳達的。這也暗示了,未來可以設計更直接利用隱藏狀態的路由機制,而非僅依賴文字。 **成本效益:搜尋器運算成本極低**

研究團隊也計算了搜尋器的運算成本。在每個任務上,SuperScout-7B的GPU時間成本不到0.5美分。相較於前沿修復器每次呼叫可能高達數美元的成本,這筆額外開銷幾乎可以忽略不計。這使得SuperScout在經濟上具有極強的吸引力,因為它用極低的成本換取了大量的資訊,進而節省了昂貴的修復器呼叫。 **結論與展望:路由與偵察的未來**

總結而言,SuperScout提出了一種「先偵察,後路由」的新範式,並透過實驗證明了「交接文件」在降低編碼代理成本方面的巨大潛力。雖然目前的路由決策並未帶來額外的增益,但這項研究為未來的發展指明了方向:

1. **強化路由決策**:既然交接文件本身已能提升弱模型能力,未來的重點應放在如何讓路由決策更精準,例如利用搜尋器的隱藏狀態來預測哪個修復器最適合處理特定任務,並在「無路由」的基礎上進一步提升整體表現。 2. **探索更強搜尋器**:目前使用7B模型作為搜尋器,若使用更大、更強的搜尋器,產生的交接文件品質可能更高,或許能進一步縮小與最強模型的差距,甚至超越。 3. **動態調整交接文件**:針對最強模型可能被交接文件「干擾」的問題,可以設計動態機制,根據任務難度或修復器的能力,決定是否提供交接文件,或提供不同詳細程度的交接文件。 這項研究不僅為編碼代理的經濟性提供了實用的解決方案,也為理解「模型間知識傳遞」與「任務路由」的機制提供了新的視角。未來,我們或許會看到更多結合「偵察」與「路由」的系統,在自動化軟體修復領域中,實現更高效、更智慧的資源配置。

Related

相關文章

量子位AI Agent

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作

**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。

剛剛
AIBaseAI Agent

螞蟻集團開源Avernet:破解多智能體“找不到、對不齊”協作難題

AI資訊AI新閒資訊正文螞蟻集團開源Avernet:破解多智能體“找不到、對不齊”協作難題發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘近日,螞蟻集團正式開源多智能體協作基礎設施Avernet,社區版本已上線。首個版本重點開放智能體協作網絡能力,支持不同智能體之間的發現、共識、跨團隊協作與治理。

2 小時前9200
何夕2077AI Agent

Prime Agent框架分數飆升

Prime Agent框架分數飆升。 極客展示了新型智能框架技術分享文章。奧普斯五代評分飆到了九成。傳統外殼在某種程度上限制了它。該框架目前能自由地修改參數。優秀的編程替代工具再度出現。

5 小時前
IT之家AI Agent

谷歌地圖智能體功能迎來新升級:聊著天就把酒店、外賣訂好了

首頁 > 智能時代>人工智能 谷歌地圖智能體功能迎來新升級:聊著天就把酒店、外賣訂好了 2026/8/6 20:49:13 來源:IT之家 作者:清源 責編:清源 評論: IT之家 8 月 6 日消息,今天(6 日)晚間,谷歌地圖副總裁兼總經理米麗婭姆 · 丹尼爾宣佈,AI 功能 Ask Maps 迎來新一輪升級,不僅可以按照用戶的個性化需求訂餐、尋找酒店,還能結合已有行程提供建議。

8 小時前