SuperScout實現低成本路由

2026年8月7日 00:00
站內 AI 整理稿

:先「偵察」程式庫再派工,編碼代理成本降至五分之一 ——7B搜尋模型結合隱藏狀態路由,在SWE-bench Pro上以五分之一成本追平最佳單一模型表現 (綜合arXiv最新論文報導)在軟體工程自動化領域,前沿大型語言模型(LLM)雖能解決倉庫級軟體問題,但每一次嘗試都所費不貲。現有的路由系統僅從問題文字本身選擇模型,往往無法準確預判任務難度與所需資源。

為此,來自學術界的研究團隊提出了一種名為「SuperScout」的新穎系統,其核心概念是「先偵察倉庫,再進行路由」——在指派任務給昂貴的修復模型之前,先由一個輕量級搜尋模型深入探索程式碼庫,產出結構化的交接資訊,並以此為依據,將任務分配給最合適的修復器。這項研究已以預印本形式發表於arXiv(編號2608.04804),並在SWE-bench Pro基準測試上展現了驚人的成本效益。現有路由機制的瓶頸:只看問題,不看程式碼 傳統的編碼代理路由系統,通常依賴於從問題陳述(issue text)中提取特徵,再透過分類器或規則來選擇要呼叫的模型。

這種方法雖然簡單,卻存在根本性的缺陷:問題陳述往往無法充分反映倉庫內部的複雜性。一個看似簡單的錯誤報告,可能涉及多個檔案、跨模組的依賴關係,甚至隱藏著歷史遺留的技術債。僅憑文字判斷,容易將簡單任務分配給過於昂貴的模型,或將複雜任務分配給能力不足的模型,造成資源浪費或任務失敗。此外,現有路由系統在新增一個修復模型時,往往需要重新訓練整個路由器,缺乏擴展性。SuperScout的創新:偵察先行,交接為憑 SuperScout的設計哲學是「讓資訊流動,而非讓模型猜測」。其運作流程分為兩個階段。第一階段,由一個僅有70億參數的輕量級搜尋模型「SuperScout-7B」負責「偵察」任務。

這個搜尋器會深入倉庫,閱讀相關檔案、追蹤函數呼叫、檢查測試案例,並嘗試提出可能的修復方案。它的輸出並非直接修復,而是一份結構化的「交接文件」(handoff),其中包含了對問題的定位、可能涉及的檔案、初步的修復思路,以及它對自身判斷的「信心」程度。關鍵在於,這份交接文件中的「可重現性聲明」會經過沙盒(sandbox)驗證。也就是說,搜尋器提出的任何「我認為修改這個檔案可以解決問題」的聲明,都會在一個隔離的環境中實際執行測試,以確認其真實性。如果聲明無法通過驗證,這些虛假或不可靠的資訊會在交接給修復器之前被系統性地剝離。這項設計確保了交接文件的品質,避免了將搜尋器的錯誤判斷傳遞給後續的昂貴模型。

第二階段:基於隱藏狀態的「簡歷式」路由 在搜尋器完成偵察並產出交接文件後,系統進入第二階段:路由決策。這裡的關鍵創新在於,路由器並非直接讀取交接文件的文字內容,而是接收搜尋器在產生交接文件過程中的「隱藏狀態」(hidden states)——也就是神經網路內部對倉庫理解的中間表示。這些隱藏狀態,加上原始的任務文字,共同輸入到一個「基於簡歷的」(resume-based)路由器中。這個路由器會根據這些資訊,將任務分配給四個「前沿修復器」(frontier fixers)中的一個。

這四個修復器是不同規模或不同能力的頂尖模型,例如可能包含GPT-5、Claude 4、Gemini Ultra等(論文中未具體指名)。路由器的決策邏輯是「成本感知」的:它會嘗試預測哪個修復器能以最低的成本成功解決問題。如果任務簡單,路由器會傾向選擇最便宜的修復器;如果任務複雜,則會選擇更昂貴但能力更強的模型。實驗結果:成本降低五倍,解決率持平 研究團隊在SWE-bench Pro基準測試的完整Python子集(266個任務)上,並使用了官方設定的「封頂預算」層級進行評估。結果顯示,SuperScout的表現令人矚目:

解決率:SuperScout成功解決了159個任務,而最佳單一模型(不經路由)解決了158個任務。兩者幾乎持平,但SuperScout的總成本僅為最佳單一模型的約五分之一。這意味著,在相同的預算下,SuperScout可以處理更多的任務,或者將節省的成本用於其他環節。- 與隨機流量分配比較:SuperScout的表現也優於「隨機流量分配」的基線(即不進行智慧路由,隨機將任務分配給四個模型)。這證明了路由決策本身確實帶來了效益。關鍵發現:交接文件才是主要功臣,而非路由決策 然而,論文中最引人注目的發現,來自於一個「無路由消融」實驗。

研究團隊將SuperScout的路由器移除,改為「永遠使用最便宜的修復器,並附上交接文件」的策略。結果顯示,這個「無路由」系統在SWE-bench Pro上與完整的SuperScout系統「打成平手」,解決率幾乎相同。這項結果極具啟發性:它表明,SuperScout所帶來的成本節省與性能提升,主要來自於「先偵察倉庫並產生交接文件」這一行為,而非最終的路由決策本身。換句話說,交接文件本身已經包含了足夠的資訊,使得即使是最便宜的修復器,也能在獲得這些資訊後,表現得與昂貴的修復器一樣好。

路由決策在當前基準上並未帶來額外的增益,但這也暗示了,如果路由器的決策更加精準,或是在更困難的任務分佈上,其價值可能才會顯現。機制分析:交接文件「重新分配」而非「增加」解決能力 為了深入理解交接文件的作用機制,研究團隊進行了一項配對校準研究(paired calibration study)。他們將任務分組,並比較了不同修復器在「有交接文件」與「無交接文件」情況下的表現。結果發現了一個有趣的現象:

交接文件顯著提升了三個較便宜的修復器的解決能力,但略微損害了最強模型(最貴的那個)的表現。這表明,交接文件的作用是「重新分配」解決能力,而非「增加」整體能力。它將原本只有最強模型才能解決的任務,轉化為較弱模型也能解決的任務。這可能是因為,交接文件提供了強烈的「提示」或「線索」,讓較弱的模型更容易找到正確的修復方向。然而,對於最強模型而言,這些額外的提示可能反而限制了其探索空間,或者引入了不必要的偏見,導致其表現略微下降。不過,論文中也指出,由於樣本量僅有99個,這些每修復器的效果僅具有「方向性」意義,尚未達到統計顯著性。

路由器的隱藏狀態具有價值,但交接文件文字本身沒有 另一個有趣的發現是,在路由器的訓練與校準中,搜尋器的「隱藏狀態」對成本路由的預測有顯著幫助,但交接文件的「文字內容」本身卻沒有。這意味著,路由器的決策能力,可能更多地來自於搜尋器在探索倉庫過程中所形成的「內部表徵」(即隱藏狀態),這些表徵捕捉了任務的複雜度、倉庫的結構等資訊,而這些資訊是交接文件的文字形式無法完全傳達的。這也暗示了,未來可以設計更直接利用隱藏狀態的路由機制,而非僅依賴文字。成本效益:搜尋器運算成本極低 研究團隊也計算了搜尋器的運算成本。在每個任務上,SuperScout-7B的GPU時間成本不到0.5美分。

相較於前沿修復器每次呼叫可能高達數美元的成本,這筆額外開銷幾乎可以忽略不計。這使得SuperScout在經濟上具有極強的吸引力,因為它用極低的成本換取了大量的資訊,進而節省了昂貴的修復器呼叫。結論與展望:路由與偵察的未來 總結而言,SuperScout提出了一種「先偵察,後路由」的新範式,並透過實驗證明了「交接文件」在降低編碼代理成本方面的巨大潛力。雖然目前的路由決策並未帶來額外的增益,但這項研究為未來的發展指明了方向:

強化路由決策:既然交接文件本身已能提升弱模型能力,未來的重點應放在如何讓路由決策更精準,例如利用搜尋器的隱藏狀態來預測哪個修復器最適合處理特定任務,並在「無路由」的基礎上進一步提升整體表現。2.探索更強搜尋器:目前使用7B模型作為搜尋器,若使用更大、更強的搜尋器,產生的交接文件品質可能更高,或許能進一步縮小與最強模型的差距,甚至超越。3.動態調整交接文件:針對最強模型可能被交接文件「干擾」的問題,可以設計動態機制,根據任務難度或修復器的能力,決定是否提供交接文件,或提供不同詳細程度的交接文件。

這項研究不僅為編碼代理的經濟性提供了實用的解決方案,也為理解「模型間知識傳遞」與「任務路由」的機制提供了新的視角。未來,我們或許會看到更多結合「偵察」與「路由」的系統,在自動化軟體修復領域中,實現更高效、更智慧的資源配置。

Related

相關文章

智東西AI Agent

當AI無處不在,TI用全棧嵌入式邊緣AI方案破解AI落地“老大難”

作者 | 雲鵬 編輯 | 漠影 從雲端到邊緣,今天AI正深刻改變人類與物理世界的交互方式。從醫療可穿戴設備、智能家居、工業自動化到具身機器人,邊緣AI憑藉低延遲、高安全、高可靠等獨特優勢,給不少行業帶來了AI落地新解法,海量AI應用直接在終端設備本地完成實時感知、推理與決策。 作為邊緣AI部署的關鍵載體,以微控制器(MCU)為代表的嵌入式芯片正迎來新一輪智能化升級。然而將AI能力下放至資源受限的邊緣節點,需要攻克成本、功耗、安全等諸多維度的嚴峻挑戰。

51 分鐘前
IT之家AI Agent

科技巨頭因 AI 購物起爭端:亞馬遜封禁 Meta Muse 智能體

作者:遠洋 責編:遠洋 評論: 感謝網友 咩咩洋 的線索投遞!9 月 21 日消息,亞馬遜已經阻斷了 Meta 全新的個人 AI 智能體 Muse 代用戶在亞馬遜網站購物的訪問權限。此前亞馬遜曾嘗試勸說這家 Facebook 母公司主動在 Muse 當中排除亞馬遜電商站點,但協商未果。

5 小時前
IT之家AI Agent

聯合國:不必等風險完全釐清,各國應提前管控 AI 智能體

作者:遠洋 責編:遠洋 評論: 9 月 21 日消息,聯合國一個科學專家小組發佈警示:各國政府應當在完全釐清風險之前,就對能力日益強大的 AI 智能體加以管控。這份報告也是該國際組織針對今年早些時候 OpenAI 入侵 Hugging Face 一事出具的首份重要評估文件。

6 小時前
鈦媒體AI Agent

智譜道歉之後,誰來給Agent劃邊界?

字母榜2026.09.21 18:03 · 來自北京全文4640字00:00 / 14:10Agent比人們想象的更危險。文 | 字母榜上傳代碼風波發酵近72小時後,智譜道歉了。9月21日早間,智譜旗下AI編程平臺ZCode發文稱,針對社區反饋的ZCode產品安全問題,已經完成整改,並向所有用戶道歉。智譜方面還表示,已將ZCode開源(https://github.com/zai-org/ZCode),把代碼交給社區監督,讓ZCode變得開放、透明。

6 小時前
AIbaseAI Agent

阿寶上線「魚來」摸魚AI系統,將碎片化休息納入智能管理

據瞭解,「魚來」首批已釋放500尾魚苗。用戶只需對阿寶說出「魚來」,即可隨機召喚一條魚,從中選出自己的「命定之魚」,並設置每日摸魚提醒。整個流程被概括為三步:對阿寶說出指令(如「每天下午2點提醒我來摸魚」)、為任務命名並開啟通知權限、坐等每日準時提醒。

10 小時前