對話 COBRA-Skills 一作盧平琛:僅用 50 個樣本,重構 Agent 技能降本路線
當經典算法遇到 LLM,用概率預判代替盲目試錯,或許才是架構演進的真正解法。作者丨張 璐 編輯丨馬曉寧 過去,智能體的技能(Skill)大多依賴人類專家手動撰寫,不僅耗時費力,更難以覆蓋海量複雜的真實場景。為此,藉助大模型“自動化生成與優化技能”,成了讓 Agent 邁向自主進化的新範式。然而,擺脫了人工編寫的束縛,卻撞上了高昂的 Token 賬單。要驗證一個自動生成的技能到底管不管用,必須讓智能體帶入真實任務中落地執行。每一次試錯,都是實打實的 Token 消耗與多輪交互的時間成本。更棘手的是,許多候選技能在剛生成時就自帶缺陷。
但在現有框架下,我們缺乏“事前篩選”的能力,只能任由大量預算被這些低質候選無意義地吃掉。同時,後續的精煉流程也在頻繁調用高階 LLM,哪怕缺乏有效的新證據,這種“反思—重寫”的流水線依然在機械重複。評估貴,精煉也貴,兩筆賬算下來,技能優化的效率就成了繞不開的瓶頸。針對這一痛點,來自香港中文大學(深圳)、天津大學、香港科技大學(廣州)和新加坡國立大學的研究團隊,在論文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一種全新的破解思路。論文鏈接:https://arxiv.
org/abs/2609.11682COBRA-Skills 摒棄了盲目堆疊 Token 的演化路線,巧妙地將技能優化轉化為一個帶預算控制的情境多臂老虎機(Contextual Bandit)問題。它在真實評估前增加了一道“收益預判”機制,確保只有最具潛力或探索價值的候選技能才會進入實際演練,並結合精細化算子迭代種群。憑藉這套高效的篩選策略,COBRA-Skills 僅用 50 個優化樣本,就將優化成本降低了 55%~58%,並在 6 個跨領域 Benchmark 上實現了對現有主流方法的全面超越。AI 科技評論近日獨家對話了論文第一作者盧平琛。
在交談中,他向我們還原了團隊如何將“情境多臂老虎機”引入 Agent 技能演化,以及這套低成本範式背後的真實踩坑經歷與工程抉擇。01雙輪閉環:經典算法“篩選” + 進化算子“重構”COBRA-Skills 的設計可以概括成:老虎機負責“選”,進化負責“改”,兩者形成一個持續運轉的閉環。具體而言,系統維護著一個固定規模的技能種群。在日常迭代中,流程分為三步:1.篩選評估。由老虎機算法為種群中的每個技能打分,挑選出得分最高者;2.實戰檢驗。目標智能體搭載該技能在優化集上執行任務,並返回對應的獎勵與執行軌跡;3.反饋更新。將評估結果寫入歷史數據,用於更新打分模型。
此外,種群會定期觸發進化更新,淘汰低分技能並生成新技能填補空缺。這兩大機制緊密結合。老虎機依據歷史數據預測技能潛力,而進化生成的新技能則會迴流至老虎機的候選池;反過來,進化機制所依賴的改進證據,來自執行老虎機精細挑選後的技能後留下的執行軌跡。02引入“老虎機”,將 Token 消耗攔在評估之前論文第一作者盧平琛在接受AI科技評論採訪時透露:在最開始復現同類工作時,我們發現總 Token 量看似還好,但賬單卻高得嚇人。團隊深入分析後發現,核心瓶頸在於教學模型(Teaching Model,如 GPT-5.5 類高階模型)調用次數過多,且單次調用的上下文極長。
因此,團隊在設計初期就明確將目標定為控制實際經濟成本(Cost),而非簡單統計 Token 數量。▎兩層 MLP 收益預測:為未評估技能精準打分最直接的做法,是基於歷史評估數據,預判候選技能在未評估時的預期得分。COBRA-Skills 藉助一個輕量級的兩層 MLP 來實現這一點:先將每個技能轉化為語義嵌入向量,再由 MLP 輸出一個標量獎勵預測值。隨著評估數據的積累,預測精度會穩步提升。每完成一次技能評估,最新的“技能—獎勵”數據就會被納入歷史庫,用於重新擬合預測模型。然而,單純依賴預測收益往往會帶來侷限。
若某種技能當前的預測得分最高,算法就容易陷入對它的持續選擇,導致其他有潛力的技能永遠得不到評估機會。這便是經典的“探索與利用”困境。▎LinearUCB 空間探索:破除“只選高分”的貪婪困境在探索策略的選擇上,團隊曾經歷過嚴謹的實證對比。據盧平琛介紹,團隊最初曾嘗試過 NeuralUCB,但發現其特異性篩選能力較弱。比如連續兩輪選中同一個技能,系統對該技能不確定性的衰減幅度與其他技能幾乎沒有區別;此外,NeuralUCB 的計算量極其龐大,在做對角化近似時還會犧牲部分精度。相比之下,LinearUCB 則展現出了極高的性價比與精準度。
仿真實驗表明,以技能嵌入向量為輸入、對應獎勵為輸出時,LinearUCB 能非常靈敏地識別出哪些語義區域已被充分探索,進而精準壓低該區域的探索獎勵,實現了輕量與高效的兼得。因此,團隊最終採用了 “神經網絡預測收益 + LinearUCB 量化探索” 的輕量高效組合。最終優先級分數 = 預測獎勵 + 探索獎勵在運行邏輯上,系統每輪僅挑選得分最高者送入評估,而綜合分值墊底的技能則會在後續進化中被淘汰。這種設計將有限的評估預算精準引導至兩類技能:要麼預測表現極佳(利用),要麼信息增量巨大(探索)。至於那些既無性能優勢、又處於已探明區域的低質技能,則會被徹底過濾,不再浪費任何 Token。
圖:LinearUCB 探索係數v對系統平均性能的影響分析(當v=0.1時達到最優性能 73.5%) 03基於軌跡證據演化,告別全局重寫的盲目消耗老虎機算法解決了“選誰評估”的效率問題,但候選技能本身並不會憑空變強。真正推動技能質變的是進化機制。它立足於評估所產生的實戰證據,負責對候選技能進行持續的生成、重組與精煉。▎攢夠證據再動刀,避免頻繁消耗 Token為了避免高頻調用高昂的 LLM 去頻繁重寫技能,進化機制並非逐輪觸發,而是採用了對數調度策略,例如在第 3、6、9、13、19……次迭代時按需觸發。
據盧平琛介紹,隨著演練推進,老虎機本身已能建立起相對準確的預測邏輯,老虎機的預測結果也能逐漸收斂到好的候選技能上,因此後期並不需要高頻補充新技能。這種“前期密集、後期稀疏”的演化節奏,讓團隊得以在積攢了足夠的實戰軌跡證據後才精準“動刀”,從而大幅降低了 Teaching Model 的調用頻次與 Token 消耗。▎三種演化算子:保守微調與結構保護每次進化更新時,算法淘汰評估得分最低的m個技能,並由以下三種算子生成新技能填補空缺:1.再生算子(Regeneration):直接從初始無技能的執行軌跡中歸納全新的獨立策略,不依賴現有父代,為種群引入全新的探索方向。
盧平琛提到:若整個框架只能保留一個算子,再生算子無疑是絕對核心,因為初始技能種群正是基於它構建而來的。2.軌跡變異(Rollout Mutation):針對當前輪次評估的技能,採樣其最新的成功與失敗案例,僅做局部的針對性修正。3.交叉重組(Crossover):對比歷史高績效與低績效技能,以其中一個高分技能為“骨架”,吸收成功經驗並規避已知失敗模式。該過程無需目標智能體重新評估,屬於“零成本”重組。除了算子設計,團隊在技能的修改幅度上也展現出了極強的工程剋制。
不同於許多同類工作讓 LLM 對技能進行全局重寫或過度融合,團隊在實驗中發現,大面積修改極易破壞原技能中已生效的優良結構,從而引發性能震盪。盧平琛強調:對於軌跡變異與交叉重組算子,我們以現有技能或高分技能為骨架,進行少量、保守的局部修改,這樣才是穩定可控的。04實測驗證:性能全面超越,優化開銷直接腰斬為了全面驗證 COBRA-Skills 的泛化能力,論文在 6 個異構的智能體基準上進行了評估。
這些任務覆蓋的維度相當廣泛: SearchQA:開放域問答; SpreadsheetBench:電子表格自動化操作; DocVQA:文檔圖像理解; LiveMath:研究級複雜數學推理; SocialMaze:社會推理與隱藏角色推斷; ALFWorld:具身環境中的多步決策。這些任務不僅橫跨單輪與多輪交互,更涵蓋了外部文件處理、工具調用以及與持久化環境的持續互動。在實驗配置上,團隊選用了三個不同能力梯隊的目標模型(Qwen3.6-35B-A3B、GPT-5.4-Nano、Gemma-4-26B-A4B-it),並統一採用 GPT-5.5 作為教學模型。
所有方法均共享同一個 100 例的留出測試集,且該測試集全程嚴格絕緣於技能的構建與篩選過程。▎突破性能上限,中小模型“補強效應”尤為突出在三個不同能力梯隊的目標模型上,COBRA-Skills 均取得了最高平均性能。相比無技能基線,它在 Qwen、GPT-Nano 和 Gemma 上分別大幅提升了 13.1、26.9 和 22.5 個百分點。數據表明,優質技能對於能力相對較弱的小模型,具有更顯著的“補強效應”。
圖:COBRA-Skills 與主流方法在不同目標模型上的平均性能(上)及性能與優化成本對比(下)對比實驗還顯示,即便僅做初始化、不做後續優化的“證據錨定技能基線”,其表現也能穩定超出無技能基線,而 COBRA-Skills 則在此基礎上實現了進一步的跨越。值得一提的是,在三個目標模型的實驗結果種,COBRA-Skills 並非在所有單項基準上都拔得頭籌(例如在Qwen3.6-35B上,SearchQA 上略低於 SkillOpt;在Gemma4-26B上,DocVQA 上優勢不明顯)。但它的核心優勢在於極高的綜合魯棒性。無明顯短板,也沒有在任何模型上失靈。
表:COBRA-Skills 與主流方法在 6 個 Benchmark 上的詳細性能對比數據在複雜的異構任務場景中,這種“不偏科”的綜合穩定性,遠比單一任務上的單點突破更具實用價值。▎教學 Token 節省八成,50 樣本撬動高穩定泛化在成本控制上,與最強基線 SkillOpt 相比,COBRA-Skills 的總優化成本降低了 55%–58%,教學模型的 Token 消耗大幅縮減了 67%–80%,每單位性能提升的成本降低了 60%–69%。表:COBRA-Skills 與主流方法在 Token 消耗、優化總成本及單位性能成本上的量化對比傳統方法往往依賴龐大的樣本集進行訓練與驗證。
例如在 SearchQA 上,SkillOpt 官方配置包含 400 個訓練樣本和 200 個驗證樣本;SpreadsheetBench 的 Trace2Skill 也使用了 200 個樣本。相比之下,COBRA-Skills 在所有基準上統一僅使用 50 個優化樣本。針對這 50 個樣本的設計考量,盧平琛解釋道:樣本太少(如 20 個)會導致分數反饋劇烈震盪,而 50 個樣本能提供非常穩定的反饋信號。在具體進化時,我們每次從 50 個樣本中隨機抽取 8 條執行軌跡作為證據;C₅₀⁸構成了極其龐大的組合空間,既保證了證據的針對性,又為技能生成保留了豐富的多樣性與探索空間。
這 50 例樣本在“評估可靠性”與“任務覆蓋度”之間取得了極佳平衡:每個候選技能均在這 50 例上完整評估,以獲取可靠的排序信號;同時,樣本完整保留了基準任務的真實構成,能暴露出多樣化的重複模式供技能歸納。樣本少不等於信息少,關鍵在於利用效率。論文還設計了兩組消融實驗:1.w/o Bandit(移除老虎機):保留進化機制,但候選篩選改為隨機選擇,平均性能下降 2.2 分。2.w/o Evolution(移除進化):保留老虎機機制,但在固定的 30 個技能池中挑選,不生成新技能,平均性能下降 2.4 分。兩者均造成 2 分以上的性能衰退,可見選擇性評估分配與候選空間演化互為補充、缺一不可。
此外,論文還設置了 Best-of-30 基線(用同樣的證據錨定機制生成 30 個技能,全量評估後取最優解)。結果顯示,Best-of-30 比完整方法低了 2.5 分。圖:消融實驗與 Best-of-30 結果對比(上表)及 36 組跨模型技能遷移矩陣熱力圖(下圖)▎無懼接口切換、離線自教學與跨模型遷移論文從三個層面進一步驗證了方法的泛化韌性。1.框架適配:將 Qwen 移植至 Claude Code 和 Codex 框架下運行,COBRA-Skills 依然分別取得 68.2 和 72.4 的最高平均分,證明其效果不依賴特定的智能體接口。
表:COBRA-Skills 在 Claude Code 與 Codex 框架下的跨平臺適配性能對比 2.自教學進化:若以目標模型自身取代 GPT-5.5 進行技能生成與精煉,系統平均分僅由 73.5 微降至 72.5,卻實現了成本減半,且性能遠超同等設置下的 SkillOpt(68.4),展現了離線低成本自教學的巨大潛能。圖:迭代收斂過程(左)及自教學模式下的性能與成本對比(右) 3.跨模型複用:將 GPT-5.5 優化的技能庫遷移至其他目標模型,36 次遷移中 34 次成功超越基線。
這有力地說明,COBRA-Skills 提取的是高泛化性的任務層解題範式,而非與特定模型綁定的 Prompt 技巧。05大模型負責創造,經典算法負責控本過去一段時間,Agent 領域隱約浮現出一種“大模型全包”的迷信:從任務理解、技能生成,到診斷反思與重寫進化,全盤交給 LLM 端到端解決。但這篇論文用一組直觀的賬單數據,直白地戳破了這種“全能幻覺”。大模型固然具備驚人的符號生成與語義理解能力,但在處理帶預算約束的序列決策、估計統計不確定性,以及計算“算力回報率”這類問題時,它不僅價格昂貴,而且缺乏天然的概率把控力。COBRA-Skills 最耐人尋味的設計,恰恰在於它的“復古”。
團隊沒有強求大模型憑空判斷哪個技能更有價值,而是優雅地引入了決策理論中經過數十年驗證的“上下文老虎機”。這種“傳統 ML 負責量化與控本,LLM 負責生成與提純”的範式融合,為下一代 Agent 的架構設計提供了清晰的示範。06 獨家對話:專訪第一作者,拆解工程邊界與落地未來▎AI科技評論:在跨模型遷移實驗中,36 次遷移有 34 次成功超越了基線,但有 2 次表現欠佳。這兩次“例外”是什麼原因造成的?盧平琛:這兩次例外的幅度其實都很小,分別只比對應的無技能基線低約 0.3 和 1.7 個百分點。
一個更可能的原因是,不同模型的能力結構、推理習慣和錯誤模式並不完全一致,因此在一個模型上優化出的 Skill,未必能完全匹配另一個模型最需要的指導方式。當然,這其中也包含少量的隨機因素。但總體來看,超過 94% 的成功率證明,優化出的技能抓取的是通用的任務級策略,具備極強的跨模型通用性。▎AI科技評論:從工程落地的角度看,目前 COBRA-Skills 最大的侷限性是什麼?盧平琛:目前我們主要聚焦於任務層(Task-level)的技能演進化。從技能自身的結構來看,我們尚未覆蓋過於複雜的多技能聯動場景。
比如像 Claude Code 提出的某些 Skill 結構中,會在執行 SQL 的同時動態調用 Python 腳本,或者通過索引去關聯其他 SQL 技能。這種跨工具、多層級的複雜技能聯動結構,是我們目前尚未覆蓋、也是下一步需要探索的方向。▎AI科技評論:如果將這種“老虎機 + 進化”的思路延伸到其他場景(如 Agent 工具調用、RAG 檢索等),你覺得哪種最有可能率先落地?盧平琛:RAG 領域的相似度檢索最有可能率先落地。因為 Skill 的標準結構本身就包含 Title(標題)、簡短 Description(描述)以及 Body(正文)三部分。
在實際業務中,大量 Agent 正是依賴那句簡短 Description 進行索引與匹配的,這與我們當前的優化框架天然契合。▎AI科技評論:如果用一句話來概括這篇論文最核心的貢獻,你會怎麼總結?盧平琛:高效、低成本地優化 Agent 的 Skill,讓智能體演化不再被昂貴的賬單拖垮。為了方便大家抱團交流、互通會議消息,我們專門建了 ECCV 2026 參會交流群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。
前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!
上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

Meta Muse 爆紅,為什麼騰訊股價大漲?
Meta Muse 爆紅,為什麼騰訊股價大漲?深流研究所2026.09.23 10:39 · 來自北京全文3733字00:00 / 10:34扎克伯格等來爆款,騰訊跟著被重估。文 | 深流研究所,作者 | 吳絳楓Meta 在 AI 上砸下的重金,什麼時候才能拿到大結果?Muse 給出了第一個答案。9 月 8 日,Meta 推出個人 AI Agent Muse。上線不到兩週,Muse 登頂美國蘋果應用商店免費應用榜,排名超過 ChatGPT、Gemini 和 Claude。扎克伯格終於等來了一個消費級 AI 爆款。9 月 21 日,Meta 股價上漲 11.43%,創下 2025 年 4 月以來最大單日漲幅,市值一天增加約 1900 億美元。Muse 點燃的不只是 Meta。市場開始押注,個人 Agent 的普及會帶來更大的推理和計算需求。於是,Arm 上漲 17.2%,英特爾上漲 12.1%,AMD 上漲近 10%,市值首次突破 1 萬億美元。這輪行情很快傳到中國。9 月 22 日,騰訊控股盤中一度上漲 7.77%,股價升至 463.4 港元。在當天普遍上漲的港股科技股中,騰訊表現最突出。Muse 有什麼特別之處?它為什麼能讓華爾街重新相信扎克伯格,又為什麼讓遠在中國的騰訊獲得重估?為什麼說Muse是“社交+Agent”?從產品體驗看,Muse 完成表格填寫、日程整理、預訂餐廳、規劃旅行及購物等一系列任務。接到任務後,它會將目標拆解為多個步驟,再調用用戶已經授權的賬戶和服務。涉及發送郵件、提交訂單和付款等敏感操作時,Muse 會暫停執行,等待用戶再次確認。說實話,這些能力本身並不新鮮。OpenAI、Google、Anthropic,以及一批創業公司都有嘗試。Muse 的不同之處在於,Meta 第一次把個人 Agent 放進一個成熟的社交體系,嘗試藉助 Instagram、F

Opus 5.5來了,性能趕超Fable,成本低至40%
Opus 5.5來了,性能趕超Fable,成本低至40%字母AI2026.09.23 10:31 · 來自北京全文4730字00:00 / 12:20被Astra“逼出來”的全新系列。文 | 字母AI5.5!!是Opus 5.5!!就在三天前,路透社還報道稱,隨著GPT-6 Astra開始搶回企業市場,Anthropic正在考慮提前推出一款新模型應戰。社區一直猜測新模型會是Opus 5.2還是5.5,現在答案終於揭曉了。而且這不是一個小更新,Anthropic直接掀開了Claude 5.5這個新系列。Opus 5.5先打頭陣,Sonnet 5.5和Haiku 5.5也已經排在後面,將在幾周後推出。某種意義上,Astra這腳油門踩下去,Anthropic連換代速度都被一起帶快了。和新模型同時到來的還有一個重置,正好方便用戶體驗。 Fable的定位有點尷尬了 既然被認為是衝著Astra來的,那就把它和Astra放在一起看。先說價格,Opus 5.5的API輸入價格是每百萬Token 4美元,輸出20美元;Astra則分別是10美元和50美元。也就是說,Opus 5.5的Token單價只有Astra的40%。兩款模型的上下文沒太大差別,Opus 5.5是100萬Token,Astra是105萬;最大輸出也都是128K Token。Astra的知識截止日期是2026年4月30日,Opus 5.5則更新到了2026年6月。兩款模型均支持low到max五檔推理強度。而且Opus 5.5相比自家上一代Opus 5也降價了。Opus 5原本是每百萬Token 5美元輸入、25美元輸出,新模型兩邊都降了20%;Anthropic稱,再加上Token使用效率提升,完成一項典型任務的實際成本能比Opus 5低約40%,輸出速度則提高了30%以上。便宜歸便宜,Opus 5.5在跑分上倒是一點沒客氣

OpenRouter發佈 2026 嵌入模型選型指南:實測 19 款、 37 個目錄條目,按場景把最佳候選擺上桌
正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日核實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。

AI變天,Kimi怎麼補齊“月之暗面”?
光錐智能2026.09.23 10:15 · 來自廣西全文7430字00:00 / 20:20模型強只是入場券,月之暗面還需要補更多課文 | 光錐智能,作者|魏琳華,編輯|劉俊宏AI圈的規則就是用來打破的,市場變化之快,讓公司們經常猝不及防。

DeepSeek 傳將向聯合國安理會閉門通報 AI 潛在風險與安全挑戰
據路透社援引知情人士消息報道,中國人工智能初創企業 DeepSeek 預計將於本週向聯合國安理會就人工智能所帶來的潛在風險與安全挑戰進行專題通報。作為全球矚目的前沿 AI 力量,此次 DeepSeek 受邀參與聯合國安理會的安全通報,折射出國際社會對中國大模型企業在技術治理、風險防控以及全球 AI 安全框架建設中發揮實質性作用的重視。

Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026
本文作者: 叢末 2026-09-23 09:49 導語:只靠語言和 token,AI 永遠跨不過物理世界這道門檻!只靠語言和 token,AI 永遠跨不過物理世界這道門檻!作者丨幸麗娟 編輯丨岑 峰 AI 行業的主敘事,曾被 Scaling Law 壟斷:更大的模型、更多的 token,更強的文本推理,彷彿只要把語言模型繼續堆大,通用人工智能就會自動到來。