Agent 走向具身世界:從語言智能到機器人「大腦指揮官」

2026年8月26日 06:11
站內 AI 整理稿

RoboHarness用編排異構策略,讓VLA、WAM、RL和TAMP不再各說各話,並零樣本完成長時序任務。作者丨鄧哲敏 編輯丨齊鋮湧 想象這樣一個任務:打開櫃門,找到藏在裡面的積木,然後把它們搭成一座橋。對人來說,這是一件很簡單的事,幾個動作自然銜接,幼兒園小朋友也能順利完成。但對機器人來說,這個任務橫跨多種完全不同的能力:找積木,需要視覺理解和語言指令跟隨;開櫃門,需要與環境進行復雜交互;搭積木,需要幾何規劃和精準操控並推測環境變化。

更麻煩的是,這些種能力分屬多個不同“門派”的模型——VLA(視覺-語言-動作模型)、WAM(世界-動作模型)、RL 策略(強化學習)、TAMP(任務與運動規劃)。它們各有所長,又彼此割裂,訓練方式不同、輸入格式不同、狀態空間也不同。今天在機器人領域,能力不缺,但協作缺位。華為諾亞方舟實驗室近期發佈了一篇論文,提出了名為 RoboHarness 的系統,專門解決不同策略之間無法協作的問題。圍繞這項工作,論文作者與我們()進行了交流。論文:https://arxiv.org/abs/2607.18060項目主頁:https://www.robo-harness.

com/01萬能模型的幻覺和現實的鴻溝今年夏天,機器人研究領域密集出現了幾項圍繞 Harness 展開的工作,它們共同指向一個認知:靠更大的模型解決一切,暫時行不通,機器人需要一層執行組織系統。清華大學於超教授團隊在 7 月發佈了 Harness VLA,將數字智能中廣泛使用的 Harness Layer 引入具身智能,讓一個凍結的 VLA 專注於最擅長的接觸密集操控,同時用一層 Harness 學會何時、以何種方式調用它,以及在 VLA 失敗後如何重置、如何重試。在 LIBERO-Pro 擾動評測中,這套系統把成功率從 50% 提升到 82.4%。

思路上,Harness VLA 解決的是一個模型如何在分佈外擾動下穩定發揮。它的問題是單策略的穩定性。華為諾亞方舟實驗室的 RoboHarness,面對的是另一層問題:當任務超出任何一個模型的能力邊界時,怎麼辦?兩者都叫 Harness,都用 Coding Agent 做組織層,但解決的是不同維度的挑戰。前者讓一個專才變得更穩,後者讓一群各有所長的專才協同作戰。隨著機器人任務複雜度不斷上升,後一個問題正變得越來越無法迴避。這個問題的根源,要從各路模型的能力邊界說起。

VLA 模型的優勢在於理解開放式語言指令、在新環境裡泛化,但它端到端生成動作的方式,在長時序任務中很難保持一致性;強化學習策略能在特定訓練場景內磨出穩定的閉環行為,但這種穩定性高度依賴訓練分佈,環境稍有變化便可能失效;TAMP 擅長符號推理和幾何約束,但需要預先定義動作原語,面對開放場景和模糊目標時規劃器很快就會吃力;WAM 能通過預測未來狀態輔助長時序決策,但容易隨預測時域增長產生誤差累積。複雜的真實任務同時要求語義理解、幾何規劃、閉環控制、長時序推理和環境變化推測,這些能力對應的訓練目標不同,有時甚至相互衝突。

從各項能力分別取得突破,到單一模型在開放環境里長期穩定兼顧所有能力,橫亙著一道至今沒有被真正跨越的鴻溝。RoboHarness 的出發點正是:與其等待這道鴻溝被填平,不如先讓已經存在、各有所長的模型真正協同起來。作者認為,直到某一個模型能夠完全壓制其他所有模型、展現出絕對的統治力之前,這樣的編排架構都是非常有意義的。這項工作並非憑空而來。作者告訴我們(),RoboHarness 的雛形誕生於去年參加全球機器人挑戰賽 BEHAVIOR Challenge 的經歷。當時賽題任務又長又難,團隊發現無論是端到端訓練 VLA 還是用行為克隆之類的模型,都沒法覆蓋任務本身的難度。

這次受挫,反而讓團隊看清了真正的問題所在。02調度大腦如何決定該誰上場RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等獨立開發的控制系統,封裝成可以被統一調度的 agentic skills,由 Coding Agent 負責高層決策。這個設計有一個重要前提:不改變、不重訓任何底層策略。各個策略保留自己的原始實現,不需要共享模型結構、動作空間或訓練數據。RoboHarness 只是在它們之上增加了一層組織能力。選對策略,可沒那麼容易。對於一個 Coding Agent 來說,單靠原始圖像輸入,很難可靠地判斷這個任務該派發給誰。

因為這個決定背後藏著很多靠語言模型的語義理解能力答不出來的量化問題。它能讀懂把杯子放到盤子上,但無法從一張 RGB 圖像裡算出當前場景與某個策略訓練分佈的相似度,更沒法評估此刻傳感器數據的可靠程度。為了解決這個問題,系統設計了三類輔助技能,專門替 Coding Agent 把判斷所需的信息提煉出來。Understanding Skills,負責將原始輸入轉化為可量化的信號,比如:圖像嵌入與各策略訓練數據的相似度、物體位姿在時間窗口內的穩定性、當前光照和圖像質量是否達標等。這些指標是策略路由的真正依據。作者認為,這個模塊的本質,就是從多維度去衡量每一個策略到底適不適合當下的任務。

Memory Skills,檢索歷史執行經驗,為選策略提供參照,並通過 Memory Bridge 處理策略之間的狀態分佈不匹配——這是系統最核心的設計,下文單獨展開。Evolution Skills,利用在線反饋持續更新策略的元數據和編排邏輯,讓系統從每一次執行中學習,而不是每次面對新情況都從零判斷。三類技能的信息流相互交互,共同輔助 Coding Agent 決策。在實際執行中,這套機制主要有兩層作用:一是任務拆解,將長指令切分為適合不同策略承接的子任務;二是動態切換,噹噹前策略逐漸接近其能力邊界時,系統會及時切換到更合適的策略,實現不同策略之間的能力互補。

論文用一組消融實驗說明了這兩層的各自貢獻:僅用語言模型幫 pi0.5 拆解任務再發給它,成功率已經明顯上升;在此基礎上接入多個異構策略後,成功率進一步大幅提升。拆得對是第一步,派得準是第二步,兩者缺一不可。但還有第三個問題,也是最難的一個,是光靠選策略解決不了的。03決定接力跑勝利的是交接的瞬間兩個獨立訓練的策略,通常生活在各自的數據世界裡。它們的輸入格式不同,對機器人狀態的經驗分佈也不同。TAMP 操作完畢停下來的那個位置,很可能恰好落在 VLA 從未處理過、無法穩定啟動的狀態空間裡。這是異構策略編排獨有的難題。

因此,負責讓兩個策略穩定交接的 Memory Bridge 被作者列為 RoboHarness 裡第一重要的模塊。他坦承,如果未來某個通用模型能完美覆蓋全部狀態空間,Memory Bridge 或許就非必需;但在現狀下,任何模型都很容易在交接瞬間落進能力分佈之外。Memory Bridge 的工作分三步。檢索:根據下一子任務和當前觀測,通過文本和視覺相似度,從多模態記憶庫裡找出目標策略曾經成功執行的 Top-K 條相似軌跡,提取末端執行器位姿、關節角度等機器人狀態。建模:根據各狀態在軌跡中的相對進程賦予監督信號,通過在線迴歸實時擬合目標策略“習慣接手”的狀態範圍。

橋接:採樣並評分候選狀態,綜合考慮進入目標策略舒適區的置信度和運動代價,選出最合適的橋接目標,生成過渡軌跡;機器人抵達這個狀態後,再把控制權交給下一個策略。這套機制完全依賴歷史執行數據在線學習,對任意策略即插即用,無需修改底層實現,也不需要聯合訓練。消融實驗中,移除 Memory Bridge 後,任務進度下降不算太大,說明策略選擇依然基本正確,但完整成功率從 86.0% 驟降至 60.4%。大量任務走到最後一步,因為交接狀態不兼容而功敗垂成,從方面證明了 Memory Bridge 的價值。04兩條技術譜系,一場悄悄發生的匯流把視野從這篇論文拉開,我們更想去描述一幅更大的具身技術版圖。

RoboHarness 的作者觀察到,在過去三年 VLA 快速發展的背景下,傳統 TAMP 與分層規劃由於在開放場景中的泛化能力明顯弱於端到端 VLA,一度淡出社區關注。然而,隨著今年 agentic systems 和 coding agents 的快速進展,分層架構重新獲得了新的生命力:高層 agent 可以藉助可組合的 skills 進行任務拆解、工具調用與動態規劃,從而顯著增強傳統層級方法的泛化能力與適應性。由此,學術社區正重新關注,並開始探索如何將強泛化的高層推理與異構底層策略相結合。這篇文章的作者來自多所加拿大東部高校和研究機構。

筆者觀察到,北美機器人研究長期存在兩條具有明顯學術淵源的技術路線:美國西海岸,以 Stanford、Berkeley 等為代表,更強調 learning 與 scaling,關注端到端學習、數據規模和模型泛化;而美國東北部及加拿大,以 MIT、多倫多大學、MILA 等為代表,則長期更重視分層架構、符號推理、邏輯規劃和結構化決策。RoboHarness 的作者們,正處於後者這條譜系的延伸之上。技術路線的分化,在具身智能工業界留同樣下了清晰印記。

近年來快速發展的團隊逐漸形成了從 foundation model scaling 到 agentic hierarchy 的技術譜系:一類更強調通用具身基礎模型、VLA 與 world model,通過統一模型、數據規模與模型能力的提升不斷拓展泛化邊界;另一類則更強調可複用操作技能與分層架構,通過任務規劃、技能組合和底層控制協同完成複雜任務。

國內以智源為代表的團隊更接近前者,而蘇度科技、魔法原子等則更突出後者;在海外,Physical Intelligence 的 pi 系列長期代表了 scaling 路線,而 Gemini Robotics,則延續了“高層推理與規劃 + 底層技能執行”的分層傳統。有意思的是,這種技術譜系的分化並非靜態對立,而是在不斷演化中形成互補。近幾個月,兩條技術路線開始出現明顯的匯流現象。例如,Physical Intelligence 在 pi0.

7 中將可控性與技能組合提升到更核心的位置;與此同時,NVIDIA 等團隊也持續推出更具分層特徵的 robot agentic systems,將基礎模型的理解與推理能力與VLA結合。整體來看,foundation model scaling 與 agentic hierarchy 正在從兩條相對獨立的技術路徑,逐漸演化為同一套機器人系統中的互補能力。05以編排為徑,走向更通用的智能RoboHarness 本身有明確的侷限:它能調度的是已有策略,無法解決所有策略都做不到的事。Memory Bridge 的可靠性依賴足夠的歷史執行數據,新接入的策略在早期階段的能力評估會有較大的不確定性。

論文的核心論點並非否定統一大模型的必要性。作者強調,長時序任務的編排不僅是對現有能力的組合,本身也會持續產生單個模型難以獨立獲得的跨能力、跨場景執行數據。這類數據記錄了不同策略之間的切換、銜接、失敗恢復與協同過程,恰恰可能成為訓練下一代通用機器人模型的重要來源。基於這一思路,RoboHarness 團隊也正在探索將混合策略編排與執行過程中產生的數據重新用於底層策略訓練,異構編排的執行經驗進一步反哺模型基礎能力的提升。從尋找最強模型到組織最合適的能力,具身智能的競爭,正在悄悄延伸到系統層面的設計。

異構策略編排與統一大模型,像是沿著兩條不同山脊展開的跋涉,最終都指向同一個遠方:讓機器人擁有更通用、更可靠的智能。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

AIBaseAI Agent

馬斯克訓話曝光:斥資600億收購Cursor後開啟深度整合

在交易完成後,埃隆·馬斯克面向Cursor千餘名員工召開了內部全員會議,首次公開承認SpaceX的人工智能部門在激烈的行業競爭中目前落後於Anthropic等強勁對手。在這次講話中,馬斯克不僅直面了技術落後的現實,更強調人工智能技術最終將發展至人類無法掌控的階段,並以此要求全體員工全力以赴助力其搶先攻克核心技術,同時明確表示後續會繼續大規模囤積算力。

5 小時前4900
何夕2077AI Agent

SparseRead長程閱讀省令牌

Computer Science > Artificial Intelligence arXiv:2608.22237 (cs) [Submitted on 23 Aug 2026] Title:Read Less, Solve More: Token-Efficient Sparse Reading for AI Agents Authors:Zedong Liu, Jiaan Wu, Xinyang Ma, Le Xu, Kai W。

7 小時前
何夕2077AI Agent

阿里事件日誌式智能體記憶

阿里巴巴近期在智能體記憶技術上提出了一項新的研究進展,相關論文已正式公開。這項研究聚焦於如何讓大型語言模型驅動的智能體具備更穩定、更長效的記憶能力,而非僅依賴單次對話的上下文理解。團隊提出的核心設計是「事件日誌式記憶」,將記憶單元與具體的會話進程綁定,讓智能體在跨越多輪互動時,仍能準確回溯先前的決策脈絡與使用者意圖,進而提升整體回應的連貫性與個人化程度。 在技術實作層面,這套記憶機制採用了沙盒內核架構來保存執行過程中的關鍵變量。

7 小時前
何夕2077AI Agent

Keenable建設智能體搜索索引

Keenable 今日正式退出隱身模式,對外揭露其正在打造的智能體搜索索引。這家新創公司瞄準的是大型語言模型與 AI 智能體在執行任務時,需要快速、精確檢索海量資訊的底層需求,試圖從搜尋基礎設施層面切入,補足傳統搜尋引擎難以應對的即時性與結構化挑戰。 伴隨此次公開亮相,Keenable 也同步宣布完成 2600 萬美元的種子輪融資。這筆資金將用於擴大工程團隊規模,並加速索引系統的部署與優化。

7 小時前
鈦媒體AI Agent

AI改變錢的流向:預算、自研與最後一公里

數智前線2026.08.25 19:27 · 來自甘肅全文6802字00:00 / 19:45ToB市場大變局,服務商們換了活法。文|數智前線,作者 | 任曉漁,編輯|徐鑫“八成電商客戶反饋,軟件和基礎設施的預算有明確的下降指標。”“以菜單和超級鏈接組成的信息化系統,今天AI開發起來太輕鬆了。”“原來大家要的是一個工具,現在大家要的是一個結果。”今年,一部分企業級市場的錢正在改變流向:在電商、營銷和與辦公相關的輕系統領域,軟件和基礎設施預算正被壓縮。

11 小時前