鈦媒體模型更新

29 秒視頻教會機器人新技能,清華北理工聯合開源 HOST

2026年8月5日 11:37
29 秒視頻教會機器人新技能,清華北理工聯合開源 HOST

重點摘要

清華大學與北京理工大學等單位聯合開源HOST框架,讓機器人僅觀看平均29秒的人類示範影片即可學會新技能,無需微調模型參數或重新採集數據,在50項未見過的桌面操作任務中成功率達62%。相較於傳統微調方案,HOST所需數據量減為1/50、學習時間縮短至1/507,且不會遺忘舊技能,為降低具身智能機器人的教學門檻提供了新路徑。

站內 AI 整理稿

教導機器人學會一項新技能,究竟需要多少步驟?波士頓動力的機器人能在複雜地形中流暢跑酷,Figure 01 的機器人可以在工廠裡搬運箱子,這些畫面看似聰明,但每個動作的背後,往往代表工程師團隊耗費數月的數據採集與模型訓練。過去,標準流程是專業工程師操作昂貴的遙控設備,錄製數百條示範數據,再花費大量時間調整模型參數,最後還得祈禱機器人學會新技巧時,不會把舊能力忘得一乾二淨。這套繁重的流程,如今迎來了全新的解方。

8月3日,自變量機器人與北京理工大學、清華大學聯合發布並開源了一套名為 HOST 的框架,全稱是 Human-to-robot One-Shot Skill AcquisiTion,意即「人類到機器人單樣本技能獲取」。這套系統讓機器人只需觀看一段平均長度約29秒的人類示範影片,就能在完全不更新模型參數、不採集新數據的條件下,執行從未見過的全新任務。在涵蓋放水果、堆碗、擦盤子、插筆等50項桌面操作任務的測試中,這些任務都是機器人在訓練階段從未接觸過的,HOST 的技能復現成功率達到62%。根據發表於 arXiv 的論文(編號2607.20033),與當前主流的 Pi-0.

5 搭配微調方案相比,HOST 所需的數據量大幅減少至原本的五十分之一,學習時間縮短至五百分之一,而成功率則明顯領先。更關鍵的是,HOST 在習得新技能的過程中完全不改變模型權重,這意味著它不會出現「學了新技能就忘了舊技能」的災難性遺忘問題。論文數據顯示,在傳統微調方案學習新技能後,最強的基線模型(Wall-OSS+SFT)在舊任務上的表現下降至原本的43%,而 HOST 幾乎完整保留了所有已掌握的技能。機器人學習人類技能時,長期以來最大的挑戰在於如何跨越「身體鴻溝」。

人類擁有雙臂、五指關節與靈活的軀幹,機器人卻可能是單臂、夾爪或輪式底盤,兩者在運動學與動力學模型上完全不同,直接讓機器人模仿人類手臂的軌跡與角度幾乎不可能成功。過去十年,業界的主流做法是「以大量數據暴力擬合」,透過遙操作設備採集數以萬計的機器人執行軌跡,再訓練端到端模型。自變量機器人團隊在論文中坦言,這條路雖然走得通,但成本極高,每一次教機器人新技能,都需要專業工程師重新採集數據、重新微調模型,花費動輒數萬元,而且每個新技能的學習都是從零開始,舊技能累積的經驗幾乎無法沿用。HOST 的突破性思維在於,它把問題的出發點從「動作模仿」轉向「結果推理」。

機器人不再試圖模仿人類的肢體動作,而是觀察人類完成任務後的結果狀態,再反推自己需要執行哪些動作序列。這個轉變直接繞開了「人機身體結構差異」這個難以克服的障礙,將學習目標從「重現過程」重新定義為「達成結果」。這樣的概念汲取自認知科學中的「觀察學習」理論,人類在面對陌生任務時,並非總是不斷試錯,而是基於已有的經驗,先在腦中模擬動作的預期效果,再據此執行。HOST 將這套理論工程化,實現了從「訓練時微調」到「推理時即時獲取」的範式轉變。HOST 的核心創新在於「結果先行」的推理流程,與傳統「看到人類動作、映射為機器人動作」的直線思維不同,它的處理過程分為三個步驟。

第一步是任務階段判斷,機器人觀看人類影片時,先判斷目前任務進行到哪個階段;以烹飪為例,系統需要分辨現在是切菜階段還是炒菜階段,這是基於視覺內容的任務進度語意理解,而非簡單的時間戳對齊。第二步是視角遷移,將人類執行完動作後的畫面,轉換為機器人自身視角與身體結構下會看到的畫面,人類用五指完成的任務,機器人要用夾爪完成,兩者的視覺畫面與運動邏輯都需要完整轉換。第三步是動作反推,從目標畫面反向推導需要執行的動作序列並付諸執行,機器人不是在「複製」人類動作,而是在「求解」一個問題:要達成這個結果狀態,我應該怎麼做。

這種「先想像結果,再反推動作」的機制,賦予 HOST 傳統方法無法比擬的泛化能力,即使執行過程中物品位置被移動,機器人也能根據目標狀態重新規劃動作,繼續完成任務。影片學習還有一個常被忽略的難題:人類與機器人的執行速度並不同步。同樣經過10秒,影片中的人類可能已經切完菜開始炒菜,機器人卻還在切菜階段,若按簡單的時間軸對齊,機器人會遺失任務進度資訊,導致後續動作全部錯位。HOST 的解法是「按任務進度對齊」策略,將影片每一幀與機器人操作的每一步都映射到同一個向量空間,再透過動態時間規整(Dynamic Time Warping)演算法,自動建立人類影片幀與機器人操作步驟之間的對應關係。

根據論文披露,這個方法把對齊誤差降低了一個數量級,從基於時鐘時間對齊的0.079降至0.006(平均絕對進度差),讓機器人的執行與影片示範能夠精準同步。這代表即使人類以快轉或慢速示範,機器人也能正確理解每個階段該達成的任務目標。這項技術的工程價值在於,它大幅降低了對人類示範影片的「規範性」要求,普通人不必刻意放慢動作或標準化流程,隨手拍攝的影片就能當作教學素材。HOST 的技術底座是一個具備視覺預測功能的級聯策略模型,採用雙專家混合架構,將技能學習拆分為兩個階段。

第一階段是同體預訓練,模型先在193,462條機器人同體軌跡數據上預訓練,覆蓋229項任務,目標是讓機器人學會「跟隨示範過程」的基本能力,透過預測同一任務另一條軌跡的未來狀態與動作,建立基礎技能框架。第二階段是人機視頻訓練,在預訓練基礎上使用5,847條人類與機器人配對示範數據進行微調,將模型能力從「機器人跟隨機器人」擴展到「機器人跟隨人類」,實現跨本體遷移。這種分階段設計考量了數據可取得性,機器人執行任務的軌跡數據相對容易採集,人與機器人執行同一任務的配對數據則極度稀缺,先利用機器人影片打好基礎,再向人類影片遷移,就能在有限數據下實現高效的跨本體技能學習。

由於 HOST 在推理時完全不修改模型參數,技能習得比較像是「新增了一份菜譜」,而非「重塑廚師的大腦」。舊技能以模型權重形式存在,新技能以推理時輸入的形式存在,兩者互不干擾;同一台機器人今天學會切菜、明天學會擦桌子,只需更換輸入影片即可,不需要重新配置或訓練。HOST 的論文、程式碼與模型權重已全部開源至 GitHub 和 Hugging Face,項目主頁也提供完整的文件與範例教學。研究團隊表示,開源的目的是想將機器人技能獲取,從依賴專業人員採集數據、反覆訓練的專業流程,轉變為普通人透過一段影片就能完成教學的方式。這項目標直指具身智慧產業最核心的瓶頸:數據獲取成本。

目前具身智慧領域的頭部廠商,多數走「大規模數據採集」路線,動用上百台機器人同時採集數據來訓練通用基礎模型,但這條路線存在兩個天生問題。首先是遙操作數據採集成本過高,一條有效示範的成本可能落在數百到上千元;其次是長尾場景覆蓋不足,多數家庭場景下的任務機器人從未見過,而這些罕見場景恰恰是用戶最需要機器人學會的地方。HOST 提供了另一條路徑,不追求數據規模的無限擴張,而是透過演算法創新降低單次學習的門檻。當機器人可以靠觀看一般人的示範影片學會新技能,「數據」就不再是遙操作工程師的專利,每個普通人都能成為機器人的老師。當然,HOST 並非沒有侷限。

62%的成功率在單樣本學習場景下已是突破性成果,作為對照,人類在只觀看一次示範後執行陌生任務的首次成功率也並非100%;但這也表示在將近四成場景下,機器人仍會失敗,距離「可靠部署」還有明顯差距。目前測試的50項任務以桌面操作類為主,在更複雜的動態場景中表現如何,仍有待後續驗證。不過正如研究團隊在項目主頁所言,HOST 是邁向通用機器人學習的第一步,期望社群能在這個基礎上走得更遠。值得注意的是,HOST 的發布並非孤立事件。

2026年以來,具身智慧領域明顯出現「開源加速」的趨勢,從 Google 的 Open X-Embodiment 到小米的 Xiaomi-Robotics-1,整個行業正從閉門造車轉向共建生態,自變量團隊選擇在項目初始就全面開源,也順應了這股浪潮。從更宏觀的角度看,HOST 的意義在於它為機器人技能獲取提供了一條不同於「規模化」的路徑。在 Scaling Law 仍然主導 AI 敘事的今天,HOST 證明了演算法創新同樣能大幅降低數據依賴,也讓業界看見一個值得深思的方向:與其無止盡地堆疊數據,或許更該思考如何教會機器人更聰明地學習。

Related

相關文章

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?

字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

3 小時前

千人聯機世界模型“RhOS-World: Khora”正式發佈

RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。

3 小時前
Hugging Face Blog模型更新

TutorMoments:AI 家教何時該出手,何時該放手?

今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

4 小時前