鈦媒體模型更新

29 秒視頻教會機器人新技能,清華北理工聯合開源 HOST

2026年8月5日 11:37
29 秒視頻教會機器人新技能,清華北理工聯合開源 HOST

重點摘要

清華大學與北京理工大學等單位聯合開源HOST框架,讓機器人僅觀看平均29秒的人類示範影片即可學會新技能,無需微調模型參數或重新採集數據,在50項未見過的桌面操作任務中成功率達62%。相較於傳統微調方案,HOST所需數據量減為1/50、學習時間縮短至1/507,且不會遺忘舊技能,為降低具身智能機器人的教學門檻提供了新路徑。

站內 AI 整理稿

教導機器人學會一項新技能,究竟需要多少步驟?波士頓動力的機器人能在複雜地形中流暢跑酷,Figure 01 的機器人可以在工廠裡搬運箱子,這些畫面看似聰明,但每個動作的背後,往往代表工程師團隊耗費數月的數據採集與模型訓練。過去,標準流程是專業工程師操作昂貴的遙控設備,錄製數百條示範數據,再花費大量時間調整模型參數,最後還得祈禱機器人學會新技巧時,不會把舊能力忘得一乾二淨。這套繁重的流程,如今迎來了全新的解方。 8月3日,自變量機器人與北京理工大學、清華大學聯合發布並開源了一套名為 HOST 的框架,全稱是 Human-to-robot One-Shot Skill AcquisiTion,意即「人類到機器人單樣本技能獲取」。這套系統讓機器人只需觀看一段平均長度約29秒的人類示範影片,就能在完全不更新模型參數、不採集新數據的條件下,執行從未見過的全新任務。在涵蓋放水果、堆碗、擦盤子、插筆等50項桌面操作任務的測試中,這些任務都是機器人在訓練階段從未接觸過的,HOST 的技能復現成功率達到62%。 根據發表於 arXiv 的論文(編號2607.20033),與當前主流的 Pi-0.5 搭配微調方案相比,HOST 所需的數據量大幅減少至原本的五十分之一,學習時間縮短至五百分之一,而成功率則明顯領先。更關鍵的是,HOST 在習得新技能的過程中完全不改變模型權重,這意味著它不會出現「學了新技能就忘了舊技能」的災難性遺忘問題。論文數據顯示,在傳統微調方案學習新技能後,最強的基線模型(Wall-OSS+SFT)在舊任務上的表現下降至原本的43%,而 HOST 幾乎完整保留了所有已掌握的技能。 機器人學習人類技能時,長期以來最大的挑戰在於如何跨越「身體鴻溝」。人類擁有雙臂、五指關節與靈活的軀幹,機器人卻可能是單臂、夾爪或輪式底盤,兩者在運動學與動力學模型上完全不同,直接讓機器人模仿人類手臂的軌跡與角度幾乎不可能成功。過去十年,業界的主流做法是「以大量數據暴力擬合」,透過遙操作設備採集數以萬計的機器人執行軌跡,再訓練端到端模型。自變量機器人團隊在論文中坦言,這條路雖然走得通,但成本極高,每一次教機器人新技能,都需要專業工程師重新採集數據、重新微調模型,花費動輒數萬元,而且每個新技能的學習都是從零開始,舊技能累積的經驗幾乎無法沿用。 HOST 的突破性思維在於,它把問題的出發點從「動作模仿」轉向「結果推理」。機器人不再試圖模仿人類的肢體動作,而是觀察人類完成任務後的結果狀態,再反推自己需要執行哪些動作序列。這個轉變直接繞開了「人機身體結構差異」這個難以克服的障礙,將學習目標從「重現過程」重新定義為「達成結果」。這樣的概念汲取自認知科學中的「觀察學習」理論,人類在面對陌生任務時,並非總是不斷試錯,而是基於已有的經驗,先在腦中模擬動作的預期效果,再據此執行。HOST 將這套理論工程化,實現了從「訓練時微調」到「推理時即時獲取」的範式轉變。 HOST 的核心創新在於「結果先行」的推理流程,與傳統「看到人類動作、映射為機器人動作」的直線思維不同,它的處理過程分為三個步驟。第一步是任務階段判斷,機器人觀看人類影片時,先判斷目前任務進行到哪個階段;以烹飪為例,系統需要分辨現在是切菜階段還是炒菜階段,這是基於視覺內容的任務進度語意理解,而非簡單的時間戳對齊。第二步是視角遷移,將人類執行完動作後的畫面,轉換為機器人自身視角與身體結構下會看到的畫面,人類用五指完成的任務,機器人要用夾爪完成,兩者的視覺畫面與運動邏輯都需要完整轉換。第三步是動作反推,從目標畫面反向推導需要執行的動作序列並付諸執行,機器人不是在「複製」人類動作,而是在「求解」一個問題:要達成這個結果狀態,我應該怎麼做。 這種「先想像結果,再反推動作」的機制,賦予 HOST 傳統方法無法比擬的泛化能力,即使執行過程中物品位置被移動,機器人也能根據目標狀態重新規劃動作,繼續完成任務。影片學習還有一個常被忽略的難題:人類與機器人的執行速度並不同步。同樣經過10秒,影片中的人類可能已經切完菜開始炒菜,機器人卻還在切菜階段,若按簡單的時間軸對齊,機器人會遺失任務進度資訊,導致後續動作全部錯位。HOST 的解法是「按任務進度對齊」策略,將影片每一幀與機器人操作的每一步都映射到同一個向量空間,再透過動態時間規整(Dynamic Time Warping)演算法,自動建立人類影片幀與機器人操作步驟之間的對應關係。 根據論文披露,這個方法把對齊誤差降低了一個數量級,從基於時鐘時間對齊的0.079降至0.006(平均絕對進度差),讓機器人的執行與影片示範能夠精準同步。這代表即使人類以快轉或慢速示範,機器人也能正確理解每個階段該達成的任務目標。這項技術的工程價值在於,它大幅降低了對人類示範影片的「規範性」要求,普通人不必刻意放慢動作或標準化流程,隨手拍攝的影片就能當作教學素材。 HOST 的技術底座是一個具備視覺預測功能的級聯策略模型,採用雙專家混合架構,將技能學習拆分為兩個階段。第一階段是同體預訓練,模型先在193,462條機器人同體軌跡數據上預訓練,覆蓋229項任務,目標是讓機器人學會「跟隨示範過程」的基本能力,透過預測同一任務另一條軌跡的未來狀態與動作,建立基礎技能框架。第二階段是人機視頻訓練,在預訓練基礎上使用5,847條人類與機器人配對示範數據進行微調,將模型能力從「機器人跟隨機器人」擴展到「機器人跟隨人類」,實現跨本體遷移。這種分階段設計考量了數據可取得性,機器人執行任務的軌跡數據相對容易採集,人與機器人執行同一任務的配對數據則極度稀缺,先利用機器人影片打好基礎,再向人類影片遷移,就能在有限數據下實現高效的跨本體技能學習。 由於 HOST 在推理時完全不修改模型參數,技能習得比較像是「新增了一份菜譜」,而非「重塑廚師的大腦」。舊技能以模型權重形式存在,新技能以推理時輸入的形式存在,兩者互不干擾;同一台機器人今天學會切菜、明天學會擦桌子,只需更換輸入影片即可,不需要重新配置或訓練。HOST 的論文、程式碼與模型權重已全部開源至 GitHub 和 Hugging Face,項目主頁也提供完整的文件與範例教學。 研究團隊表示,開源的目的是想將機器人技能獲取,從依賴專業人員採集數據、反覆訓練的專業流程,轉變為普通人透過一段影片就能完成教學的方式。這項目標直指具身智慧產業最核心的瓶頸:數據獲取成本。目前具身智慧領域的頭部廠商,多數走「大規模數據採集」路線,動用上百台機器人同時採集數據來訓練通用基礎模型,但這條路線存在兩個天生問題。首先是遙操作數據採集成本過高,一條有效示範的成本可能落在數百到上千元;其次是長尾場景覆蓋不足,多數家庭場景下的任務機器人從未見過,而這些罕見場景恰恰是用戶最需要機器人學會的地方。HOST 提供了另一條路徑,不追求數據規模的無限擴張,而是透過演算法創新降低單次學習的門檻。當機器人可以靠觀看一般人的示範影片學會新技能,「數據」就不再是遙操作工程師的專利,每個普通人都能成為機器人的老師。 當然,HOST 並非沒有侷限。62%的成功率在單樣本學習場景下已是突破性成果,作為對照,人類在只觀看一次示範後執行陌生任務的首次成功率也並非100%;但這也表示在將近四成場景下,機器人仍會失敗,距離「可靠部署」還有明顯差距。目前測試的50項任務以桌面操作類為主,在更複雜的動態場景中表現如何,仍有待後續驗證。不過正如研究團隊在項目主頁所言,HOST 是邁向通用機器人學習的第一步,期望社群能在這個基礎上走得更遠。 值得注意的是,HOST 的發布並非孤立事件。2026年以來,具身智慧領域明顯出現「開源加速」的趨勢,從 Google 的 Open X-Embodiment 到小米的 Xiaomi-Robotics-1,整個行業正從閉門造車轉向共建生態,自變量團隊選擇在項目初始就全面開源,也順應了這股浪潮。從更宏觀的角度看,HOST 的意義在於它為機器人技能獲取提供了一條不同於「規模化」的路徑。在 Scaling Law 仍然主導 AI 敘事的今天,HOST 證明了演算法創新同樣能大幅降低數據依賴,也讓業界看見一個值得深思的方向:與其無止盡地堆疊數據,或許更該思考如何教會機器人更聰明地學習。

Related

相關文章

AI終於能自己花錢了,曾讓半個互聯網崩潰的公司,給Agent做了個支付寶

賬號設置我的關注我的收藏申請的項目退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機構庫投資機構職位推介投資人認證投資人服務項目推薦36氪Pro創投氪堂企業入駐創業者服務創投平臺AI測評網 首頁快訊資訊推薦財經AI項目推薦廣東最新創投汽車科技專精特新直播視頻專題活動搜索項目推薦我要入駐城市合作AI終於能自己花錢了,曾讓半個互聯網崩潰的公司,給Agent做了個支付寶愛範兒·2026年08月05日 12:07未來最尊貴的互聯網用戶,可能不是人 儘管當下 Agent(智能體)發展如火如荼,但這些號稱智商碾壓人類的 AI 智能體,本質上仍是互聯網裡的支付「黑戶」。 它們缺少穩定身份,也沒有原生支付能力。面對登錄頁、驗證碼和信用卡表單,AI 往往只能基於安全因素,中斷任務,把註冊、付款和密鑰生成重新交還人類。 要讓 Agent 真正進入商業閉環,就必須跨過身份與支付這道門檻。 官方博客地址:https://blog.cloudflare.com/wallets/?utm\_campaign=cf\_blog&utm\_content=20260804&utm\_medium=organic\_social&utm\_source=twitter 而就在這一點上,我發現,被稱為「互聯網頭號保安」的 Cloudflare 今天正式發佈了面向 AI 智能體的可編程錢包 Cloudflare Wallets。 用戶目前已經可以為自己的 Cloudflare 賬戶搶注一個 Wallet Handle,獲得唯一的可讀用戶名。

剛剛

7月海外短劇&AI劇百強榜:網頁端B25Drama主投劇登頂榜首

DataEye發布2026年7月海外短劇與AI劇百強榜,網頁平台B25Drama以葡萄牙語劇《De Repente CASADOS》登頂短劇榜首,DramaShorts兩部特殊情感題材劇居次。AI劇方面,DramaWave以《被流放的公主成了最強狼後》蟬聯榜首,其平台在百強榜佔51席,整體投放素材量月增41%,顯示海外AI短劇賽道正經歷投放提速與供給分化。TikTok熱播榜則由新劇《Heartbreak High》以2.14億次播放增量居冠,整體呈現快輪動、短週期競爭態勢。

剛剛
IT之家模型更新

越疆新一代具身全棲人形機器人亮相:情緒感知與空間行動雙突破

**越疆新一代具身全棲人形機器人正式亮相:情緒感知與空間行動雙重突破,重塑人機共生新範式** 2026年8月5日,國內具身智能領域的領軍企業越疆機器人官方正式對外公布了旗下新一代具身全棲人形機器人。此次發布不僅標誌著人形機器人在核心技術維度上的又一次跨越式迭代,更以「情緒感知」與「空間行動」的雙重突破為核心亮點,向外界展示了機器人從單純工具向具備情感交互能力的「生活夥伴」轉型的無限潛能。

剛剛
鈦媒體模型更新

大廠搶灘AI辦公

中國科技大廠在短短一個多月內密集推出AI辦公產品,如字節的豆包專業版、騰訊的WorkBuddy、阿里的千問辦公等,顯示AI辦公已成為必答題。各廠商路線分為獨立AI Agent和嵌入既有協同軟件兩種,分別瞄準不同場景與用戶。雖然市場增長迅速,但AI Agent的穩定性與價值落地仍有距離,定價模式也正從傳統的席位費轉向任務型收費。

剛剛

辦公 Agent 爆火,模型大戰進入下一階段

中國三大互聯網巨頭阿里、騰訊、字節跳動在短短兩個月內同步整合其辦公Agent產品,顯示AI行業已從模型競爭進入入口與生態爭奪階段。阿里將旗下三款Agent產品合併為「千問辦公」,整合桌面、雲端及企業協作能力,並結合釘釘與阿里雲基礎設施,企圖搶佔企業級AI辦公的統一入口。

剛剛