機器人看視頻學操作,伯克利首次打通互聯網視頻到靈巧手真機部署鏈路

2026年7月6日 15:22
機器人看視頻學操作,伯克利首次打通互聯網視頻到靈巧手真機部署鏈路

重點摘要

加州大學柏克萊分校團隊提出「Do as I Do」方法,首次打通從網路單目RGB影片到靈巧手真機部署的完整鏈路。該技術能將人類日常操作影片轉換為22自由度Sharpa Wave靈巧手可執行的動作軌跡,解決機器人從影片學習靈巧操作的關鍵數據轉換瓶頸。

站內 AI 整理稿

人類學習一項靈巧的操作技能,往往從「觀看」開始——小孩看著大人打蛋、倒水、釘釘子,透過反覆觀察與模仿,逐漸掌握手部動作的細微協調。然而,今天的機器人學習流程卻截然不同:它們更多依賴於「動手實作」,例如成本高昂的遙操作、大量仿真環境中的反覆執行,或在精心佈置的場景中採集真實機器人數據。這種模式不僅效率偏低,更限制了機器人從豐富的視覺素材中汲取知識的可能性。事實上,可供機器人「觀看」的數據早已無處不在。從 YouTube 上的日常操作影片、第一人稱視角數據集,到近期蓬勃發展的生成式影片,這些素材中包含了難以計數的人手與物體互動過程。

真正的瓶頸並不在於數據匱乏,而在於能否完成一道關鍵的轉換關卡:如何將充滿雜訊的單目 RGB 影片,轉化為多指靈巧手能夠實際執行的動作軌跡?為了解決這個問題,加州大學柏克萊分校(UC Berkeley)的研究團隊提出了名為「Do as I Do」的端對端流程,並成功跑通第一條從網路影片直接生成真實靈巧手實機執行軌跡的完整鏈路。這項工作被視為補上類人靈巧操作從影片到機器人數據的關鍵拼圖,相關技術細節與專案頁面也已公開。「Do as I Do」的核心流程可分為兩個主要階段。首先,團隊從真實場景中的單目 RGB 影片中重建出四維(4D)的手-物互動過程。

所謂 4D,指的是三維空間加上時間維度,能夠精確捕捉人手在操作物體時的動態形變與相對位置。這一步驟挑戰極大,因為單目影片缺乏深度資訊,且日常影片常帶有遮擋、光影變化與運動模糊,但團隊透過結合視覺與幾何推理的技術,成功克服了這些雜訊,還原出高品質的互動軌跡。緊接著,第二階段是將這些重建出的互動軌跡,重定向到一款擁有 22 個自由度的 Sharpa Wave 靈巧手上。22 個自由度意味著每根手指都具有多個獨立的關節驅動能力,能夠執行人類手部大部分的精細動作,例如捏握、旋轉、按壓等。

重定向的過程並非簡單的映射,而是需要考慮機器人手的運動學限制、手指長度與關節角度範圍,才能確保軌跡在真實硬體上順暢執行。研究團隊強調,這套流程的關鍵突破在於「端到端」的自動化程度。過去雖然有少數研究嘗試將人類操作影片轉為機器人指令,但大多需要額外的深度感測器、多視角攝影機或人工標註,無法直接利用網路上海量的單目影片。Do as I Do 則僅需一段普通的單目 RGB 影片,就能自動產出可部署的靈巧手軌跡,大幅降低了數據蒐集與預處理的成本。從更宏觀的角度來看,這項工作回應了機器人學習領域長期存在的「數據鴻溝」問題。

人類擁有大量直覺式的操作經驗,卻難以直接編碼成機器人可理解的數學模型;而機器人雖然可以透過遙操作或仿真快速產生數據,但這些數據往往缺乏真實世界操作的豐富性與變異性。Do as I Do 提供了一條從人類自然行為出發、無需額外感測設備的數據橋樑,讓機器人能夠從既有的視覺資料庫中「自學」操作技能。值得注意的是,這項研究目前仍處於早期階段。雖然首次驗證了從網路影片到真實靈巧手執行的可行性,但部分較為複雜或需高精度力控制的任務(例如打結、拆解精密零件)可能仍存在偏差。團隊在專案頁面上公開了程式碼與範例,並期待後續研究能夠進一步提升軌跡重建的穩定性,以及重定向到其他類型靈巧手的泛化能力。

業界觀察人士認為,這條鏈路的打通,對於服務機器人、家庭輔助機器人以及工業精密裝配等場景具有潛在影響。未來若能大規模利用現有的 YouTube 教學影片、直播內容,甚至是擴增實境中的手勢數據,機器人將有機會在無需人工示範的情況下,僅透過觀看就能學會開門、倒水、使用工具等日常技能。這場從「看」到「做」的轉變,可能正是類人靈巧操作走向普及的關鍵一步。不過,也有專家提醒,單目影片中的視角變換、遮擋與光照變化仍是嚴峻挑戰,且目前的重定向流程對硬體參數的依賴度較高。如何讓同一套系統適用於不同尺寸與自由度的靈巧手,將是下一階段的重要課題。

整體而言,Berkeley 團隊此次的成果為機器人學習開闢了一條極具想像空間的新路徑,也讓「機器人看影片學操作」從概念邁向真實落地。

Related

相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”

眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

2 小時前

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?

宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

5 小時前

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態

首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

7 小時前

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了

三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。

13 小時前

宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品

AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。

14 小時前6300

IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

16 小時前