一段視頻,讓機器人學會開門並穿越:Video2DoorTraversal 如何打通 Real-to-Sim-to-Real

2026年8月28日 07:24
站內 AI 整理稿

對人來說,推門近乎是一種下意識動作。對移動操作機器人來說,這是一道把感知、移動、操作和控制綁在一起的綜合題。機器人需要找到並靠近把手,完成接觸與旋轉,在門體移動時協調底盤、機械臂和夾爪,還要避開門框、連續穿過狹窄門口。任何一步出現誤差,都可能讓整段任務中斷。近日,由紐媧機器人、上海交通大學和山東大學研究人員共同完成的 Video2DoorTraversal 預印本公開發布。上海交通大學博士生唐心誠為第一作者, 紐媧機器人創始人、上海交通大學特聘教授楊睿剛為論文通訊作者。

論文提出了一套面向輪足移動操作機器人的單視頻 Real-to-Sim-to-Real 框架:用一段普通 RGB 視頻重建真實門的數字孿生 DoorTwin,在仿真中生成並篩選可執行軌跡,再訓練機器人完成從接近、開門到穿越的連續任務。需要說明的是,五扇門的主實驗並非用一段視頻訓練一個策略後直接覆蓋全部對象。研究針對每扇目標門分別採集一段 RGB 視頻,在論文指定的輪足移動操作平臺上每扇各測試 35 次,共完成 175 次測試,其中成功 169 次,平均成功率為 96.57%。在三扇結構相似、訓練階段未見過的門上,策略無需增加目標門訓練或軌跡生成,零樣本平均成功率為 80.95%。

從接近門到完成開門和穿越,平均用時約 13 秒,視覺處理和策略推理均在機器人本地完成。一扇數字門,為什麼要既“像”又“能動”真實建築中的門並不統一。門板尺寸、鉸鏈方向、把手形態、安裝位置和開啟阻力都會變化。現有相關方案可能依賴預構建門資產、額外掃描、人工任務設計或真機適配。Video2DoorTraversal 試圖減少其中一部分前置工作。Video2DoorTraversal 的第一步,是把真實門轉化為可直接進入物理仿真的 DoorTwin。系統從單段 RGB 視頻中恢復帶真實尺度的幾何信息和相機運動,識別門板、把手及鉸鏈關係,生成包含關節、碰撞幾何和外觀紋理的數字資產。

隨後,系統從參考視角檢查輪廓、比例、把手類型、鉸鏈方向和部件位置,並持續修正生成結果。數字門既要在視覺上接近真實對象,也要在物理上能夠被抓住、轉動和推開。只有滿足這兩個條件,機器人在仿真中的練習才可能遷移到真機。把現場試錯,轉移到仿真環境完成 DoorTwin 後,論文中的仿真閉環代理會把任務組織為接近、抓取、轉動把手、推門和穿越等參數化技能,並在模擬器中反覆執行。一條軌跡失敗後,系統會根據碰撞、接觸、把手旋轉和門體開啟狀態分析原因,在鄰近參數中繼續搜索。只有通過任務、碰撞和運動學驗證的成功軌跡,才會被保留為訓練數據。這個過程不依賴針對每扇門進行真人遙操作採集。

為了提高從仿真到現實的適應能力,訓練還隨機改變機器人與門的初始位姿、鉸鏈和把手的摩擦與阻尼、開門阻力和相機外參,並加入多種深度噪聲。這些擾動和邊界情況可以在仿真中反覆驗證,論文只保留在擾動下仍然成功的軌跡作為策略訓練數據。這裡存在兩個不同的輸入階段:開頭的一段 RGB 視頻用於生成 DoorTwin;真機執行時,ArticuACT 使用機器人前視和腕部的雙視角深度圖以及機器人狀態,協同輸出底盤、機械臂和夾爪命令。模型訓練時還會預測接觸、把手轉動和門體開啟進度,以學習任務不同階段的交互特徵。96.57% 與 80.95%,分別說明什麼96.

57% 對應論文設置下五扇真實推門的平均真機結果,表明該框架在論文限定的對象、輪足平臺和測試設置下完成了端到端真機驗證。這一數字不代表通用開門產品或紐媧公司級工程閉環已經得到驗證。80.95% 則對應結構相似未見門上的零樣本測試。策略從一扇重建門的仿真數據中完成訓練,面對相近結構的新門時,無需增加訓練或重新生成軌跡。這一結果給出了跨門遷移的初步證據,也保留著清晰邊界:目前驗證對象仍是結構相似的推門,拉門、更多把手機制和更豐富的門體結構被論文列為後續方向。

對產業部署而言,紐媧機器人這項技術有價值的指標還包括新場景適配週期、現場試錯次數、人工介入成本,以及仿真資產和訓練數據能否在更多設施、場景和本體之間複用。從一項研究,看紐媧的仿真技術路徑紐媧將具行智能定義為機器人在開放人類環境中的持續通行與任務完成,並將其通俗解釋為具身智能與自動駕駛的交集。其世界通行模型 WTM 旨在把空間理解、任務判斷、導航和具身操作組織在同一智能底座中。在紐媧公開的公司級架構中,WorldWeaver 被定位為真實場景數據與三維資產的組織層,SimWeaver 的目標是提供物理仿真能力,支持 WTM 的訓練與評測;相關模塊的具體實現和集成成熟度仍待技術確認。

Video2DoorTraversal 使用 DoorTwin 和論文所述的仿真訓練管線;已經與 WorldWeaver、SimWeaver 或 WTM 形成統一工程閉環。兩者的關聯,已經體現在共同指向一條技術路徑:讓真實場景進入數字環境,讓機器人在仿真中積累經驗,再回到真實任務中接受檢驗。門只是開放人類環境中常見的通行設施。對紐媧而言,這項研究的後續價值,將取決於類似方法能否覆蓋更多設施與任務,並持續降低新場景的適配和驗證成本。

論文:Video2DoorTraversal: Push Door Traversal via Simulated Door Twins arXiv v1 預印本:https://arxiv.org/abs/2608.20251v1 項目頁面:https://video2doortraversal.github.io/

Related

相關文章

專訪商湯首席科學家林達華:多模態的湧現時刻會在一兩年內到來

40分鐘前機器人賽場開始淘汰“偏科生”3小時前閱讀更多內容,狠戳這裡查看AI測評DeepSeek商湯日日新點點選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇CHIC 2026觀察:DADE Capital的產業AI棋局,從依明科技首秀開始浮現依明科技攜服裝產業AI亮相CHIC展重構產業秩序1小時前關於城市合作項目推薦我要入駐投資者關係商務合作關於我們聯繫我們加入我們歐洲站歐洲站歐洲站Ai產品日報網絡謠言信息舉報入口熱門推薦熱門資訊熱門產品文章標籤快訊標籤合作伙伴APP下載iOS & Android本站由 阿里雲 提供計算與安全服務 違法和不良信息、未成年人保護舉報電話:010-89650707 舉報郵箱:jubao@36kr.

剛剛

全球超萬個創業項目廝殺,HICOOL 2026揭榜!北京攢了多大一盤棋?

作者 | 李水青 編輯 | 漠影 8月28日報道,8月26日晚8時,HICOOL 2026全球創業者峰會在中國國際展覽中心(順義館)開幕。 200個獲獎項目集體亮相,AI、機器人、醫藥健康、量子信息、生物技術等前沿領域的硬科技項目登臺;四項重磅發佈接連亮相:全球創業趨勢洞察報告發布,全球創業服務聯盟成立並啟動全球OPC支持計劃,全景數字生命國際大科學計劃發起籌備,機器人自主進化學院預發佈…… 這場屬於全球創業者的“嘉年華”,用一個夜晚集中展示了HICOOL如何把創新創業從源頭推向產業。

2 小時前

大曉聯合香港大學發佈StreamPI,讓 VLA 真正理解時間,邁向連續物理智能

當 VLA 模型理解語言、感知環境並直接生成機器人動作,一個更基礎的問題開始浮現:機器人如何理解一個持續變化的物理世界?物體從哪裡移動而來、杯子此前遮住了什麼、機械臂正在接近還是遠離目標——真正決定下一步動作的信息,往往不只存在於當前一幀,而存在於連續的時間之中。

5 小時前
何夕2077研究與前沿

StreamPI補上時序

機器人模型近年來在視覺語言動作(VLA)領域進展迅速,但單幀模型往往缺乏對時間序列的掌握,難以應付需要連續判斷的真實世界操作。根據業界消息指出,一項名為「StreamPI」的新框架正試圖補上這塊缺口,透過機器人時序框架的設計,讓原本只處理單一畫面的VLA模型也能具備「流式記憶」,也就是在動作決策時能參考過去一段時間的觀察與狀態,而非只看當下瞬間。 這項進展對機器人實務應用格外關鍵。

12 小時前
何夕2077研究與前沿

代碼世界模型亮相

據消息指出,代號「代碼世界模型」的人工智慧模型近日正式對外亮相。這則動態由「」在AI資訊日報中提及,消息本身雖然十分簡短,但「代碼世界」的命名引人聯想,是否代表該模型將專注於程式碼的理解、生成或執行,成為外界討論的起點。 消息中並未進一步說明模型背後的開發單位、技術架構或實際應用場景,僅以「亮相」作為關鍵資訊。

12 小時前