10000小時人類數據,練出全球首個全身移動操作隱式世界動作模型

2026年7月15日 09:49
10000小時人類數據,練出全球首個全身移動操作隱式世界動作模型

重點摘要

智在無界發表全球首個面向人形機器人全身移動操作的隱式世界動作模型Being-M0.7,該模型利用超過10000小時人類混合模態數據進行預訓練,透過隱空間預測與MoT架構,成功實現魚缸撈魚、鏡像取物等多項高難度全身移動操作任務。

站內 AI 整理稿

人形機器人賽道的競爭焦點,過去兩年正從整機硬體進一步延伸到模型能力。整機廠商密集發布新品,翻跟頭、跳舞、跑馬拉松的影片輪番刷屏。但在喧囂背後,行業逐漸形成一個共識:決定人形機器人能力上限的,不只是關節與電機。能否理解環境、預測變化,並協調全身完成任務,正成為其走向通用的關鍵。世界模型、VLA 與人形機器人基礎模型,因此成為近兩年最重要的技術方向之一。然而,三道難題始終擺在行業面前。首先,人形機器人的真機演示數據採集成本極高,採集時須同步記錄第一人稱影片、本體感知數據與可執行的全身指令,受遙操作難度、安全風險與環境多樣性限制,難以在短時間內形成大規模、高品質的數據積累。

其次,現有許多世界動作模型沿用像素級影片預測路線,計算開銷龐大,且大量容量消耗在與控制關聯微弱的畫面細節上;人形機器人快速的自身運動與視角抖動,更會進一步放大視覺預測噪聲。最後,許多方案仍將上肢操作與移動控制分開建模,上下半身協調性不足,難以支撐流暢的全身控制。在這樣的背景下,具身智慧公司智在無界發布了 Being-M0.7。這是全球首個面向人形機器人全身移動操作的隱式世界動作模型,也是業內首次將隱式世界模型能力從桌面靈巧操作擴展到全身移動操作。該模型使用超過一萬小時以人為中心的混合模態數據進行預訓練,再透過少量真機演示數據完成本體適配,並在真實人形機器人上完成了多項高難度的全身移動操作任務。

智在無界是全球最早押注大規模人類影片訓練路線的具身智慧企業之一,同步布局通用靈巧操作與通用移動靈巧操作兩條模型主線,也是國內首個推出原生具身隱式世界動作模型的團隊。其路線的核心判斷在於,機器人真機演示數據昂貴且稀缺,難以像網際網路文本和影片那樣持續擴大規模。相比之下,人類每天都在用第一人稱視角與物理世界互動,這些海量的人類行為數據蘊含關於場景演化、物體動力學與身體協調的豐富先驗。智在無界認為,與其等待機器人數據慢慢積累,不如先讓模型從人類經驗中學習世界的運作方式,再將這些知識遷移到具體的機器人本體上。今年四月發布的 Being-H0.7,已驗證這套判斷在靈巧操作側的可行性。

該模型將訓練數據規模擴展到二十萬小時人類影片,在六項國際評測中取得綜合排名全球第一,並成為首個覆蓋跨本體、跨場景、連續動態、流體、柔性物體、物理規律與上下文推理等七大關鍵維度的通用具身世界模型。Being-M0.7 則是這條隱式世界動作模型路線的最新成果。如果說 Being-H 系列回答的是手如何操作世界,Being-M0.7 回答的則是整個身體如何在世界中協調地移動與作業。人形機器人的移動靈巧操作要求模型同時決定去哪裡、身體如何朝向、手腳如何配合、姿態如何保持穩定,這是在時間與身體維度上都高度耦合的問題,也是通用人形機器人繞不開的能力關口。Being-M0.

7 採用 Mixture of Transformers(MoT)結構,先在第一人稱影片和人體運動數據上進行預訓練,隨後透過動作專家後訓練,在多樣化全身操作任務的機器人軌跡數據上完成控制落地。與許多依賴像素級影片生成的世界模型不同,Being-M0.7 在隱空間中預測未來環境狀態,並將其與緊湊的全身運動表徵耦合在一起。隱空間預測能把建模能力集中在語義狀態、物體布局與場景演化這些真正與控制相關的結構上,既保留世界模型預判未來的本質,又大幅降低計算開銷。智在無界圍繞 Being-M0.7 公布了四組真機展示,涵蓋液體互動、鏡像推理、長程任務與遮擋避障等極具挑戰性的場景。

在魚缸撈魚任務中,機器人走到水箱前,使用手持網具撈取水中的玩具魚。液體沒有固定形狀,水下目標的視覺位置會因折射偏移,機器人必須理解水、漁網與魚之間的互動關係。五次測試中,Being-M0.7 成功三次,同場比較的其他模型各為兩次與一次成功。在鏡像取物任務中,盒子只在背面和側面開口,機器人必須根據鏡中反射推斷隱藏物體的真實位置,再接近盒子並伸手抓取。面對零點五公尺與一公尺兩種距離,Being-M0.7 總共成功四次,其他模型則均僅成功一次。此外,移動置物取物與搬箱避障任務,分別考驗機器人在長程工作串聯中的狀態保持能力,以及負載狀態下即時調整全身姿態與避障的能力。

支撐這些能力的關鍵,在於 Being-M0.7 在數據與架構層面的設計。智在無界選擇的 Vision-Motion MoT 架構,為視覺和運動保留各自的模態專屬投影與處理模塊,同時透過共享的多模態注意力進行跨模態互動。這使模型能夠同時兼容三類數據:影片與運動配對數據、純影片數據與純運動數據。即使數據模態不完整,也能被納入同一個訓練框架。基於此架構,團隊構建了超過一萬小時的混合模態預訓練數據,涵蓋人類第一人稱影片、第一人稱影片與運動的配對數據,以及純人體運動序列,來源包括多個外部公開數據集與內部數據集。另一個關鍵設計,是人類與人形機器人共享的統一運動表徵。Being-M0.

7 將來自不同來源的人體運動數據轉換為以頭部為根節點的統一表示,並採用僅保留頭部、雙手和雙腳的緊湊運動表示,在保留關鍵互動和接觸資訊的同時,有效彌合人類與機器人之間的形態差異。在預訓練階段,模型透過視覺編碼器將圖像映射至隱空間,並使用流匹配目標進行訓練,根據短時間的視覺-運動歷史和任務指令,聯合預測未來狀態變化與運動軌跡。在真機數據採集環節,團隊搭建了一套基於 VR 裝置的全身遙操作系統,操作員佩戴頭顯與追蹤器,由系統即時估計人體姿態,再轉換為宇樹 G1 可執行的二十九自由度全身控制指令。

由於模型已在預訓練階段建立視覺與運動先驗,真機數據主要承擔將預訓練先驗落地到具體控制空間,以及學習低層控制命令與反饋機制的任務。這項過程由輕量級動作專家完成,動作專家讀取隱式世界動作模型的中間隱藏狀態,將其作為高層規劃上下文,再結合當前視覺觀測與本體感知資訊,生成機器人可直接執行的動作塊。這套 Vision-Motion MoT 架構的意義,不僅在於解決 Being-M0.7 一款模型的訓練問題,更確立了一套可持續擴展的多模態融合範式。它把訓練可用的監督信號來源,從昂貴稀缺的機器人真機演示,擴展到海量的人類行為數據,為任何規模化法則的成立提供了前提。同時,Being-M0.

7 調整了模型學習的順序:在被適配為機器人可執行指令之前,模型先從大規模人類中心數據中學習視覺上下文、未來動態和人形運動學結構;動作專家再將這些預測與運動先驗轉化為具體控制命令。這與直接從機器人示教中學習動作映射的傳統模仿學習方案形成重要差異。更進一步,這套架構不要求所有新增數據都具備完整的視覺與運動配對,單獨的人類影片與運動序列都可以被納入同一個模型。放到整個行業的座標系中,Being-M0.7 的發布或許代表著人形機器人競爭邏輯的一次變化。過去幾年,注意力更多集中在誰的本體更靈活、誰的運動演示更驚豔。

隨著硬體性能持續提升,模型能否理解場景、預測變化並生成協調的全身動作,以及背後是否存在可持續擴大的數據體系,將越來越成為拉開差距的關鍵。從 Being-H 到 Being-M,智在無界的判斷是讓機器人先從人類行為中學習世界,再把這些知識轉化為真實物理空間中的行動。當理解成為行動的前提,通用人形機器人才真正走出了實驗室敘事,開始通向更多樣的真實場景。

Related

相關文章

一年砸下110億美元,比紅杉還兇,白宮才是AI圈最猛投資人

美國白宮過去一年在AI領域投入110億美元,規模超越紅杉資本等傳統創投,顯示政府正以國家級資源全面押注AI產業。這筆資金分散於多個聯邦機構,涵蓋基礎模型訓練、醫療及氣候應用等關鍵環節,並強調負責任AI開發。此舉反映美國對維持全球AI領導地位的危機感,但也引發市場機制扭曲與技術商業化延緩的疑慮。

31 分鐘前

一口氣發佈三款教育插件,OpenAI教育產品再升級

OpenAI 推出三款教育插件,分別為課程助手、作業輔導員與互動學習夥伴,旨在協助教師備課與學生自主學習。這些工具整合至教育版平台,強調引導式學習而非直接給答案,並內建防護機制避免學生過度依賴。OpenAI 計畫未來加強多語言支援與特殊教育需求,持續深化教育科技布局。

58 分鐘前

騰訊、字節、阿里,搶著給打工人配「AI助理」

騰訊、字節跳動與阿里巴巴三大中國科技巨頭,近期紛紛推出或升級企業級AI助理,目標是提升白領工作效率。各家AI助理的競爭重點從回答問題轉向執行任務,並分別強調跨應用串聯、主動式智慧與企業級安全等不同特色。儘管面臨資料隱私與AI幻覺等挑戰,但市場調查顯示超過六成中國企業計劃在一年內導入AI辦公工具。

1 小時前

推行AI提效後,策劃們開始加班趕工期

當AI開始重寫小遊戲生產流程,真正的變化何時發生?這個問題在近期引發了業界廣泛討論。隨著人工智慧技術逐步滲透進創意與策劃領域,許多公司開始導入AI工具來提升工作效率,然而實際情況卻與預期有所出入。部分策劃人員反映,在推行AI提效後,他們不僅沒有減少工作量,反而因為系統調整與流程磨合,導致加班趕工期的現象頻繁出現。 這場變革的起點,源自於企業對AI生產力的高度期待。許多遊戲開發與內容製作公司,尤其是中小型團隊,紛紛導入AI輔助工具,試圖透過自動化生成文案、腳本、美術素材甚至程式碼,來縮短專案週期。

2 小時前

DeepSeek大漲價,Token價格戰終於要結束了?

DeepSeek大幅調漲API服務價格,引發市場對AI模型價格戰是否結束的討論。業界分析指出,漲價反映營運成本壓力與市場定位調整,可能代表中國AI產業從低價競爭轉向追求盈利與可持續發展。未來競爭焦點將從價格轉向模型效果與生態系統完整性,但漲價能否終結價格戰仍取決於市場供需與競爭對手反應。

2 小時前

狂攬130億!英偉達投的AI基建獨角獸又融資了

澳洲AI基礎設施獨角獸Firmus宣布完成20億美元(約136億人民幣)戰略股權融資,現有投資方英偉達與Coatue持續參投,並新增黑石旗下基金及Jane Street。該公司專注於設計、建設及營運AI工廠,核心產品HyperCube整合供電、液冷與伺服器機架,並提供GPU雲端算力服務。英偉達透過股權投資與技術合作,協助Firmus擴張亞太地區AI數據中心,同時擴大其晶片與計算架構的市場覆蓋。

2 小時前