雷峰網生成式AI

200個任務、1700萬幀!大曉ACE-Data-0把真實家庭場景變成物理智能「數據引擎」

2026年7月31日 04:08

重點摘要

近日,基於全球首創的具身模型信息密度定律與以人為中心的環境式數據採集方案2.0,並依託環境式採集引擎ACE,大曉機器人聯合南洋理工大學 S-Lab 重磅開源 L5 級多模態具身物理智能數據集 ACE-Data-0。

站內 AI 整理稿

近日,大曉機器人聯合南洋理工大學 S-Lab 正式開源名為 ACE-Data-0 的多模態具身物理智能數據集。這套數據集以全球首創的具身模型信息密度定律,以及以人為中心的環境式數據採集方案 2.0 為基礎,結合環境式採集引擎 ACE 打造,定位為 L5 級多模態具身物理智能數據資產。官方表示,ACE-Data-0 希望透過對真實物理交互、長程任務過程與多模態因果信號的高保真採集與高精度標註,為全球具身模型提供一個能支撐泛化、反思與進化的數據底座,讓通用物理智能從實驗驗證階段,進一步走向規模化產業落地。 這套數據集的規模與內容相當具體。ACE-Data-0 共包含 150 小時數據、1700 萬幀視頻、200 個任務類別、50 名參與者、2 個真實家庭場景,以及 7.5 萬個交互片段。任務類型橫跨原子級人—物交互、長時序家庭場景活動鏈,以及人與場景的多元互動。在數據同步方面,系統同時收錄第一人稱視頻、多視角第三人稱視頻、全身與手部運動、物體六自由度軌跡、多通道音頻與觸覺信號,並將所有模態對齊至相同的時間線與空間座標系,完整保留人類感知、行動、接觸與環境變化的連續過程。大曉機器人也基於此數據集建構了一套由底層信號、場景組成要素到具身交互理解的三級評測基準,用於檢驗模型在接觸感知、人體與物體狀態恢復、手—物交互理解等關鍵環節的真實能力。 報導指出,當前視覺語言模型、VLA 與世界模型雖然快速演進,機器人進入真實世界後仍缺乏一套適當的數據來源,用以學習人類行動能力。諸如打開櫥櫃、倒水、疊衣服等日常行為,往往同時涉及視覺、全身運動、手部操作、物體狀態、聲音、觸覺與任務規劃。普通視頻僅能記錄事件發生,卻難以呈現接觸何時發生、力度如何變化、物體如何運動,以及當前動作與前後任務的關係。另一方面,現有第一人稱視頻多半缺少精確的人體、手部與物體狀態;動作捕捉數據則多來自理想化實驗室,較少包含自然遮擋、第一人稱視角、音頻或觸覺。大量數據也停留在持續數秒的抓取、放置等單步動作,難以反映真實家庭場景的長期依賴。因此,ACE-Data-0 的設計不再將活動切割為孤立短片,而是連續記錄感知、行動、接觸及狀態變化,強調完整感知、長時序任務與多模態同步。 精細手部操作與房間尺度活動,對採集系統提出了不同要求。指尖接觸、抓握變化與物體細微運動,需要近距離密集傳感器;人在廚房、客廳與臥室之間移動,則需要大範圍覆蓋、全局視角與統一的空間座標。為兼顧兩類需求,大曉機器人將環境式採集引擎 ACE 設計為桌面尺度與房間尺度兩套互補配置。桌面尺度系統面向精細化手—物交互,在操作區域周圍佈置多視角攝像機、光學動作捕捉與觸覺設備,重點記錄抓取、傾倒、擦拭、切割、摺疊等任務中的手部姿態、物體軌跡與接觸變化。房間尺度系統則覆蓋廚房、餐廳、客廳、臥室等完整家居空間,透過廣基線攝像機與全空間動作捕捉,持續記錄參與者全身運動、跨區域移動,以及發生在不同位置的連續交互。兩套配置共享統一的數據採集、同步、標定、質檢與標註流程,桌面尺度回答手與物體如何精細交互,房間尺度回答人如何在完整環境中移動、規劃並完成任務。 採集過程中,參與者佩戴第一人稱設備,系統同步記錄四路魚眼視頻、IMU、頭戴設備位姿、全身運動與手部關節狀態;多視角外部攝像機則補充第一人稱視角中容易遺漏的身體與環境資訊。每個活動時刻都透過多個視角同步觀察,並與可度量的人體、手部與物體狀態對應,讓自然行為與高精度物理監督得以同時保留。此外,ACE-Data-0 還記錄物體運動、全手掌觸覺壓力與多通道音頻。視覺描述外部變化,運動數據還原人體與物體軌跡,音頻記錄碰撞及設備狀態,觸覺提供接觸、壓力與滑動資訊,不同模態共同構成對同一次真實交互的完整觀察。 多模態數據的真正難點,並不在設備數量,而在不同設備產生的數據能否準確對應。攝像機、動作捕捉系統、觸覺手套與音頻設備通常擁有獨立時鐘與不同採樣頻率,即使只有幾毫秒偏差,也可能導致畫面中的手尚未接觸杯子,觸覺信號卻已產生的情況;若不同攝像機、人體與物體沒有統一空間基準,也難以準確建立幾何關係。ACE-Data-0 透過時間同步與空間標定,將視頻幀、人體動作、物體狀態、觸覺讀數與音頻統一到同一條時間線,並將外部攝像機、持續運動的第一人稱設備、人體、雙手與物體配準至共享世界座標系,使每次採集成為對同一物理過程的統一記錄。研究者可以直接找到某個視頻幀對應的人體姿態、物體位置、接觸壓力與聲音變化,也可比較第一人稱與第三人稱視角下的同一事件。ACE-Data-0 亦提供相機參數、同步時間線、人體及手部狀態、物體網格與六自由度位姿、邊界框、運動軌跡、手—物接觸資訊,以及與物理時間線對齊的自然語言描述;大量標註直接來自經標定的採集系統,而非完全依賴模型事後估計,使數據在遮擋、快速運動與長期任務中具備更穩定的一致性。 ACE-Data-0 的任務設計也與傳統標準化採集有明顯區別。任務共分三類:第一類是原子級人—物交互,單次約 3 分鐘,涵蓋倒水、清洗、擦拭、切割、摺疊與整理等單項操作;第二類是由多個原子動作組成的長時序家庭場景活動鏈,可持續 20 至 30 分鐘,例如從打開冰箱、取出食材,到清洗、切配、烹飪、裝盤與收拾;第三類是人—場景交互,約 5 分鐘,包括移動、坐下、鍛鍊、開關傢俱、取放物品及姿態轉換。與嚴格規定每一步動作的腳本式採集不同,ACE-Data-0 採用目標級指令,參與者只被告知最終任務,不被要求遵循固定流程,因此可以自由選擇物品、操作順序與移動路徑,也可能在過程中猶豫、改變計劃、返回上一步或處理意外情況。官方認為,這些差異在標準化採集中可能被視為噪聲,但對進入真實家庭場景的機器人而言,卻是必須理解的現實。長時序任務的困難也不只是影片更長;此前的決定會改變後續可執行的動作,物體可能離開並重新進入視野,子任務可能中斷、重排或在其他位置繼續,模型必須持續記住任務目標、物體狀態與已完成步驟,而不能將活動視為一串彼此獨立的動作。 基於 ACE-Data-0,大曉機器人建立了由底向上的三級具身感知評估基準。第一級為底層信號推斷,研究模型能否從視覺觀測中預測接觸與觸覺資訊;第二級為場景組成要素恢復,評估模型在遮擋、複雜姿態與持續運動下恢復人體與手部運動狀態的能力;第三級為具身交互理解,要求模型從第一人稱與第三人稱視頻中恢復接近、抓取、調整與釋放等完整手—物交互過程。研究團隊評測了 30 多種代表性方法,結果顯示現有模型在接觸、嚴重遮擋、第一人稱自運動、極端視角與長時間任務中仍存有明顯能力缺口。這套基準並非只判斷任務最終是否成功,而是試圖拆解模型究竟在哪一步失效;一次失敗可能源於沒有感知到接觸,也可能來自物體狀態估計錯誤、任務上下文丟失、動作順序理解偏差,或手部運動恢復不準確。分層評測將這些問題逐一拆解,有助於研究者判斷模型已理解什麼,以及在哪一層發生能力斷裂。 ACE-Data-0 的應用價值也不僅止於評測。由於第一人稱視頻、多視角第三人稱視頻、人體與物體軌跡、音頻、觸覺與語言標註皆處於統一時空框架,這套數據集可進一步服務於模仿學習、機器人策略學習、世界模型、VLA,以及人類示範向不同機器人本體的遷移。在大曉機器人的規劃中,具身數據建設不能只追求小時數與軌跡數,更需要保留真實世界中的物理聯繫、任務結構、接觸反饋與狀態演化。ACE-Data-0 名稱中的「0」,代表這套具身數據體系的起點。未來,大曉機器人將繼續圍繞具身數據引擎、通用具身基礎模型、世界模型與 VLA 推進研發,並與研究機構、開發者及產業夥伴共同探索從人類自然行為到機器人通用能力的可拓展路徑。從「看見動作」到「理解行動」,從孤立視頻到連續物理過程,ACE-Data-0 正試圖為具身智能建立一條更接近真實世界的數據入口,讓每一次真實生活中的感知、接觸與行動,都成為機器人理解物理世界的訓練信號。

Related

相關文章

DeepSeek-V4-Flash正式版上線,130億激活參數撬動Agent戰場

DeepSeek-V4-Flash正式版API上線,以130億激活參數在多項Agent基準測試中接近三個月前的V4-Pro預覽版,並推出自研Agent框架DeepSeek Harness。該模型支援OpenAI的Responses API,旨在以高性價比輕量模型搶攻Agent應用市場,顯示公司正加速商業化進程。

8 分鐘前

Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統

AI資訊AI新閒資訊正文Claude“闖出”測試環境?Anthropic承認AI模型曾入侵三家機構系統發布於AI新閒資訊時間 :Jul 31, 2026閱讀 :1分鐘Anthropic發佈最新安全報告披露,在內部安全測試過程中,旗下Claude系列模型曾因測試環境配置問題意外訪問互聯網,並未經授權進入三家不同機構的生產系統。事件涉及Claude Opus4.

38 分鐘前4400

字節跳動 Seedance 2.5 發佈:30 秒一鏡到底,AI 視頻開始會講故事了

字節跳動正式推出 Seedance 2.5 影片生成模型,單次生成時長從 15 秒翻倍至 30 秒,並能多輪延長且維持人物、場景與風格一致。該模型強化長敘事與多模態參考能力,支援單次輸入最多 30 張圖片、10 段影片與 10 段音頻,可同時還原多人形象與聲音。Seedance 2.5 將陸續上線即夢 AI 與豆包專業版,API 也將接入火山方舟,鎖定影視、廣告、教育等多元場景。

1 小時前6200

阿里千問發佈Qwen-Audio-3.0-ASR-Flash,語音識別攻克專業場景"最後一公里"

阿里通義千問發布語音識別大模型Qwen-Audio-3.0-ASR-Flash,主打長音頻上下文記憶與內建多行業詞庫,醫療、IT等專業術語無需配置即可精準識別。該模型支援30餘種語言,並整合語音潤色功能,已在阿里雲百鍊平台開放調用。同步推出的Streaming版本鎖定即時場景,延遲僅300毫秒,系列先前於評測拿下全球第一。

1 小時前3600