ACE補齊具身數據
重點摘要
具身智能(Embodied AI)正面臨嚴重的數據瓶頸。模型必須同時理解第一人稱視角、全身動作、精細操作、物體狀態、聲音與觸覺,這些訊號還必須隨著人類在現實環境中執行目標而同步演化。然而,現有數據集往往只在單一視角、單一模態或單一空間尺度下紀錄,導致完整的感知-動作迴路僅能被部分觀測。為了解決這個問題,來自南洋理工大學、商湯科技等機構的研究團隊推出了「ACE(Ambient Capture Engine)」,一個以人為中心的環境數據引擎,能將真實家居空間轉變為空間校準、時間同步的錄製工作室。
具身智能(Embodied AI)正面臨嚴重的數據瓶頸。模型必須同時理解第一人稱視角、全身動作、精細操作、物體狀態、聲音與觸覺,這些訊號還必須隨著人類在現實環境中執行目標而同步演化。然而,現有數據集往往只在單一視角、單一模態或單一空間尺度下紀錄,導致完整的感知-動作迴路僅能被部分觀測。為了解決這個問題,來自南洋理工大學、商湯科技等機構的研究團隊推出了「ACE(Ambient Capture Engine)」,一個以人為中心的環境數據引擎,能將真實家居空間轉變為空間校準、時間同步的錄製工作室。 ACE 系統以兩種互補的尺度運作。在桌面尺度(table-scale)配置下,系統專注於記錄手部與物體的精細互動,能夠解析握持、旋轉、按壓等細微操作;而在房間尺度(room-scale)配置下,系統則能捕捉全身動作、移動軌跡以及人在裝潢完整的家居環境中與各類物品的互動過程。兩種尺度共享同一套時空坐標系統,使得數據可以無縫對齊與融合。 在數據收集方面,ACE 同時記錄多種模態訊號,包括第一人稱(egocentric)與多視角第三視角(exocentric)影片、全身與關節手部動作、物體幾何與六自由度軌跡,以及音訊與觸覺訊號。這些訊號被統一整合成多感官串流,確保每一幀畫面都對應到精確的運動學與接觸資訊。研究團隊利用 ACE 系統建構了 ACE-Data-0 數據集,總時長達 150 小時,包含 1700 萬幀影片,涵蓋 200 個任務類別,由 50 位參與者在 2 個不同環境中執行,總共產出 75,000 個互動片段。 ACE-Data-0 的任務涵蓋三個層級:原子級操作(如拿起杯子、轉動開關)、長鏈家務活動(如煮飯、整理房間),以及人-場景互動(如坐在沙發上、打開抽屜)。為了保留人類自然行為的多樣性,研究團隊採用「目標層級」而非「步驟層級」的指令,讓參與者自行決定如何達成目標,而非遵循固定的步驟順序。這使得數據集內的行為變異更貼近真實世界。 為了評估現有模型在這種豐富數據上的表現,團隊進一步設計了層次化基準(hierarchical benchmark),從低層訊號(如觸覺、深度)、中層場景元件(如物體姿態、手部關節),到高層互動(如動作序列、任務成功與否)進行分層測試。他們對當前最先進的模型進行評估,結果揭示了在接觸、遮擋、自我運動以及長時域任務下,現有方法仍存在顯著不足。 具體而言,模型在處理手與物體接觸時的細微力回饋、物件被遮擋時的追蹤、第一人稱視角因頭部移動造成的畫面劇烈變化,以及持續數分鐘的長鏈任務時,表現大幅下滑。這顯示 ACE-Data-0 所提供的同步人類示範——包含對齊的感知、運動學與接觸監督——對於訓練更強大的模仿學習、世界模型、視覺-語言-動作系統以及具身智能模型,具有重要的基礎價值。 ACE 系統的設計出發點,是將真實家居環境改造為可重複使用的數據生產設施,而非傳統的實驗室或模擬器。這使得數據收集能在更自然的場景中進行,同時保持嚴格的同步與校準。團隊強調,ACE-Data-0 僅是 ACE 系列的第一個公開數據集,未來將持續擴展環境數量、參與者多樣性與任務複雜度,為具身智能領域提供可擴展的數據基礎。 該研究成果已發表於 arXiv(論文編號 2607.28625),並開放專案頁面與數據集下載。隨著具身智能從模擬環境走向真實世界,ACE 這類能夠補齊「感知-動作」完整迴路的高品質數據引擎,將成為推動機器人學習與通用人工智慧進展的關鍵基礎設施。
Related
相關文章
極速語音初創公司融資到位
極速語音初創公司融資到位。 該創業公司宣佈近期獲得千萬級融資。融資消息在查看語音模型融資原文頁中披露。其開發的語音大模型主打近零延遲。AI客服的溝通體驗將非常 ☎️ 逼真自然。這項技術很快就會衝擊傳統的呼叫中心。
通用人臉替換工具熱度不減
通用人臉替換工具熱度不減。 該項目在開源人臉替換工具項目頁獲得56.9k。該技術為個人用戶降低了深偽製作門檻。它能將換臉流程封裝為傻瓜式套件。龐大的活躍用戶社區仍在源源不斷貢獻。這一經典項目 ⚙️ 保持著非常高的活躍度。
橫掃五大手遊電競賽事,穩坐電競“神U”後,驍龍下一站:用AI顛覆遊戲世界
這篇消息聚焦「橫掃五大手遊電競賽事,穩坐電競“神U”後,驍龍下一站:用AI顛覆遊戲世界」。目前站內已移除先前混入的模型思考或安全判斷文字,並保留來源可確認的主題供讀者追蹤。
千問已在特斯拉車機內測
千問大模型已進入特斯拉中國車機深度測試階段,上車在即,未來可能提供超越語音助手的多元功能。豆包大模型助手則已接入部分特斯拉新車。阿里雲與特斯拉中國對此消息尚未正式回應。
AI寫作改變思考習慣
AI寫作改變思考習慣。 作者稱重用工具已十八月。如今起筆時���大腦會找提示框。他在寫作者原帖討論稱內心預熱變安靜。客戶仍滿意���產出也更快。問題在於閒置檔是否丟失。

字節阿里都沒防住:騰訊WorkBuddy四個月“偷”下AI辦公智能體第一
字節阿里都沒防住:騰訊WorkBuddy四個月“偷”下AI辦公智能體第一象先志2026.07.29 18:00 · 來自安徽全文1749字00:00 / 04:59WorkBuddy登頂之後,真正的底牌還沒出。文 | 象先志易觀6月榜單顯示,騰訊WorkBuddy以2097萬次月訪問量登頂國內AI辦公智能體,超過第二、三名之和。這個踩著OpenClaw風口上線的產品,四個月就成了騰訊AI最硬的一張牌。