NVIDIA 李柏依:機器人只會「看」還不夠,它還得學會「聽」| ECCV 2026

2026年9月30日 14:12
NVIDIA 李柏依:機器人只會「看」還不夠,它還得學會「聽」| ECCV 2026
站內 AI 整理稿

本文作者: 張豈萍 2026-09-30 14:12 導語:給生成模型引入仿真,補上難以獲得的聲音感知。給生成模型引入仿真,補上難以獲得的聲音感知。作者丨張豈萍 編輯丨幸麗娟 機器人要進入真實世界,需要處理的信息遠不止視覺。倒水時,聲音可以幫助判斷杯子是不是快滿了;物體發生碰撞時,不同材質會發出不同的聲音;一個人在小房間和大房間裡說話,空間回聲也不一樣。然而,這些人類習以為常的多模態感知,以及諸如切蘋果、疊杯子這類極其複雜的雙手靈巧操作,在機器人的訓練階段卻面臨著極其高昂的“數據採集壁壘”。當機器人需要的數據很難直接採集,傳統物理仿真又補不全這些信息時,還有沒有別的辦法?

在 ECCV 2026 主題為“Visual Perception and Reasoning in the Interactable World”的Workshop上,NVIDIA Research 科學家、UC Berkeley 研究者李柏依(Boyi Li)通過線上連線分享了她近期在這一方向上的兩項工作。她博士畢業於康奈爾大學,師從 Serge Belongie 與 Kilian Q.Weinberger,之後在 UC Berkeley 與 Jitendra Malik、Trevor Darrell 開展研究,目前研究重點包括具身智能中的高效多模態、泛化建模和交互智能系統。

面對這些難以直接採集的數據,她嘗試了兩條不同的路徑:模擬器裡沒有的聲音,可以“生成”出來;機器人身上昂貴的操作數據,也可以從人類視頻裡獲得。第一條路徑是MultiGen。傳統物理模擬器已經可以模擬相當逼真的倒水過程,卻沒有與畫面同步的聲音。李柏依團隊利用現實世界中的視頻和音頻訓練生成模型,再讓它為仿真視頻補上對應的聲音。她將這個思路概括成一句話:“Don’t just simulate physics – generate perception” (不只模擬物理過程,還要生成感知)。另一條路徑是 DexImit。

與其大量採集昂貴的雙手機器人示範,團隊嘗試利用人類操作視頻,恢復其中手與物體的交互,再將這些交互轉化為機器人能夠學習和執行的雙手操作數據。一個補上仿真世界裡缺失的感知,一個把人類操作轉化為機器人可以學習的示範。背後的思路是一致的:機器人訓練需要的,不只是把物理世界模擬得更真實,還要把那些難以直接獲得的感知和交互信息,變成機器人可以學習的數據。

以下是李柏依的演講分享,AI科技評論根據其演講內容進行了不改原意的編輯:Efficient Multimodal Intelligence for Embodied Agents in Interactive Worlds(交互世界中的具身多模態智能)01機器人為什麼需要“聽見”世界?我們一直在研究多模態系統。現在的多模態已經不只是圖像和語言,還包括 3D 幾何、聲音、嗅覺和觸覺等信息。這些模態可以幫助模型進行泛化和推理,也可以用於機器人、醫療等真實場景。今天我主要分享其中兩個與機器人有關的工作。先從聲音開始。我們先來看一個很有意思的任務。

假設現在有一根水管正在往瓶子裡倒水,你需要判斷什麼時候水會溢出來。如果沒有聲音,只看水管裡的水流,其實很難判斷瓶子裡面發生了什麼。如果把聲音加進來呢?其實在日常生活中,我們一直在利用聲音理解周圍發生的事情。比如烤肉的時候,我們可以通過聲音判斷它的狀態;玻璃碎了、門打開了、可樂被打開了、水燒開了,我們也可以通過聲音知道發生了什麼。聲音還能提供空間信息。在小房間、大房間,甚至更大的空間裡說話,聲音聽起來都會不一樣。它也可以幫助我們判斷物體的材質和狀態。比如洗碗的時候,不同材質的杯子、瓶子和盒子會發出不同的聲音;有時候我們還會搖一搖薯片罐,通過聲音判斷裡面是不是還有東西。那機器人能不能也利用聲音?

我們希望訓練一個機器人策略,讓它同時利用視覺、物理信息和聲音,更準確地執行任務。要做到這一點,我們首先需要多模態數據。但真實世界裡的這類數據很難採集。那 simulation 呢?現在的物理模擬器已經可以生成非常逼真的視覺效果。比如倒水,我們能夠看到整個物理過程,看起來已經很真實了。問題是,沒有與畫面對應的聲音。如果要訓練同時利用視覺、物理信息和聲音的機器人策略,我們就需要包含這些信息的多模態數據,而且不同模態之間還要彼此對應。現有的物理模擬器沒辦法提供這樣的音頻。那這些聲音從哪裡來?02MultiGen:不只模擬物理,還要“生成感知”我們開始重新看已經擁有的數據。

現實世界裡其實有大量同時包含視頻和聲音的數據,比如 YouTube 等來源的視頻。我們把這些視頻收集起來,作為 In-the-Wild Data。我們的目標是訓練一個 Audio Generative Model:給模型一段視頻,讓它生成與視頻內容對應、並且在時間上對齊的聲音。我們選擇 diffusion model 作為基礎模型,在訓練時輸入視頻,讓模型學習生成對應的音頻。訓練完成之後,我們發現這個模型對不同的視頻內容有比較好的泛化能力。給它一段視頻,它能夠生成與畫面對應的聲音。接下來,我們把物理模擬器生成的視頻輸入這個模型,讓它生成對應的聲音。

這樣,模擬器負責生成視覺信息和機器人的物理軌跡,生成模型負責補上音頻,最後得到一套 Simulated Multimodal Dataset 。有了這些數據之後,我們就可以進一步訓練同時利用視覺和聲音的 Multimodal Robot Policy,再把它部署到真實環境中。我們測試了不同的容器和液體。比如把液體倒進不規則的容器,機器人需要自己判斷什麼時候停止;換成可樂之後,聲音和音高都發生了變化,但機器人仍然可以完成倒水任務。我們還測試了環境變化。比如在倒水過程中把燈關掉,讓視覺受到干擾,機器人仍然能夠繼續完成任務。我們也加入了背景噪聲,在比較嘈雜的環境裡,策略仍然能夠識別倒水的聲音。

為了進一步驗證效果,我們比較了兩種策略:一種只使用視覺,另一種同時使用視覺和聲音。先看不透明容器。因為無法直接看到容器內部的液體狀態,只使用視覺時誤差比較大;加入聲音之後,誤差明顯下降。我們也測試了透明容器。即使在這種情況下,視覺本身已經能夠提供更多信息,加入聲音之後,性能仍然有所提升。我們還做了一個更直接的對比實驗。兩組實驗保持完全相同的設置,一組機器人只使用視覺,另一組同時使用視覺和聲音。倒水過程中,我們把燈關掉,等機器人判斷應該停止之後,再把燈打開。只使用視覺的時候,水已經溢出了杯子。機器人在感知上其實非常脆弱。一旦視覺受到干擾,整個系統就很容易失效。

在這種情況下,聲音可以發揮很重要的作用,幫助系統變得更加魯棒。這也是我們最後想表達的:“Don’t just simulate physics – generate perception.”不只模擬物理過程,還要生成感知。03DexImit:機器人數據還能從哪裡來?剛才我們講的是生成音頻信號。接下來,我們來看另一類與真實世界有關的交互信息:人和機器人怎樣與真實世界中的物體發生交互。這項工作的出發點很簡單。我們關注 Bimanual Dexterous Manipulation,也就是雙手靈巧操作。

它對於通用機器人非常重要,很多真實世界任務都需要兩隻手和靈巧操作,比如抓取、倒水、使用工具,以及長時序操作。但真實機器人上的雙手靈巧操作數據,採集起來既昂貴,又耗費人力。與此同時,人類操作視頻幾乎是無限的。它們可以來自日常演示,也可以來自視頻生成模型,而且這些視頻本身就包含了人類操作物體的知識。那我們能不能直接從人類視頻中生成機器人的靈巧操作數據?這就是我們提出 DexImit 的出發點。它的全稱是 Learning Bimanual Dexterous Manipulation from Monocular Human Videos。

我們希望從人類視頻出發,在仿真中生成模仿這些人類操作的機器人雙手數據。04從一段人類視頻,到真實機器人具體怎麼做?整個 pipeline 有四個階段。第一步是恢復人手和物體的運動。我們直接從一段單目人類視頻開始,進行深度估計、手部姿態估計、3D 生成和物體的 6D pose estimation,最後把這些信息統一到 World Coordinate 中,得到手和物體隨時間變化的 4D 交互軌跡。但把軌跡恢復出來還不夠。一段雙手操作視頻裡,兩隻手可能同時在做不同的事情,一個長任務裡也會連續出現多個動作。所以第二步我們會把整個過程拆成不同的子任務,再安排兩隻手分別在什麼時候執行什麼動作。

接下來還有一個問題:人的手和機器人的手並不一樣。人的動作不能直接複製給機器人。我們需要根據前面恢復出來的交互,生成機器人真正能夠執行的抓取姿態。這裡我們會考慮 force closure 等物理約束,再通過 motion planning 生成平滑、無碰撞的機械臂軌跡,最終得到完整的仿真機器人示範。得到這些數據之後,我們還會進行 Augmentation。比如改變物體的位置和尺度、相機視角以及 observation,讓訓練出來的策略能夠更好地泛化到真實世界。數據質量同樣很重要。我們還會利用視覺語言模型理解原始的人類操作視頻,再檢查生成出來的數據是否與原始操作一致。

那這些生成出來的數據到底能不能用?我們主要想回答幾個問題:生成的數據本身是不是有效?和已有方法相比,能不能得到更好的雙手靈巧操作數據?面對更復雜、更長的任務還能不能工作?最後,能不能實現 zero-shot real-world deployment?我們測試了不同來源和不同難度的人類視頻。可以看到,人工採集的數據質量更好;隨著任務變得越來越複雜,生成數據的準確性和可用性也會下降。我們還和已有方法進行了比較。對於真實世界裡更加複雜的任務,比如製作飲料、烹飪、切蘋果和疊杯子,僅僅把視頻中的動作恢復出來是不夠的。

尤其是 long-horizon、fine-grained、contact-rich tasks,我們需要比較準確的 reconstruction,同時還要保證生成出來的動作交互在物理上是合理的。比如切蘋果,機器人不僅需要準確判斷蘋果的位置,還要控制切下去的力量,同時保證抓取足夠穩定。最後,我們進一步測試了 zero-shot real-world deployment。為了讓策略更好地泛化到真實環境,我們會對物體位置和尺度、相機視角以及 observation 做 augmentation。我們也做了 ablation study,分別改變其中一些設置。

結果可以看到,完整方法的表現最好,這些 augmentation 對真實世界部署非常重要。我們把 DexImit 生成的數據部署到了真實機器人上。當然,DexImit 目前還有一些限制。首先是柔性物體和關節物體。現在的 3D 生成階段主要依賴 SAM 3D,它假設的是剛性物體幾何,目前還不能很好地處理柔性物體或者帶有關節結構的物體。未來可能需要更先進的 geometry reconstruction 或 generative modeling 來解決這個問題。第二是移動操作。現在的方法主要面向桌面上的雙手操作。如果機器人需要一邊移動、一邊操作物體,還需要進一步建模機器人本體的運動和環境動態。

第三是長視頻。整個 pipeline 由多個模塊連續執行,誤差可能會隨著時間不斷累積。視頻越長,這個問題越明顯。有些情況下還是需要人工介入,比如調整基於 VLM 的子任務分解,或者修正重建過程中出現的問題。最後是手內操作,比如在手裡旋轉一個橙子。這類任務中,手和物體之間會產生非常嚴重的遮擋,單目視頻能夠提供的信息有限,目前 DexImit 也沒有專門針對這種情況設計機制。我們的代碼已經開源,大家感興趣的話也可以進一步嘗試。05Q&A 現場問答▎Q1(現場觀眾):有沒有哪些特定的噪聲或聲音,會對機器人策略產生負面影響?或者有些聲音對人類有用,但機器人卻無法利用?

李柏依: 這是一個很好的問題,我們也一直在思考。比較有意思的是,我們在訓練時其實沒有做任何噪聲增強(noise augmentation),但模型在有背景噪聲的情況下依然比較魯棒。我們猜測,可能是因為音頻本身是一維信號,不同聲音之間比較容易區分。比如模型訓練過倒水的聲音之後,即使環境中同時出現其他聲音,也可以把不同的聲音區分開。當然,這只是我們目前的推測。▎Q2(現場觀眾):有沒有一些任務,即使加入聲音,對機器人也沒有什麼幫助?李柏依: 這個我們還沒有測試。但很容易想到聲音在哪些任務裡發揮作用。比如當視覺信息受到干擾的時候,聲音就很重要。

對於其他任務,比如拿起一個杯子或者拿起手機,聲音可能就沒有那麼重要。通常我們並不需要依靠聲音去抓取手機或者杯子。為了方便大家抱團交流、互通會議消息,我們專門建了 ECCV 2026 參會交流群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。

現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

(公眾號:) 原創文章,未經授權禁止轉載。詳情見轉載須知。0人收藏 分享: 相關文章 具身智能 ECCV2026 多模態 音頻生成 NVIDIA 李柏依 生成模型 具身智能不只在地上跑:給無人機裝上機械臂,它們要 ...具身智能的無本體數據,終於有了自己的「代表作」 國啟新篇 興創未來 國興智能新品亮相,多項技術引領 ...從「多少小時」到「多大增益」:具身智能數據競賽換 ...

張豈萍 編輯 發私信 當月熱門文章 NVIDIA 李柏依:機器人只會「看」還不夠,它還得學會「聽」| ECCV 2026 計算機視覺的下一個十年:從「看懂世界」到「教會人類」| ECCV 2026 從三維視覺到世界模型:空間智能為何成為 AI 走向物理世界的共同主線?| ECCV 2026覆盤 具身智能不只在地上跑:給無人機裝上機械臂,它們要去天上「擰螺栓」了 | IROS 2026 最新文章 具身智能不只在地上跑:給無人機裝上機械臂,它們要去天上「擰螺栓」了 | IROS 2026 從三維視覺到世界模型:空間智能為何成為 AI 走向物理世界的共同主線?

| ECCV 2026覆盤 計算機視覺的下一個十年:從「看懂世界」到「教會人類」| ECCV 2026 ECCV 2026 開幕:李飛飛團隊獲時間檢驗獎,7000人擠爆馬爾默 Yann LeCun 萬字演講:「預測像素」是偽命題,JEPA 也並非憑空而來 | ECCV 2026 樂享以太大模型,讓中國具身智能坐上定義席 熱門搜索 創客 iPhone 6 喬布斯 自然語言處理 字節跳動 海康威視 知乎 創業公司 聊天機器人 錘子手機 快手

Related

相關文章

豆包AI再升級:一站式搞定出行全流程,劍指生活服務入口

AI資訊AI新聞資訊正文豆包AI再升級:一站式搞定出行全流程,劍指生活服務入口發佈於AI新聞資訊發佈時間 :2026年9月30號 14:33閱讀 :1分鐘9月30日消息,字節跳動旗下AI助手豆包近日迎來功能升級,正式接入機票、火車票預訂、打車叫車及地圖導航等出行服務,試圖從“對話助手”向“生活服務入口”轉型。據瞭解,用戶現在可直接通過豆包完成機票和火車票的查詢、比價、下單及退改簽全流程操作,無需跳轉至第三方平臺。打車功能支持車型選擇與一鍵呼叫。同時,豆包接入了導航能力,可提供公交、自駕等多種出行方式的路線規劃。此外,平臺還上線了旅遊攻略專屬入口,整合“吃住行遊”推薦服務。此次升級意味著豆包正從單純的AI對話工具,向覆蓋用戶出行決策與執行閉環的平臺級應用邁進。在AI助手賽道競爭日趨激烈的背景下,誰能率先打通“動嘴就能辦事”的體驗,誰就可能搶佔下一波用戶心智。相關推薦安卓端Google Assistant正式謝幕,Gemini接管手機語音入口,手錶汽車卻還留著舊管家谷歌對老牌語音助手Google Assistant的退休已不可逆。9月29日外媒報道,谷歌自上月起群發郵件,預告手機端Assistant即將停用;如今大批安卓用戶反饋已無法調用。部分用戶還發現,Gemini賬戶菜單中切換至Google Assistant的入口消失。從選項到服務,舊助手正被逐步抹去。2026年9月29號 17:59172.4k字節豆包要出獨立個人助理App了,內部已秘密內測數月字節跳動正加速將AI產品豆包推向獨立個人助理方向。知情人士稱,豆包今年4月起已秘密內測個人助理應用“Spell”,近期因海外同類產品走熱,字節加快項目推進。公司計劃合併“Spell”團隊與豆包對話團隊,集中資源打造獨立個人助理App,使豆包不再僅內嵌於其他產品。2026年9月29號 14:14221.9kAI團隊重組頻上熱搜:豆

剛剛

微軟研究院發佈生物學“世界模型”Quine,藥物篩選驗證週期壓縮至數天

AI資訊AI新聞資訊正文微軟研究院發佈生物學“世界模型”Quine,藥物篩選驗證週期壓縮至數天發佈於AI新聞資訊發佈時間 :2026年9月30號 14:36閱讀 :1分鐘微軟研究院近日正式發佈面向生命科學領域的AI科研系統Quine,將其定位為“生物學世界模型”,旨在通過跨尺度生物推理加速複雜機制解析與藥物研發。系統由生物學世界模型與交互式研究平臺兩大核心部分構成。底層模型基於基因組、蛋白質、化學分子、RNA、細胞狀態及生物影像等多源異質數據聯合訓練,構建起統一的生命知識表徵;上層平臺則深度聯動科研文獻、實驗工具、推理引擎與實驗場景,形成人機協作的科研閉環,在實際投入昂貴實驗前對幹預措施及潛在候選路徑進行優先級排序。在與哈佛大學及麻省理工學院博德研究所關於胰腺導管腺癌的合作中,研究團隊利用Quine分析篩選數千種候選化合物,從靶向幹預篩選到溼實驗驗證僅耗時一個週末,不僅驗證了細胞狀態轉變假設,還精準預測出一種未被關注的全新細胞狀態。目前,微軟已同步啟動Quine Fellows研究員計劃,並計劃未來逐步接入Microsoft Discovery平臺。微軟明確強調該系統目前定位於實驗性科研輔助,不直接用於臨床醫療決策。這一成果標誌著生成式AI正從單點數據擬合,跨越至具備系統級推理能力的科研基礎設施階段。相關推薦AI“超級科學家”Kosmos 12小時跑完半年科研,準確率79.4%非營利機構FutureHouse推出AI科研系統Kosmos,12小時可完成1500篇論文閱讀、生成4.2萬行代碼及引用報告,效率相當於人類團隊6個月,準確率79.4%。該系統採用結構化世界模型,並行處理檢索、分析與驗證,已成功復現7項前沿發現。2025年11月18號 15:40225.8kAI“超級科學家”Kosmos問世:12小時完成人類半年科研量FutureHouse推出AI科研系統Kosmos

剛剛
雷峰網生成式AI

從三維視覺到世界模型:空間智能為何成為 AI 走向物理世界的共同主線?| ECCV 2026覆盤

從三維視覺到世界模型:空間智能為何成為 AI 走向物理世界的共同主線?| ECCV 2026覆盤 本文作者: 張豈萍 2026-09-30 14:24 導語:AI 正從看懂畫面,走向理解空間、預測變化、執行動作。 AI 正從看懂畫面,走向理解空間、預測變化、執行動作。 作者丨張豈萍 編輯丨幸麗娟 AI 已經越來越會生成一個“看起來真實”的世界,卻依然很難真正理解並行動於這個世界。物體在哪裡、彼此是什麼空間關係,遮擋之後還剩下什麼;一個動作發生後,世界會怎樣變化。這些問題的解法,共同指向空間智能。而近兩年具身智能與世界模型的爆火,進一步推動空間智能成為 AI 走向物理世界的核心能力基座。回看 ECCV 2026,這趨勢尤其明顯。大會程序主席 Anna Rohrbach 公佈的數據顯示,本屆 ECCV 共收到 10473 篇投稿,最終接收 2834 篇。按研究主題劃分,圖像與視頻合成以超過 1400 篇位居第一,視覺、語言與推理第二,3D 則從此前的主導方向退居第三。但 3D 主題排名的後退,不等於3D 退潮。相反,過去主要集中在 3D 視覺和圖形學中的三維表示、幾何與物理一致性、動態建模、可交互生成與空間推理等基礎問題,正在向視頻生成、機器人、具身智能、世界模型等方向擴散,成為 AI 走向物理世界時共同面對的問題集。從大會 Workshop 也能看到這種變化。93 場 Workshop 中,約 10 場與 3D 直接相關,11 場涉及空間智能,9 場指向物理AI,還有 5 場以世界模型為主題。尤其是在世界模型和物理 AI 相關 Workshop 中,不少演講都在圍繞三維空間理解、動態場景建模、預測以及進一步的執行能力展開探討。香港科技大學教授譚平圍繞可擴展的 3D 場景重建與生成展開,從場景表示切入三維空間理解;斯坦福大學助理教授吳佳俊從二維視覺進一步走向隨時間變化的三維點雲

剛剛
量子位生成式AI

DeepSeek知乎獨家發文,首次公開V4.1 Agent訓練“大本營”DSec

DeepSeek在知乎獨家發佈技術長文,首次系統闡釋了DeepSeek彈性計算(DeepSeek Elastic Compute,DSec) 近日,DeepSeek在知乎獨家發佈技術長文,首次系統闡釋了支撐DeepSeek-V4全部訓練、評測與數據預處理流程的沙盒基礎設施——DeepSeek彈性計算(DeepSeek Elastic Compute,DSec)。

剛剛
IT之家生成式AI

“美國散戶大本營”Robinhood 推出 AI 智能體工具,可自動替用戶盯盤交易

作者:遠洋 責編:遠洋 評論: 9 月 30 日消息,“美國散戶大本營”線上券商 Robinhood 當地時間週二於休斯敦喬治 ·R· 布朗會議中心舉辦年度活動,高管團隊集中揭曉了一系列重磅新工具與服務。其中最引人注目的是一款應用內人工智能助手 ——Robinhood Agents,它不僅能解答行情疑問、從零搭建定製化投資策略,並最終能在你入睡、工作或遠離屏幕時,自動替你盯盤並執行交易。

剛剛