李飛飛、Yilun Du罕見聯手:別給機器人建大腦了,直接偷視頻模型的|GAIR Paper 115

2026年8月6日 10:42

重點摘要

史丹佛大學李飛飛與麻省理工學院Yilun Du聯手發表研究,主張直接借用現有影片生成模型作為機器人的知識庫,讓機器人從大量視覺資料中學習行動策略,而非從頭打造專屬控制系統。這項方法跳脫傳統感知、規劃、控制的層層架構,大幅降低訓練成本並提升機器人的泛化能力,為機器人學習開闢全新路徑。

站內 AI 整理稿

史丹佛大學電腦科學教授李飛飛與麻省理工學院學者Yilun Du近日罕見聯手,發表一篇引發機器人學與人工智慧社群高度關注的研究論文。兩人提出的核心觀點相當直接:與其費盡心力為機器人打造專屬的「大腦」與決策系統,不如直接「借用」現有的影片生成模型,讓機器人從大量視覺資料中學習如何與真實世界互動。這項研究被收錄於GAIR Paper系列第115期,論文一出,立刻在學界與產業界掀起廣泛討論。這項研究的出發點,在於近年影片生成模型已累積了海量、涵蓋各種場景與動作的視覺資料。

李飛飛與Yilun Du認為,這些模型內部其實已經隱含了對物理世界運作方式的理解,包括物體如何移動、人類如何操作工具、空間如何變化等。與其從零開始訓練機器人的控制模型,不如把這些影片模型當作「現成的知識庫」,直接從中提取行動策略,讓機器人學會規劃動作。這種做法跳脫了傳統「先建構感知、再規劃、最後控制」的層層架構,試圖以更輕量、更有效率的方式,賦予機器人靈活的行動能力。過去數十年來,機器人學的研究路徑大多遵循一條明確的技術路線:先讓機器人透過感測器理解周遭環境,接著在內部建立世界模型,再依據任務目標進行動作規劃,最後才輸出控制指令驅動機械本體。這套架構雖然邏輯清晰,卻也帶來嚴重的效率瓶頸。

每一個環節都需要大量工程調校,而且一旦環境條件超出訓練數據的涵蓋範圍,系統的表現往往急遽下降。李飛飛與Yilun Du的論文,正是針對這個根本性的限制提出替代方案。他們的核心洞察在於,近年來影片生成模型在訓練過程中,已經不知不覺地吸收了人類社會中幾乎所有可見的動作模式。無論是廚房裡切菜的細微手勢、工廠中組裝零件的工序、還是街頭上行人穿越馬路的行為,這些都被編碼在模型的參數之中。對機器人而言,這些影片模型等同於一座取之不盡的「動作知識庫」。若能有效解碼並轉譯這些知識,機器人不必親身經歷每一種情境,也能夠理解環境的動態變化,並做出合理的行動決策。

這項研究的意義,在於它可能改變機器人學習的資料來源與訓練邏輯。過去機器人學習往往需要大量真實世界的互動數據,成本高且耗時;而影片模型所涵蓋的資料範圍遠超過機器人實驗室所能收集的規模。若能成功「借用」這些影片模型,機器人就有機會更快地理解多樣化的環境,並在未曾實際經歷過的場景中做出合理判斷。這也讓機器人從「專用任務執行者」走向「通用行動者」的可能性,又向前推進了一步。從技術層面來看,這篇論文的核心貢獻在於提出一套系統性的方法,將影片生成模型的內部表徵轉化為機器人可用的行動策略。

研究團隊設計了特定的轉換機制,讓機器人不需要重新訓練一套完整的控制模型,而是透過查詢影片模型內部對應的視覺特徵,直接產生動作序列。這種方式大幅降低了訓練成本,同時也讓機器人具備更強的泛化能力,因為影片模型所涵蓋的場景多樣性,遠非實驗室所能比擬。這項研究也反映了近年來人工智慧領域一個重要的趨勢:大型預訓練模型不再只是單純的「內容生成器」,而是逐漸被視為「世界模型」的載體。影片生成模型在學習如何生成逼真畫面的過程中,其實已經被迫理解物體如何在空間中移動、如何與其他物體互動、以及時間如何推進。這些理解雖然沒有以明確的規則形式存在,但卻隱含在模型的參數之中。

李飛飛與Yilun Du的論文,正是嘗試將這份隱性知識「提取」出來,轉化為機器人可用的行動指令。當然,這項研究也並非沒有挑戰。影片生成模型所學習到的知識,是否足以應對真實世界中的物理接觸、力回饋與不確定性,仍是需要進一步驗證的問題。此外,如何確保機器人從影片模型中所提取的行動策略具備安全性與可靠性,也是未來實際落地時必須面對的關卡。不過,研究團隊的嘗試,無疑為機器人學習開闢了一條新的路徑,也讓外界重新思考「機器人大腦」的定義與建構方式。李飛飛與Yilun Du的聯手,本身就具有指標性意義。

李飛飛是電腦視覺領域的權威學者,長期推動以視覺資料驅動的人工智慧發展;Yilun Du則在生成模型與多模態學習方面有深厚的研究基礎。兩人的合作,象徵著電腦視覺、生成模型與機器人控制三個領域的界線正在逐漸模糊,未來的研究將更傾向於跨領域的整合,而非各自獨立發展。這篇論文所提出的理念,也與近年來人工智慧領域「大模型即基礎設施」的思維不謀而合。過去,每個機器人系統都需要從頭開發專屬的感知與控制模組;如今,大型影片模型可能成為所有機器人共享的「基礎知識庫」。這種模式一旦成熟,機器人開發的門檻將大幅降低,更多團隊可以專注於特定應用場景的開發,而不必重複投入基礎能力的建構。

當然,從論文發表到實際應用,中間仍有相當長的距離。機器人系統的穩定性、安全性、即時性要求,都是影片生成模型目前尚未完全解決的問題。但這項研究的價值,在於它提供了一個全新的思考框架:機器人不必擁有自己的「大腦」,而是可以學會善用外部已有的「智慧」。這種「借用」而非「重建」的思維,可能將成為下一代機器人學習的重要方向。隨著影片生成模型持續進化,其所蘊含的世界知識也將愈來愈豐富。李飛飛與Yilun Du的論文,等於為機器人學界指出了一條通往通用行動能力的捷徑。未來,機器人或許不再需要經歷漫長的真實世界訓練,就能透過觀看海量影片,學會如何在複雜多變的環境中自主行動。這項研究的深遠影響,值得持續觀察。

Related

相關文章

100微米與10微米之間,眼科手術機器人的“極限運動”

眼科手術機器人旨在協助醫生在100微米至10微米的極細微尺度上進行精準操作,克服人類手部顫抖與反應延遲的生理極限。目前主要發展遠端操控與共操控兩條技術路線,在視網膜下注射、白內障手術等領域展現優勢,但面臨體積大、成本高、學習曲線陡峭等挑戰。隨著人工智慧導入,機器人正從被動輔助邁向主動決策支援,有望成為未來常規眼科手術的關鍵工具。

剛剛

A股人形機器人第一股來了,宇樹IPO倒計時,誰將成最大贏家?

宇樹科技正式啟動科創板IPO初步詢價,預計8月10日開放申購,計劃募資42.02億元,發行估值約420億元,將成為A股首檔純正人形機器人概念股。這家成立於2016年的公司,從四足機器人跨足人形機器人領域,此次上市不僅為早期投資者帶來可觀回報,也象徵人形機器人賽道在資本市場獲得正式認可。市場關注其上市後能否維持技術優勢並實現商業化量產,股價表現將為整個行業提供重要參考。

2 小時前

王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態

首頁 > 智能時代>具身智能 王興興:宇樹科技將積極探索人形機器人、機甲等更多產品形態 2026/8/7 14:56:22 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 8 月 7 日消息,據澎湃新聞消息,宇樹科技董事長、總經理兼首席技術官王興興今天在網上路演時表示,本次登陸資本市場,是宇樹科技全新的起點。

4 小時前

衝刺全球首個100萬小時具身數據!三家國產公司,聯手了

三家國產機器人公司宣布聯手,目標累積全球首個一百萬小時的具身數據,以強化機器人從感知到執行的全鏈路訓練基礎。此次合作整合本體製造、感測器與數據平台等優勢,試圖打通數據獲取到模型訓練的完整閉環,並建立共享數據標準與交換機制。若目標達成,不僅將刷新全球具身數據規模紀錄,也可能為中國在AI競爭中搶下機器人學習基礎設施的定義權。

10 小時前

宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品

AI資訊AI新閒資訊正文宇樹科技王興興:將持續攻堅具身智能技術,探索人形機器人等新產品發布於AI新閒資訊時間 :Aug 7, 2026閱讀 :1分鐘8月7日,宇樹科技創始人兼CEO王興興在網上路演中表示,公司登陸資本市場是新的起點,未來將持續深耕通用具身智能機器人核心技術研發與產業應用,推動智能機器人更早進入社會服務場景。

11 小時前6300

IJCAI 2026 專訪:機器人想學會人類動作,還差一座橋 | GAIR Paper 118

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:IJCAI + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

13 小時前