星動紀元陳建宇:VLA 非終局,具身大腦已進入世界模型時代 | WRC 2026

2026年8月21日 03:14
站內 AI 整理稿

當機器人開始理解世界,通用智能才進入物理空間。作者丨吳思夢 陳嘉欣 編輯丨岑 峰 過去幾年,機器人解決的問題是“如何更精準地執行動作”。在工業生產線上,機器人可以完成焊接、搬運、裝配等大量重複任務,但這些能力建立在一個前提之上:環境、流程和目標都已經被提前定義。機器人並不需要真正理解世界,只需要按照預設路徑完成任務。但當機器人開始走出工廠,進入物流、服務甚至家庭場景,問題正在發生變化。面對一個沒有見過的物體、一個沒有訓練過的任務,機器人能不能理解環境、預測變化,並找到完成任務的方法?這成為通用機器人走向下一階段必須回答的問題。大模型的發展為機器人提供了新的可能。

語言模型證明,人工智能可以通過大規模數據學習複雜規律,並獲得跨任務泛化能力。但機器人面對的並不是語言世界,而是真實的物理世界。因此,具身智能領域正在探索一個更底層的問題:大模型究竟應該如何賦能機器人?目前行業的主流方向是 VLA。它讓機器人通過學習大量人類行為數據,將視覺、語言和動作統一起來。但 VLA 的核心仍然是模仿——模型學習人類過去如何行動。問題在於,如果機器人面對一個從未見過的新任務,僅依靠已有動作經驗,是否能夠真正泛化?另一條更激進的路線,是讓機器人擁有世界模型。它不只是學習“應該做什麼動作”,而是嘗試理解物理世界運行的規律,並預測未來可能發生什麼。

在 WRC 2026 大會上,星動紀元創始人、CEO 陳建宇提出了自己的判斷:世界模型可能不僅是 VLA 的增強模塊,而可能成為下一代具身智能的核心範式。他更強調機器人作為物理智能體的特殊性。模型的進化並不只依賴數據規模,還需要通過本體進入真實世界,在真實交互中獲得反饋。大腦、本體和場景並不是三個獨立環節,而是在持續循環中共同演化。以下為陳建宇演講內容精編,·AI 科技評論在不改變原意的基礎上進行編輯和整理。01 通用機器人的兩個特徵,與協同進化的飛輪終端之後的下一代智能終端產品,很可能是以某種家用機器人的形式存在的。這裡最關鍵的一點,是能不能打造出更加通用的機器人。

我認為,這樣的機器人必須具備兩個特徵。第一個特徵是上限更高:擁有更高的自由度、更高的智能,能夠做到許多以前的機器人做不到的事情,從而把整個市場打開。第二個特徵是更加通用、泛化性更強:當我們去做一件新的事情時,不再像以前的專用機器那樣需要重新開發硬件和軟件,絕大部分能力都可以直接複用與泛化。要打造這樣一個通用機器,避不開兩件事:同時做它的“大腦”和它的“本體”。圍繞這個目標,我們這幾年已經實現了通用機器人軟硬一體、全棧自研的多項突破。在大腦側,自研了支撐端到端的大模型運動控制;在本體側,自研了雙足本體關節與靈巧手,並把它們很好地整合到了一起。

做這件事最重要的,是把大腦、本體和場景協同起來,形成一個協同進化的飛輪。飛輪的最上層,是我們的端側具身大腦大模型,包括我們做的 VLA、世界模型與數據等,它是一個通用模型,能適配多種不同的本體、用到不同的場景中。中間層是本體:具身大腦最終要產生價值,必須放在某個本體之上,才能與物理世界交互、真正去幹活。最終,我們把大腦與本體一起應用到各類場景裡,只要大腦足夠通用、本體足夠通用,它們就能比較通用地進入各個場景。而在場景應用的過程中,我們會不斷獲得大量數據反饋,這些反饋又反過來反哺模型的發展。就這樣,我們把技術和商業化很好地協同起來,形成協同進化的飛輪。下面,我具體講講我們的思路和做法。

02大腦:從端到端 VLA 到世界動作模型先從具身大腦層面講起。我把到目前為止的具身大模型迭代,歸納為三個範式。第一範式:語言模型 + 機器人控制。這一切都始於 ChatGPT 大模型的出現。最初我們探索的是把語言大模型用在機器人裡,但整體框架仍是傳統的模塊化機器人思路:用語言模型增強上層的推理,下層仍然是傳統的感知、控制、執行模塊。這一階段,我們做出了全球首個大語言模型結合人形機器人的學術工作——以語言模型作為上層規劃,下層感知控制執行仍由傳統方法完成。但我們很快意識到這種分層方法的侷限:感知、規劃、控制、執行都被模塊化,模塊間的特徵和接口靠人工定義,無法端到端訓練。

語言模型和視覺模型都經歷過從“模塊化、人工定義特徵”到“端到端、靠數據 scaling”並最終成功的轉變,我們相信,具身智能也應遵循類似的範式。第二範式:多模態底座上的 VLA 模型。大約在 2023 年,以 GPT-4 為代表的多模態語言模型出現,把視覺等信息融了進來。對應到具身模型,就產生了 VLA:在多模態模型的底座之上,把機器人非常重要的動作和與環境交互的功能,也融合進同一個統一模型。今天典型的 VLA 模型,比如 Google 的 PaLM 系列、RT 系列等,已經形成統一範式:以多模態語言模型為底座,再加上一個動作頭,端到端訓練。

這一範式,我們其實是歷史上最早公開成論文發表的團隊之一,2024 年就發表了相關工作。第三範式:世界模型。在 AI 大模型一側,最早的代表是 2024 年發表的 Sora 第一代,如今 Seedance 等也發展得非常迅速。具身智能基於類似的方法,做出了我們所說的“世界動作模型”,它除了能預測未來的動作,還能預測未來世界狀態的演化,從而形成一個閉環。那麼,為什麼我認為還需要做世界模型?VLA 的侷限,不在端到端訓練本身,而在它的學習方式上。VLA 幾乎所有的學習都靠“模仿”:所以要採集大量人類行為數據,通過模仿形成泛化。

但這種泛化相對有限——遇到一個新場景、新任務,如果沒有被模仿過,它很難舉一反三地泛化過去。世界模型則不同:它要構建的是對物理世界的常識性理解,這種理解天然具備較好的泛化性,比如一個水杯,你往下倒水,水就會往下流,這類常識不需要一遍一遍地學。這正是我們認為世界模型能大幅提升泛化性的原因。從功能上看,我們的世界動作模型涵蓋了 VLA 的全部功能:左邊輸入,上面是代表“視覺”的感知輸入,下面是代表“語言”的 prompt;右邊上面是“動作”輸出,它同樣要產生動作。而世界模型還多出一塊:能夠對物理世界的未來演化進行預測。

兩者更大的區別,在於智能底座:VLA 的底座是多模態語言模型,最底層的智能內核是語言,優勢是抽象思維強、泛化廣,缺點則可能缺失一些細節的物理信息與理解;而如今的世界模型多以視頻模型為主,直接處理原始的圖像、視頻、音頻數據,這些數據裡包含了更豐富的物理世界細節,視頻模型能直接處理它們。所以我認為,視頻底座的世界模型,更適合我們這種面向物理世界操作的具身模型。沿著這條思路,我們做出一系列工作。早在 2024 年,我們就發表了世界動作模型的工作——這是全球首個融合視頻預測與動作預測的世界動作模型,如今也基本成為世界動作模型的標準範式,比英偉達的類似方案早了約一年。

在數據層面,世界模型對數據的吸收能力比較強:我們構建了基於大規模人類行為的數據集,2025 年初發表論文將其與世界動作模型結合,數據集中不僅加入機器人真機數據,還把第一人稱的人類操作數據也一起用於訓練。此外,我們還與 Facebook AI(FAIR)團隊的 Andreas 合作完成了 ControlNet 相關工作,進一步提升了動作行為的精準可控性;並把世界模型放到真實世界中,用真實反饋進行迭代與強化學習。具體方法不再贅述,我展示一下我們模型的能力。第一,世界模型的建模與預測能力。我給大家看了兩幅圖:一幅是世界模型生成的,一幅是真實世界實拍的——幾乎分辨不出來。

這說明通過大量數據和較好的網絡設計,世界模型已經能精準預測複雜的物理現象。類似的例子還有很多:毛巾的褶皺、把一張抽紙抽出來,這些細微操作都能被很好地建模,這對精細操作非常有利。第二,零樣本任務泛化。這是我們關於“泛化”的終極追求——任務級泛化:完全沒有學過類似任務,模型也能完成。現在的 VLA 模型能較好實現“物品泛化”(換個物品或位置可能仍能泛化),但“新任務泛化”很難。我們希望模型面對沒見過、沒訓過、沒有數據的任務也能做到。零樣本的意思,就是把預訓練模型直接接到新任務上,看它能否泛化過去。

我們在自己辦公區隨機取景、隨機下達指令,得到了比較好的初步結果:場景背景複雜多樣,指令還帶有一定邏輯推理——比如“把左邊的拖鞋放到右邊拖鞋的旁邊”“把第二個水杯拿起來”“從一堆雜物中把膠帶拿起來,並把它從水平方向放到垂直”。模型能夠端到端地把這些行為動作直接預測出來。第三,精細操作與跨本體能力。經過大量後訓練,模型可以完成比較精細的操作:疊紙盒、翻襪子(把襪子從裡到外翻出來)、脫鞋、開水,都能做得比較好。它還具備跨本體的能力,能夠操作複雜的靈巧手,進而使用工具,比如用螺釘槍打螺釘,用移液器時不僅拿起來、移動到對應位置,還會用大拇指按下按鈕再操作。我們也因此獲得了一些國際榜單的獎項。

03本體:全棧自研的雙足與靈巧手有了一個能夠理解世界的大腦,還需要一具與之匹配的身體。對於通用人形機器人來說,靈巧手、雙足以及全身高自由度運動控制,都是過去沒有成熟答案的方向。傳統機械臂解決的是固定場景下的重複動作,而人形機器人需要進入開放環境,面對更多未知任務。因此,我們選擇從整機、關節模組、機械手,到電機、減速器、驅動器進行全棧自研,同時開發對應的運動控制算法。我們設計這套本體的目標,並不是讓機器人完成某一個動作,而是讓它具備進入真實物理世界、承擔更多樣任務的能力。

全尺寸雙足機器人需要同時兼顧力量、速度、自由度和工作空間,這也是為什麼人形機器人的硬件路線正在從傳統機械設計,走向更高自由度的整機學習和控制路線。在運動控制層面,我們做了全球首個面向商用的人形機器人複雜地形方案,2023 年底已實現涉水行走、上下樓梯等能力,今年春節期間,我們還發布了全尺寸人形機器人舞劍的演示,因為我們的公司做的是通用機器,我們仍能讓它做出非常優美的舞蹈動作,它的尺寸比較大、慣性也比較大,來回翻轉的難度其實很高。再看靈巧手。靈巧手是我們末端執行器的重要類型。

以往工業裡主要用夾爪和吸盤,只有一個自由度,只能把物體夾起來放到另一個地方,很難做翻轉、手內操作等複雜動作;而靈巧手可以像人的手一樣做非常複雜的操作。另一個重要的點在於:現在我們的數據都來自人類行為數據,靈巧手能更好地與人類行為匹配,從而把人類行為數據用得更充分。目前靈巧手主要有三大技術派系:連桿驅動、腱繩驅動與直驅。我們在全行業最早推出全直驅的靈巧手產品,直驅的好處很多,最大的一個是響應速度極快:我們的手一秒鐘能點擊 10 次鼠標,達到超人類的水準;因為有較好的反驅能力,抗衝擊能力也強,穩定性好;同時我們把它做到了 24 千克的負載。

04商業化與結語:飛輪轉起來之後把軟件和硬件都做好、階段化以後,最終最重要的,是把它真正落到商業化場景裡去。我們始終堅持同時做軟件和硬件,就是為了打造完整的產品,最終提供完整的解決方案交付給終端用戶。我們從物流工業起步,逐步向服務、C 端和家用滲透。另一條線是:把硬件平臺、軟件工具鏈與 API 開放出來,供二次開發者或研究者使用、拓展。我認為,從今年開始,具身行業已經進入商業化的拐點。以我們為例,B 端客戶項目已經覆蓋十餘個城市,在各類物流工業場景中常態化運作。不僅僅是拍一個 demo。各行各業對機器人也非常關注:機器人就像 AI 大模型一樣,是一個通用的東西,可以與各行各業結合。

從互聯網大廠,到汽車主機廠,到 3C 電子公司,到物流公司,都有非常多的需求。我們在物流分揀等場景已有實際應用案例;同時,基於我們開放的硬件本體、API 和軟件工具鏈,很多用戶搭建了自己的應用,或開展新型研究,形成了比較豐富的生態成果。最後總結一下。大家可以看到,即便在物流這樣的具體場景,我們用的也是“端到端大模型 + 人形機器人 + 靈巧手”這一通用形態,再用它逐步去做具體的專用場景。這樣做,是希望通用形態能夠持續迭代:進入下一個場景時,我們不需要重新搭建一整套系統,之前場景構建出的能力和數據都可以較好地複用。

在此基礎上,隨著整個系統能力的發展,我們不斷開拓更新的場景,這樣的規劃飛輪,我們已經初步建立起來。通用機器人不是一個單點產品,而是一個持續進化的系統。大腦更聰明,本體更強大,場景更廣闊,飛輪就會轉得越來越快。感謝大家,這是我今天的分享。WRC 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 WRC 2026 參會群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。

前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 workshop、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:WRC + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

IT之家生成式AI

消息稱蔚來智駕負責人任少卿創立具身智能公司,蔚來將戰略投資

首頁 > IT資訊>人物 消息稱蔚來智駕負責人任少卿創立具身智能公司,蔚來將戰略投資 2026/8/24 18:46:59 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 24 日消息,據晚點 Auto 消息,8 月 24 日,蔚來 CEO 李斌在智駕全員會上宣佈,智能駕駛負責人任少卿已創立物理 AI 基礎模型和具身智能獨立公司,蔚來將戰略投資並與之開展合作。知情人士稱,“會議很簡短,沒有提及組織架構變動。”一位參與此次全員會的人士稱,李斌和任少卿在會議上明確表示,任少卿將繼續擔任蔚來智能駕駛業務負責人。報道稱任少卿創立的新公司已經完成註冊,估值達到獨角獸級別。任少卿,1988 年出生,2016 年取得中國科學技術大學與微軟亞洲研究院博士學位。2018 年,任少卿參與創立 momenta,任合夥人兼研發總監;2020 年 8 月加入蔚來汽車,後擔任蔚來自動駕駛研發首席專家、副總裁。IT之家查詢公開信息獲悉,除了在蔚來任職,2025 年 9 月,任少卿加入中國科學技術大學,擔任講席教授、博士生導師和通用人工智能研究所所長,研究方向包括人工智能、世界模型、具身智能、深度學習和 AI for Science 等。相關閱讀:《原 Momenta 研發總監任少卿入職,蔚來自動駕駛研發重心轉回國內》《消息稱蔚來智駕再調整:任少卿直管大模型部門,推進“端到端”量產交付》《中國科大教授任少卿、蔚來汽車 CEO 李斌獲中國人工智能最高獎》 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:蔚來,智駕,任少卿,具身智能智元聯合長隆打造全球首個具身智能主題樂園,含機器人服務酒店等秦力洪:純電滲透率今年有望超 50%,蔚來不會做增程車蔚來李斌稱中國汽車行業進入“決賽最殘酷階段”,接下來三五年最後的玩家差不多塵埃落定奇瑞捷豹路虎 FREELANDER

剛剛
鈦媒體生成式AI

偷書要賠15億美元,AI巨頭燒幾百萬本書反而合法了

偷書要賠15億美元,AI巨頭燒幾百萬本書反而合法了藍字計劃2026.08.24 18:01 · 來自廣東全文4120字00:00 / 11:49只要能訓練出更好的大模型,究竟要銷燬多少本實體書,甚至在實體書之外還會消耗多少前AI時代的“資產”,也許就再也沒人關心了。文 | 藍字計劃,作者|Chester一場現代版的“焚書”,正在美國發生。最近幾年,美國二手書市場出現了一個奇怪現象:不少神秘買家,一次性採購成百上千本書,不挑書、不問價,甚至連冷門舊書都照買不誤。隨著電子閱讀的普及,現在還有多少人看實體書?更別說這種成百上千的掃貨始買書。書商們自然也開始好奇:究竟是誰在買走這批書?最近,美國科技媒體404 Media聯繫到一名二手書商。對方剛剛通過書籍交易平臺Biblio,接到了一筆大約1000本舊書的訂單,其中還包括不少稀有、絕版和具有收藏價值的書。為了找出背後的買家,404 Media把一枚AirTag塞進其中一本書裡,然後一路追蹤。最終,這本書被送進了亞馬遜位於拉斯維加斯的一家倉庫。據404 Media調查,這些書到了亞馬遜倉庫後,命運卻只有三步:切掉書脊、批量掃描、然後扔進碎紙機。負責這項工作的VGT3團隊,甚至還給自己設計了一個頗為應景的Logo:一隻露著牙齒、手裡抓著書的霸王龍。 自己也賣書的亞馬遜卻幹起了銷燬實體書的活已經夠驚奇了,但更驚奇的是同樣這樣乾的,不只有亞馬遜。在更早之前,Anthropic就被曝光過一個代號為“巴拿馬計劃”的秘密項目。他們的目標,是把全世界的書都“破壞性掃描”一遍。在大約一年時間裡,Anthropic為此花費數千萬美元,買下數百萬本實體書,然後切掉書脊、掃描內容,再把剩下的紙張送去回收。美國的AI大公司,怎麼就和舊書幹上了?互聯網內容,不夠AI用了AI公司瘋狂買二手書,其實是想買下書裡的內容和數據。過去,互聯網是大模型最方便的數據來源。

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛