星動紀元陳建宇:VLA 非終局,具身大腦已進入世界模型時代 | WRC 2026

2026年8月21日 03:14
站內 AI 整理稿

當機器人開始理解世界,通用智能才進入物理空間。作者丨吳思夢 陳嘉欣 編輯丨岑 峰 過去幾年,機器人解決的問題是“如何更精準地執行動作”。在工業生產線上,機器人可以完成焊接、搬運、裝配等大量重複任務,但這些能力建立在一個前提之上:環境、流程和目標都已經被提前定義。機器人並不需要真正理解世界,只需要按照預設路徑完成任務。但當機器人開始走出工廠,進入物流、服務甚至家庭場景,問題正在發生變化。面對一個沒有見過的物體、一個沒有訓練過的任務,機器人能不能理解環境、預測變化,並找到完成任務的方法?這成為通用機器人走向下一階段必須回答的問題。大模型的發展為機器人提供了新的可能。

語言模型證明,人工智能可以通過大規模數據學習複雜規律,並獲得跨任務泛化能力。但機器人面對的並不是語言世界,而是真實的物理世界。因此,具身智能領域正在探索一個更底層的問題:大模型究竟應該如何賦能機器人?目前行業的主流方向是 VLA。它讓機器人通過學習大量人類行為數據,將視覺、語言和動作統一起來。但 VLA 的核心仍然是模仿——模型學習人類過去如何行動。問題在於,如果機器人面對一個從未見過的新任務,僅依靠已有動作經驗,是否能夠真正泛化?另一條更激進的路線,是讓機器人擁有世界模型。它不只是學習“應該做什麼動作”,而是嘗試理解物理世界運行的規律,並預測未來可能發生什麼。

在 WRC 2026 大會上,星動紀元創始人、CEO 陳建宇提出了自己的判斷:世界模型可能不僅是 VLA 的增強模塊,而可能成為下一代具身智能的核心範式。他更強調機器人作為物理智能體的特殊性。模型的進化並不只依賴數據規模,還需要通過本體進入真實世界,在真實交互中獲得反饋。大腦、本體和場景並不是三個獨立環節,而是在持續循環中共同演化。以下為陳建宇演講內容精編,·AI 科技評論在不改變原意的基礎上進行編輯和整理。01 通用機器人的兩個特徵,與協同進化的飛輪終端之後的下一代智能終端產品,很可能是以某種家用機器人的形式存在的。這裡最關鍵的一點,是能不能打造出更加通用的機器人。

我認為,這樣的機器人必須具備兩個特徵。第一個特徵是上限更高:擁有更高的自由度、更高的智能,能夠做到許多以前的機器人做不到的事情,從而把整個市場打開。第二個特徵是更加通用、泛化性更強:當我們去做一件新的事情時,不再像以前的專用機器那樣需要重新開發硬件和軟件,絕大部分能力都可以直接複用與泛化。要打造這樣一個通用機器,避不開兩件事:同時做它的“大腦”和它的“本體”。圍繞這個目標,我們這幾年已經實現了通用機器人軟硬一體、全棧自研的多項突破。在大腦側,自研了支撐端到端的大模型運動控制;在本體側,自研了雙足本體關節與靈巧手,並把它們很好地整合到了一起。

做這件事最重要的,是把大腦、本體和場景協同起來,形成一個協同進化的飛輪。飛輪的最上層,是我們的端側具身大腦大模型,包括我們做的 VLA、世界模型與數據等,它是一個通用模型,能適配多種不同的本體、用到不同的場景中。中間層是本體:具身大腦最終要產生價值,必須放在某個本體之上,才能與物理世界交互、真正去幹活。最終,我們把大腦與本體一起應用到各類場景裡,只要大腦足夠通用、本體足夠通用,它們就能比較通用地進入各個場景。而在場景應用的過程中,我們會不斷獲得大量數據反饋,這些反饋又反過來反哺模型的發展。就這樣,我們把技術和商業化很好地協同起來,形成協同進化的飛輪。下面,我具體講講我們的思路和做法。

02大腦:從端到端 VLA 到世界動作模型先從具身大腦層面講起。我把到目前為止的具身大模型迭代,歸納為三個範式。第一範式:語言模型 + 機器人控制。這一切都始於 ChatGPT 大模型的出現。最初我們探索的是把語言大模型用在機器人裡,但整體框架仍是傳統的模塊化機器人思路:用語言模型增強上層的推理,下層仍然是傳統的感知、控制、執行模塊。這一階段,我們做出了全球首個大語言模型結合人形機器人的學術工作——以語言模型作為上層規劃,下層感知控制執行仍由傳統方法完成。但我們很快意識到這種分層方法的侷限:感知、規劃、控制、執行都被模塊化,模塊間的特徵和接口靠人工定義,無法端到端訓練。

語言模型和視覺模型都經歷過從“模塊化、人工定義特徵”到“端到端、靠數據 scaling”並最終成功的轉變,我們相信,具身智能也應遵循類似的範式。第二範式:多模態底座上的 VLA 模型。大約在 2023 年,以 GPT-4 為代表的多模態語言模型出現,把視覺等信息融了進來。對應到具身模型,就產生了 VLA:在多模態模型的底座之上,把機器人非常重要的動作和與環境交互的功能,也融合進同一個統一模型。今天典型的 VLA 模型,比如 Google 的 PaLM 系列、RT 系列等,已經形成統一範式:以多模態語言模型為底座,再加上一個動作頭,端到端訓練。

這一範式,我們其實是歷史上最早公開成論文發表的團隊之一,2024 年就發表了相關工作。第三範式:世界模型。在 AI 大模型一側,最早的代表是 2024 年發表的 Sora 第一代,如今 Seedance 等也發展得非常迅速。具身智能基於類似的方法,做出了我們所說的“世界動作模型”,它除了能預測未來的動作,還能預測未來世界狀態的演化,從而形成一個閉環。那麼,為什麼我認為還需要做世界模型?VLA 的侷限,不在端到端訓練本身,而在它的學習方式上。VLA 幾乎所有的學習都靠“模仿”:所以要採集大量人類行為數據,通過模仿形成泛化。

但這種泛化相對有限——遇到一個新場景、新任務,如果沒有被模仿過,它很難舉一反三地泛化過去。世界模型則不同:它要構建的是對物理世界的常識性理解,這種理解天然具備較好的泛化性,比如一個水杯,你往下倒水,水就會往下流,這類常識不需要一遍一遍地學。這正是我們認為世界模型能大幅提升泛化性的原因。從功能上看,我們的世界動作模型涵蓋了 VLA 的全部功能:左邊輸入,上面是代表“視覺”的感知輸入,下面是代表“語言”的 prompt;右邊上面是“動作”輸出,它同樣要產生動作。而世界模型還多出一塊:能夠對物理世界的未來演化進行預測。

兩者更大的區別,在於智能底座:VLA 的底座是多模態語言模型,最底層的智能內核是語言,優勢是抽象思維強、泛化廣,缺點則可能缺失一些細節的物理信息與理解;而如今的世界模型多以視頻模型為主,直接處理原始的圖像、視頻、音頻數據,這些數據裡包含了更豐富的物理世界細節,視頻模型能直接處理它們。所以我認為,視頻底座的世界模型,更適合我們這種面向物理世界操作的具身模型。沿著這條思路,我們做出一系列工作。早在 2024 年,我們就發表了世界動作模型的工作——這是全球首個融合視頻預測與動作預測的世界動作模型,如今也基本成為世界動作模型的標準範式,比英偉達的類似方案早了約一年。

在數據層面,世界模型對數據的吸收能力比較強:我們構建了基於大規模人類行為的數據集,2025 年初發表論文將其與世界動作模型結合,數據集中不僅加入機器人真機數據,還把第一人稱的人類操作數據也一起用於訓練。此外,我們還與 Facebook AI(FAIR)團隊的 Andreas 合作完成了 ControlNet 相關工作,進一步提升了動作行為的精準可控性;並把世界模型放到真實世界中,用真實反饋進行迭代與強化學習。具體方法不再贅述,我展示一下我們模型的能力。第一,世界模型的建模與預測能力。我給大家看了兩幅圖:一幅是世界模型生成的,一幅是真實世界實拍的——幾乎分辨不出來。

這說明通過大量數據和較好的網絡設計,世界模型已經能精準預測複雜的物理現象。類似的例子還有很多:毛巾的褶皺、把一張抽紙抽出來,這些細微操作都能被很好地建模,這對精細操作非常有利。第二,零樣本任務泛化。這是我們關於“泛化”的終極追求——任務級泛化:完全沒有學過類似任務,模型也能完成。現在的 VLA 模型能較好實現“物品泛化”(換個物品或位置可能仍能泛化),但“新任務泛化”很難。我們希望模型面對沒見過、沒訓過、沒有數據的任務也能做到。零樣本的意思,就是把預訓練模型直接接到新任務上,看它能否泛化過去。

我們在自己辦公區隨機取景、隨機下達指令,得到了比較好的初步結果:場景背景複雜多樣,指令還帶有一定邏輯推理——比如“把左邊的拖鞋放到右邊拖鞋的旁邊”“把第二個水杯拿起來”“從一堆雜物中把膠帶拿起來,並把它從水平方向放到垂直”。模型能夠端到端地把這些行為動作直接預測出來。第三,精細操作與跨本體能力。經過大量後訓練,模型可以完成比較精細的操作:疊紙盒、翻襪子(把襪子從裡到外翻出來)、脫鞋、開水,都能做得比較好。它還具備跨本體的能力,能夠操作複雜的靈巧手,進而使用工具,比如用螺釘槍打螺釘,用移液器時不僅拿起來、移動到對應位置,還會用大拇指按下按鈕再操作。我們也因此獲得了一些國際榜單的獎項。

03本體:全棧自研的雙足與靈巧手有了一個能夠理解世界的大腦,還需要一具與之匹配的身體。對於通用人形機器人來說,靈巧手、雙足以及全身高自由度運動控制,都是過去沒有成熟答案的方向。傳統機械臂解決的是固定場景下的重複動作,而人形機器人需要進入開放環境,面對更多未知任務。因此,我們選擇從整機、關節模組、機械手,到電機、減速器、驅動器進行全棧自研,同時開發對應的運動控制算法。我們設計這套本體的目標,並不是讓機器人完成某一個動作,而是讓它具備進入真實物理世界、承擔更多樣任務的能力。

全尺寸雙足機器人需要同時兼顧力量、速度、自由度和工作空間,這也是為什麼人形機器人的硬件路線正在從傳統機械設計,走向更高自由度的整機學習和控制路線。在運動控制層面,我們做了全球首個面向商用的人形機器人複雜地形方案,2023 年底已實現涉水行走、上下樓梯等能力,今年春節期間,我們還發布了全尺寸人形機器人舞劍的演示,因為我們的公司做的是通用機器,我們仍能讓它做出非常優美的舞蹈動作,它的尺寸比較大、慣性也比較大,來回翻轉的難度其實很高。再看靈巧手。靈巧手是我們末端執行器的重要類型。

以往工業裡主要用夾爪和吸盤,只有一個自由度,只能把物體夾起來放到另一個地方,很難做翻轉、手內操作等複雜動作;而靈巧手可以像人的手一樣做非常複雜的操作。另一個重要的點在於:現在我們的數據都來自人類行為數據,靈巧手能更好地與人類行為匹配,從而把人類行為數據用得更充分。目前靈巧手主要有三大技術派系:連桿驅動、腱繩驅動與直驅。我們在全行業最早推出全直驅的靈巧手產品,直驅的好處很多,最大的一個是響應速度極快:我們的手一秒鐘能點擊 10 次鼠標,達到超人類的水準;因為有較好的反驅能力,抗衝擊能力也強,穩定性好;同時我們把它做到了 24 千克的負載。

04商業化與結語:飛輪轉起來之後把軟件和硬件都做好、階段化以後,最終最重要的,是把它真正落到商業化場景裡去。我們始終堅持同時做軟件和硬件,就是為了打造完整的產品,最終提供完整的解決方案交付給終端用戶。我們從物流工業起步,逐步向服務、C 端和家用滲透。另一條線是:把硬件平臺、軟件工具鏈與 API 開放出來,供二次開發者或研究者使用、拓展。我認為,從今年開始,具身行業已經進入商業化的拐點。以我們為例,B 端客戶項目已經覆蓋十餘個城市,在各類物流工業場景中常態化運作。不僅僅是拍一個 demo。各行各業對機器人也非常關注:機器人就像 AI 大模型一樣,是一個通用的東西,可以與各行各業結合。

從互聯網大廠,到汽車主機廠,到 3C 電子公司,到物流公司,都有非常多的需求。我們在物流分揀等場景已有實際應用案例;同時,基於我們開放的硬件本體、API 和軟件工具鏈,很多用戶搭建了自己的應用,或開展新型研究,形成了比較豐富的生態成果。最後總結一下。大家可以看到,即便在物流這樣的具體場景,我們用的也是“端到端大模型 + 人形機器人 + 靈巧手”這一通用形態,再用它逐步去做具體的專用場景。這樣做,是希望通用形態能夠持續迭代:進入下一個場景時,我們不需要重新搭建一整套系統,之前場景構建出的能力和數據都可以較好地複用。

在此基礎上,隨著整個系統能力的發展,我們不斷開拓更新的場景,這樣的規劃飛輪,我們已經初步建立起來。通用機器人不是一個單點產品,而是一個持續進化的系統。大腦更聰明,本體更強大,場景更廣闊,飛輪就會轉得越來越快。感謝大家,這是我今天的分享。WRC 2026 要來了,你還在單打獨鬥?為了方便大家抱團交流、互通會議消息,我們專門建了 WRC 2026 參會群!進群你會解鎖這些「福利」?會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。

前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 workshop、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:WRC + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!

上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛