8 位 AI 創業者談世界模型:生成一切之後,還差一點常識|WRC 2026

2026年8月31日 09:13
站內 AI 整理稿

會生成未來,不等於理解世界。作者丨吳思夢 編輯丨岑 峰 2026世界機器人大會的最後一天,一場題為“世界模型到服務人類的現實距離”的論壇對話,將八位分別來自模型、數據、本體、仿真各賽道的創業者拉到了同一張桌子上。這場對話由剛剛獲聘中國電子學會世界模型專委會主任委員的之江實驗室主任、阿里雲創始人王堅主持。八位對話嘉賓——大曉機器人董事長、商湯科技聯合創始人王曉剛,奧比中光創始人、董事長黃源浩,無界動力創始人、CEO張玉峰,跨維智能創始人、CEO賈奎,智澄AI創始人、CEO胡魯輝,飛渡科技聯合創始人、總經理宋彬,螞蟻靈波科技首席科學家沈宇軍,極佳視界聯合創始人、首席科學家朱政,均為該專委會委員。

儘管大家都在一個大領域裡,但每個人對時代和技術的經歷各不相同。王堅請八位嘉賓依次從自身經歷出發,暢談:你們認識的世界模型,到底是什麼?一個小時的討論圍繞三個議題層層遞進,從“世界模型到底是什麼”開始,到“高質量數據會不會成為不可逾越的成本障礙”結束。有人把它稱作生成式AI“皇冠上的明珠”,有人自嘲是“賣鏟子的人”,有人把底座能力比作“九年義務教育”,還有人追問屬於具身智能的“DeepSeek時刻”何時到來。

但真正讓這場對話顯出重量的,是那些在比喻之外逐漸浮出的判斷:世界模型不能只停留在“生成得像”,而要跨過模仿學習,去理解物理世界的底層邏輯;數據雖然稀缺,但模型一旦具備真正的理解力,數據依賴或許會急劇下降;落地的路徑也並非一步跨進家庭,而是先到工業裡練技能,再到商業場景裡練泛化,最後才敢叩響家門。更棘手的約束來自工程本身,邊緣算力有限,功耗不能無限膨脹,安全機制和熔斷設計必須跟上。八個人從不同賽道出發,最終都指向同一個問題:從生成到理解,中間還差什麼?而從垂類到通用,或許才是這場漫長賭局的終局。

以下為本次論壇對話的精編稿,基於現場錄音轉寫稿進行了不改原意的編輯整理:01議題一:世界模型,到底不一樣在哪?王堅(主持人,之江實驗室主任、阿里雲創始人):最近幾年世界模型這個詞很熱。諸位是不是能夠從自身的經歷,談一談你們所認識的世界模型,跟現在其他講的模型有什麼不一樣的地方?當前有哪些非常有意思的技術路線?王曉剛(大曉機器人董事長、商湯科技聯合創始人):我們從2024年10月發佈了“開悟”世界模型1.0。過去幾年,我們認為世界模型的應用經歷了幾個階段。第一階段,世界模型主要用來做數據增強——舉一反三、反一百,通過世界模型生成各式各樣的數據作為訓練數據的補充。

第二階段,世界模型可以作為模擬仿真器,模擬動態世界的動態變化,比如端到端自動駕駛,就在世界模型裡通過強化學習不斷自身演進進化。第三階段,就是今天大家更加期待的——World Action Model,把世界模型直接部署到機器人終端的大腦,讓它實時驅動本體。世界模型相比以前的VLA模型,最大的特點是能夠對世界的未來狀態進行生成和預測。VLA還屬於模仿學習,針對特定任務、特定硬件本體,很難期待它做出智能的湧現。它擅長的是靜態場景,比如抓取一瓶水,環境不發生變化時預測運動軌跡。

但今天的世界模型假設世界在交互過程中不斷演化變化,我們一邊執行動作,一邊對各種可能性、平行空間裡未來可能產生的後果做出推理和演繹。所以世界模型要具備理解、生成、預測一體化:一個模型,能夠對複雜任務進行拆解,判斷執行效果是成功還是失敗,完成度是多少;生成對未來世界狀態的演繹;預測並控制真機本體——三種能力共享特徵。黃源浩(奧比中光科技集團股份有限公司創始人、董事長):講世界模型,一般都是跟大語言模型相對的。2022年底GPT出來之後,大家都知道大語言模型效果特別好,過了一陣,逐步有人講空間智能、講世界模型。

大語言模型只能語音交互,而世界模型能夠讓機器人具身智能真正幫人類幹活,解放的是80億人類的勞動力。原來的GPT只能詩和遠方,不能實地幹活。世界模型是解決這個問題的。我們是做世界模型的數據的——視覺數據,也聯合很多觸覺數據公司,把數據做到毫秒級硬件同步,給世界模型訓練提供養料。我們預測,世界模型跟具身智能的GPT時刻可能很快要到來,而且具身智能的市場可能比數字智能大5倍、10倍。我們賣鏟子的就不多說了,聽聽其他模型專家多說一點。王堅:你剛才講具身智能的GPT時刻,是不是能夠把它改成具身智能的DeepSeek時刻?張玉峰(無界動力創始人、首席執行官):我以前在地平線做智能駕駛和智能駕駛芯片。

世界模型這個概念存在很久了,對於未來狀態的預測本身就是一個泛世界模型。我的聯合創始人、CTO夏中譜老師,2011年在中科院自動化所讀博時研究的就是model-based reinforcement learning,它本身就是世界模型的雛形——只不過那時比AlphaGo打敗世界圍棋冠軍還早了幾年,同學們還愁強化學習怎麼找工作。這些年強化學習火了,世界模型更火了。VLA也好,或者類似的、基於本質上模仿學習的範式,它追求的是數據量足夠大、分佈足夠好情況下的概率分佈和肌肉記憶。

但對於物理世界的底層邏輯的理解,對於提煉關鍵信息由此帶來的比較好的泛化——few-shot、one-shot、zero-shot的湧現一直沒有看到。數據稀缺是一方面,但範式本身也有問題。所以世界模型給大家帶來了重新聚焦這個概念的機會,也是希望能夠突破模仿學習為底層邏輯的範式限制。具身智能應該聚焦在什麼層面?核心是像人一樣:以自身的動作為條件,預測世界的下一個狀態;或者為達到某個目的,我們到底該採取什麼行動?這是人、還有一些哺乳動物與生俱來的能力。我們不需要、也很難學習對於一個物理世界從可見光到原子各個維度的複雜真實模擬,就像天氣預報在未來幾年可能依然很不準。

但人依賴自己大致正確的世界模型,就已經能夠完成很多任務。所以無界動力的技術路線是隱空間世界模型——讓很多計算不是發生在像素層面,而是讓模型學到潛空間的高維表徵,更高效地推理、關聯時空的因果。賈奎(跨維智能創始人、首席執行官):這一波AI熱潮,從2017年Transformer之後,我們到大語言模型、圖像生成、視頻生成、3D生成,到現在聊的世界模型。世界模型是整個這六七年生成式AI到目前為止的一個最高潮。因為我們能生成語言、能生成視頻、能生成3D,而世界模型是希望能夠完全生成符合三維物理幾何絕對正確的世界。從這個角度講,世界模型是“生成式AI皇冠上的明珠”。

跨維智能比較關注的是:你要能夠生成三維物理幾何絕對正確的可交互動態環境。這意味著世界模型的隱空間、它的token是要能夠定義在正確的時空節點上。這樣你不僅能生成機器人末端的正確軌跡任務,還能預測機器人或其他物理智能體對環境發生動態改變後,環境怎麼正確地變化。世界模型的上限比LLM、VLM、VLA都要高得多,當然對數據的訴求也非常大。胡魯輝(智澄AI創始人、首席執行官):我們公司以通用人工智能作為願景,很自豪國內率先自研世界模型。從AlexNet到AlphaGo、Transformer到ChatGPT,都是現象級的。下一個人工智能是什麼?很有可能就是世界模型。

我們已經經歷了CV時代、多模態大模型時代,也看到了智能湧現和泛化性。下一個問題,人工智能可能要解決的就是理解物理世界——理解可能是個核心。我原來是Meta背景,我們公司用的是JEPA技術路線。相信世界模型能夠在人工智能領域起到AlexNet、Transformer這種顛覆性影響。宋彬(北京飛渡科技股份有限公司聯合創始人、總經理):我們做空間智能和數字孿生方向。這幾年我們一直在關注世界模型,也總結了一下——大體可以分為幾個流派:有基於像素和視頻生成的,有基於物理AI角度的,有基於JEPA的,有最新提出的基於因果的,還有基於循環因果的Loop方法。

我們看完之後發現一個共性:第一,AI要具備快速理解世界的能力和生成任務的能力;第二,要具備模擬、仿真和推演能力,這必然涉及物理常識,這是其他大模型比較缺乏的;還要有對空間結構、時空拓撲的理解和推演能力,以及因果能力,尤其做ToB、ToG方向,我們需要強因果關係;第三,就是規劃和在物理世界上執行任務的能力。我把世界模型底座能力比作九年義務教育——小學、初中把我們培養出對物理常識、社會倫理、道德的基本認知。上了初中之後開始特殊訓練,有些進職高,有些進高中。世界模型底座也是一樣,要有很強的泛化和通用能力。沈宇軍(螞蟻靈波科技首席科學家):靈波是一家給機器人做大腦的公司。關於世界模型我想說兩點。

第一,非常開心看到大家逐漸意識到視頻這個模態對人工智能的重要性。機器人在現實生活中幹活,離不開dynamics——不管是突發狀況還是整個交互過程,更多的是動態建模,視頻方向可能有比較大的提升。第二,世界模型火、潛力大,但我們更關注的是:模型的發展是不是真的對機器人操作有真實的幫助?如果第二點沒法證明,前面視頻、時序建模做得再好也是空中樓閣。朱政(極佳視界聯合創始人、首席科學家):極佳視界2023年年初成立,到現在三年半,主要標籤就是世界模型。

當時是語言模型最火的時候,我花非常多精力給投資人講什麼是世界模型,投資人的反應非常一致:你們是非常優秀的團隊,如果願意做語言模型我一定投,但我實在搞不懂什麼是世界模型。經過三年發展,到去年情況有了非常大的改觀——很多投資人主動找上門。給大家一個直觀的例子:去年這個時候我來WRC,公司估值只有現在的1/50。12個月時間,估值漲了50倍。02議題二:服務人類,還差哪幾步?王堅:剛才宇軍在談的時候講到了服務人類。一談機器人,大家就會談到人形機器人。如果世界模型要真正服務人類,它今天應該具備哪些最核心的能力?我們離這個目標還有多遠?王曉剛:具身的世界模型應該具備三個核心能力。第一是生成智能。

世界模型的核心就是能夠生成對未來世界的推演和預測。但光生成漂亮的視頻、像素級的美觀,還不能完成跟物理世界的交互。缺的第二能力是物理智能,包括空間智能、空間能力,以及跟物理操作的物體的物理規律、物理屬性——包括空間記憶。第三個是認知智能。今天我們在具身裡做的還是比較Tabletop的簡單動作,未來進入更復雜的場景、進入家庭,很長程複雜的任務怎麼分解?怎麼對動作執行的完成狀態進行判斷?這需要認知能力。最先急缺的是中間的物理智能。為什麼漂亮的視頻並不意味著學到了物理規律?第一,我們今天學的好多視頻不是真實的視頻,比如電影特效、科幻的視頻。第二,我們非常缺工作當中第一視角交互的視頻。

除了視頻本身,還要有相機位姿、幾何信息、物理屬性、多視角攝像,只有綜合起來,才能把物理智能學好。黃源浩:一方面模型需要不斷進化,另一方面數據特別重要。世界模型有很多類別,一種是從理論上出發設計牛頓力學、各種規則;另一種是喂數料湧現出來的。人剛出生也沒學過牛頓定律,但看人家怎麼做、模仿學習也能做。兩條路徑都要走。如果世界模型好了,真正機器人能為人類幹髒活、苦活、累活,還得本體——手的執行能力、傳感器各方面都得好。先從最需要的方向、最貴的、人類最不願意乾的活去落地,後面泛化性好了、智能高了,再往更多場景滲透。張玉峰:世界模型要能學到對於物理世界底層邏輯的理解、長程任務的完成、場景泛化的支持。

我們的總體思路是用工業來練技能——選定一些有商業價值、有複製性、傳統工業自動化不太容易做的場景,比如安全帶織布柔性物體的操作,基於世界模型的方法能夠預測和快速響應被操作物體的形變。用商業場景練泛化——商業場景體現的是光線、背景變化,比如咖啡店、快餐連鎖店,任務相對具象但環境有變化。進家庭現在比較有挑戰,因為它把幾個挑戰的維度全放在一起了。另外,安全性怎麼保障?做L4自動駕駛時,模型端到端和額外的安全機制、冗餘機制並存也是非常關鍵的。還有一點,但凡人機共生,語言交互能力非常關鍵,模型如何能夠把人的一些示教,類似於大人教小孩一樣,作為上下文讓機器人在實際場景下得到學習。

賈奎:人的訴求簡單說有兩種:一種需要情緒價值,希望有好的內容讓人享用;另一種,人希望機器人能給自己把活都幹了。世界模型可以生成完全三維幾何物理正確的世界——投影到文本就是語言生成,投影到不同視角就是圖片或視頻。我們也希望用這樣的世界模型去驅動機器人,把人從勞動中解放出來。世界模型其實也是整個AI的大一統終局——只要你能夠感知理解、生成完全正確的世界,你既可以給人類創作好的內容,也可以驅動機器人。胡魯輝:世界模型有兩大應用:數字空間和物理世界。在數字空間裡,可能是語言模型或多模態大模型的升級,但世界模型核心要解決的是理解的問題。

理解很抽象——人對物理世界的理解包括對physical和dynamics的理解、對任務和規劃的理解,以及因果關係:怎麼預測下一個時空?怎麼讓機器人做下一個動作?關於落地場景,我們最早一個訂單是家用場景。後來覺得家用、工業或特殊場景,從人工智能理解和因果關係來說其實差不多。但核心關鍵,家用不僅僅是完成任務,還涉及安全、隱私、倫理。我當時在Meta時,歐盟對Meta有一個50億的隱私罰款。很多人覺得把規範遵守就可以了,但Meta的理念是通過技術、人工智能方法來解決這些問題。所以世界模型真正能落地,安全技術少不了。宋彬:講服務人類,正好刷到抖音裡的微短劇。我在想,如果基於世界模型來做短劇行不行?

應該可以,至少我們快速生成一個短劇,很可能就能讓大家買單。當很多需求是消費級的時候,世界模型已經在做商業化的事了。但面向功能性需求——工程級、工業級,客戶要的是可靠性、準確率,而且是長時序裡的穩定性的確定性輸出。物理AI泛化意味著多場物理場的耦合求解,還要長時序穩定輸出保證正確率,這估計還得攻克很多年。昨天看到一個機器人,跑著跑著跑直線居然撞牆了——說明在開放式環境裡,對空間本體和主體、空間結構和時空拓撲的理解推演能力不夠。還有時空語義解析成本過高、ROI不合理,導致很難普及。但有一點:今天的AI讓解決問題的效率和準確率是倍增的——過去一個問題三年,現在基於這套體系可能倍增。所以離目標多遠?

可能有一個類似摩爾定律的邏輯來看待這個事——兩年、三年,也可能5年。安全方面,不管AI也好,一旦訪問數據本體,一定要有隔離層。我是比較推崇基於本體語義來做隔離層。第二要有熔斷機制。沈宇軍:如果說我們要聊的事情是以機器人為載體,AI能服務人類會提出一個新的挑戰:機器人本身不能是個功耗太高的東西。在功耗要求比較低的時候,我們如果一邊追求智能的上限,一邊又要保持低功耗,這個中間可能是一個很難平衡的點。現在的AI範式還是計算——大數據碰上大算力。智能越高,數據越多,參數量越大,推理時消耗的計算資源就更多。但機器人不能不斷給自己發電,跟車不一樣。

在邊緣部署的問題會限制算力發揮——如何更高效地讓計算發揮價值,在智能上限和低功耗限制之間做好平衡,這可能是真的有一天我們期待機器人服務人類時一定要解決的問題。朱政:世界模型距離真正能服務好人類,最大的短板仍然是模型能力。知識從哪裡來?應該從數據裡來。我們訓一個具身的基模或世界模型,大部分數據還是無標註視頻數據或帶標註的視頻數據,它和文本數據有本質區別——文本數據天然蘊含豐富知識,但視頻數據怎麼增加儘可能多的知識?第二步,有了知識之後怎麼交給模型?我們的模型參數容量還是非常小的,相比較語言模型可能只有1/10甚至1%。

雖然說世界模型要完成任務的解空間比語言模型小一些,但第一步還是要把模型容量足夠做大,之後再想辦法做小。當然,一個只經過預訓練的模型顯然不能很好在物理世界運轉,需要不停地跟物理世界交互去自進化。03議題三:數據,會不會卡住所有人?王堅:剛才大家討論裡已經談到了一個很關鍵的問題——數據。這次人工智能的變革極大依賴於數據來源,世界模型就更加了。世界模型還有一個很大挑戰,就是跟物理規律之間的關係。小剛總提到,很多數據都是從電影特效裡學來的,有的假的東西讓大家看起來像真的,但有些真的符合物理規律的看起來又像假的。真正符合你們需要的高質量數據應該怎麼來?怎麼治理?

數據的成本會不會成為創新企業的不可逾越的障礙?王曉剛:這是具身和大語言模型非常重要的差別。大語言模型的數據來自互聯網,有些互聯網企業有天然優勢。但具身的數據,尤其是真人操作的數據,歷史上積累是0。這些數據從哪來?得從真實的生產生活環境中採集。我們實驗過,建實驗室僱採集員編劇本讓他不停執行動作,對訓練效果非常有限。我們真正需要的是in the wild的數據——越自然越好。這就要跟場景方深入合作,製造業、零售、酒店,全國成千上萬的工人動員起來,才能實現數據快速積累。

通過實踐,我們逐漸看到scaling law:從in the wild採集的數據量逐漸增加時,教會一個本體做某項技能,現在可能幾個小時就會了,將來也許更少,也許就不需要真機數據了。數據可以分若干等級——頭戴第一視角單目或雙目運動相機在單一場景採集的原始視頻也能用,但隨規模增大,給智能提供的上限比較低。如果身上帶多攝像頭協同,加力觸覺手套,採集場景更加diversify,不但有成功還把很多失敗的例子也採集進來——這些數據價值非常高。市場上不同類型數據從幾十塊到1000塊錢左右,市場給了它這樣的定位。黃源浩:數字智能是大算力加大數據催生的,大算力來自英偉達,大數據是互聯網本來就有。

但具身智能數據是0,怎麼辦?真機遙操質量非常高但成本更高。數據最重要還是來自於跟人學習。現在大家著急買各種採數據的設備——有了數據模型就迭代快,迭代快就是贏者通吃的市場,第三名以外可能沒太大用了。但數據質量參差不齊,標準也不統一。機器人要跟人學習的無非兩個:locomotion移動,強化學習已經做得挺好;manipulation操作——擰螺絲、釘釘子、ICP這種靈巧操作,數據非常少。開始有人用視頻,後來用第一視角,發現只有視頻沒有觸覺就加觸覺手套,但手套現在還不太成熟。眼睛採到的數據和手套數據可能差15毫秒就已經不對了,力的精度也沒有側滑的力。所以數據飛輪的轉動是最重要的。數據標準更重要。

要做到3D空間復原——從視角放大縮小都可以,第一視角第三視角都可以看,空間裡手在哪個姿態、哪個位置、力是多少、物體是什麼狀態,只有完整記錄下來數據才可複用、才可跨本體複用、跨模型複用,數據成本才會降下來。期待王院士來主導把數據標準定一下,先做到八成九成慢慢增加。張玉峰:行業對於數據金字塔已有基本共識:從互聯網數據到ego數據、真機數據等。我們這次也發佈了可穿戴設備——頭上五個魚眼360度加TOF,手上兩個手環。我們的咖啡師就帶著這樣的設備在做咖啡時採數據。在數據量上,頭部語言模型企業能用到百萬億Token的語料,比具身智能大好幾個數量級。

現在先過百萬條具身智能數據,已有初步行業共識,可能是一個小的拐點。但量是其一,質量很重要。我們比較看重有效信息密度:比較低的是觀測觀察型數據;第二類簡單接觸,拿放這些;第三類接觸點比較密集,比如易碎物品的抓取,價值相對更高;第四類是失敗情況下的數據——這類數據混入訓練數據中,如果質量和量都能提升,對模型成功率和失敗後可逆情況下的自我恢復有很大幫助。世界模型天然對數據的依賴性會小很多。粗略估計,相比以模仿學習為基礎範式的方式,可能能小2/3的數據依賴量。因為模仿學習很多時候是靠堆數據獲得概率分佈的高質量性——汽車不撞路牙子,可能就是因為看到了百萬次、千萬次的軌跡沒有壓路牙子。

但我們人,小朋友騎幾次兩輪車也就知道碰路牙子什麼後果了。賈奎:我們可能遠遠低估了實現通用物理AI對數據的要求。人簡單對著面前

Related

相關文章

IT之家生成式AI

DeepSeek-V4-Flash-Vision-Exp 模型已開源,多模態 Agent 能力接近 Opus-4.8

首頁 > 智能時代>人工智能 DeepSeek-V4-Flash-Vision-Exp 模型已開源,多模態 Agent 能力接近 Opus-4.8 2026/8/31 19:35:24 來源:IT之家 作者:遠洋 責編:遠洋 評論: 感謝IT之家網友 fakepheonix、軟媒新友2156291、Domado、陳倔強123 的線索投遞! IT之家 8 月 31 日消息,剛剛,DeepSeek V4 首個多模態模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上線,採用 MIT License 開源。公開內容包括模型文件、Tokenizer、Prompt Encoding 參考實現,以及最小化 PyTorch 推理實現,覆蓋視覺編碼器、Aligner、DFlash Attention、MoE、Hyper-Connections 與 DSpark 等核心模塊。據IT之家瞭解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列首款原生支持圖片輸入的視覺模型,官方明確標註為“Exp”實驗版本,於 2026 年 8 月 21 日上線 DeepSeek API 平臺。該模型支持在文本之外輸入圖片,可以讓模型描述圖片、識別截圖中的文字、分析圖表等。支持的圖片格式包括 JPEG、PNG、GIF、WebP。深度求索官方表示,V4-Flash-Vision-Exp 在各類 Agent 框架內展現出了較好的多模態適配能力,能夠有效支持大家藉助多樣化的 Agent 工具解鎖更多實用的工作場景。在 Agent、推理、世界知識等純文本任務上與 V4-Flash 正式版持平,原有優勢完整保留。在需要視覺理解的 Agent 基準測試中較 V4-Flash 大幅提升,多模態 Agent 能力已接近 Opus-4.8。 投訴

剛剛
鈦媒體生成式AI

對話COCO Matrix高宇翔:難以提前窮舉世界,不如「學習適應」世界

這是今天很多泛化研究在解決的問題。另一個問題是,碰到真的不會的東西,它要多久才能學會?這是我們更關心的問題。比如一個機器人從來沒有見過某種咖啡機。第一種思路是希望訓練數據足夠豐富,讓它以前見過類似的咖啡機,所以第一次就能操作。這個能力當然非常重要。

剛剛

今天,“人工智能”這個學科誕生70年了

24分鐘前剛剛,OpenClaw 2. 0來了,龍蝦升級1小時前Mac mini缺貨原因找到了,OpenAI、Anthropic都在搶7小時前閱讀更多內容,狠戳這裡查看AI測評ECDeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇Claude Max 20x在哪兒? 200刀只管5小時Claude Max 20x 虛假宣傳:真實周額度只有 5x 的兩倍!

剛剛

一塊GPU,Claude爆肝48小時自我對齊,效率狂飆15000倍

一款名為 Claude 的 AI 模型近日在一項實驗中展現出驚人的自我對齊能力,僅憑單張 GPU 的算力,便花了 48 小時完成自我調整,整體效率據稱提升了 15,000 倍。這個結果在 AI 圈引發熱議,也讓外界再度關注模型在自動優化與對齊上的可能性。所謂對齊,指的是讓 AI 的行為更貼近人類意圖,過去這類工作往往需要大量人工標註與回饋,成本極高。 這次的做法則是讓 Claude 自行運作、在有限的運算資源下持續修正自己的輸出。

剛剛