雷峰網生成式AI

從生成到行動,生數科技用通用世界模型連接「兩個世界」

2026年7月22日 00:48

重點摘要

在世界人工智能大會(WAIC)的展館裡,機器人通常是最搶鏡的一類展品。機械臂抓取物體、人形機器人聽從指令完成家務,“世界模型”也常常伴隨這些演示出現,用來解釋機器人如何理解環境、預測變化並完成行動。久而久之,世界模型似乎逐漸成為機器人和自動駕駛領域的專屬概念。

站內 AI 整理稿

# 從生成到行動:生數科技用通用世界模型連接「兩個世界」

在世界人工智能大會(WAIC)的展館裡,機器人向來是最搶鏡的展品之一。機械臂精準抓取物體、人形機器人聽從指令完成家務,「世界模型」這個概念也經常伴隨這些演示出現,被用來解釋機器人如何理解環境、預測變化並完成行動。久而久之,世界模型似乎逐漸成為機器人和自動駕駛領域的專屬名詞。但在生數科技創始人、清華大學人工智能研究院副院長朱軍看來,通用世界模型並不只服務於某個單一場景,其核心目標是通過統一的基座與架構,實現對世界的理解、預測與行動。

7月20日,在生數科技與萬興科技聯合承辦的「世界模型驅動下的AI影視生產力新範式」專題論壇上,朱軍明確提出,世界模型不是視頻模型的升級版,也不是語言模型的延伸產物,而是人工智能從「生成內容」邁向「理解世界、推演世界、實時交互世界」的全新範式。這項判斷的關鍵在於,基於同一套底層基座,模型既可以在像素空間生成高質量的視頻內容,也可以在動作空間輸出機器人可執行的精確動作。換句話說,AI視頻與具身智能並非兩條割裂的技術路線,而是世界建模能力在數字世界和物理世界中的不同延伸。這也是理解生數科技通用世界模型戰略的核心切入點。## 世界模型的核心,不只是「預測下一幀」

世界模型究竟需要具備什麼能力?朱軍將其概括為三個層次:理解、想象和行動。首先,模型要感知並理解當前環境的狀態;其次,要能夠預測不同輸入或動作可能帶來的變化;最後,還要把理解和預測轉化為可執行的決策。這與人類學習騎車、開車等技能的過程高度相似——人在採取動作前,會預判不同操作的結果,再選擇更安全、更穩定的方案。因此,世界模型不只是生成一個看起來真實的未來畫面,也不只是簡單地預測下一幀視頻,而是要形成從理解當前狀態、推演未來變化到指導實際行動的完整閉環。機器人當然是這套能力最直觀、要求也最高的應用之一,但絕非唯一的應用場景。數字內容同樣需要世界建模。

圖片記錄的只是一個瞬間,視頻則包含時間、空間和狀態的連續變化。人物運動時,身體、衣服和背景要保持合理變化;鏡頭切換後,角色外貌、服裝和空間位置不能無故改變;隨著內容延長,模型還需要處理物體關係、事件順序和環境狀態的一致性。視頻模型不僅要知道物體「長什麼樣」,還要學習它如何運動、如何與環境發生關係,以及一個狀態如何演變為下一個狀態。當然,能夠生成連貫的視頻並不等同於擁有完整的通用世界模型能力,但視頻生成所要求的時空建模、動態預測和狀態一致性,確實為模型進一步走向實時交互和物理行動提供了不可或缺的基礎。## 視頻數據,是構建通用世界模型的重要底座

從第一性原理出發,構建通用世界模型需要解決兩個核心問題:數據和架構。過去,大模型通過通用架構、規模化數據和算力形成了Scaling Law。要讓世界模型從特定場景的小模型走向通用基座,同樣需要大規模、多樣化的數據支撐。生數科技將相關數據歸納為一個從互聯網視頻到機器人實採軌跡的「數據金字塔」,其中包括通用視頻、第一視角人類動作視頻、合成數據和機器人軌跡數據。這些數據的差異主要體現在規模和精度上。互聯網視頻規模龐大,記錄了大量人物、物體、環境、動作及其時空關係,影視劇、紀錄片、監控視頻和第一視角影像都保存了真實世界運行的重要信息。

而機器人軌跡數據雖然能夠提供關節角度、控制信號、力反饋和動作結果,但採集成本高昂,規模遠小於互聯網視頻。過去,由於缺少動作標註和機器人控制信號,通用視頻很難直接用於從狀態到動作的學習。但隨著視頻生成模型的發展,模型可以通過預測和重建視頻,學習空間、時間、動作和結果之間的深層關係,視頻數據也因此成為世界模型大規模預訓練的重要基礎。不過,視頻數據不能替代機器人數據。視頻可以告訴模型動作在視覺上如何發生、環境如何變化,卻無法完整提供機器人執行所需的關節角度、力反饋、本體狀態和控制信號。

更合理的路徑是,先通過海量視頻學習通用的世界規律,再通過機器人數據補充精確的動作知識和物理反饋:前者拓展世界模型的認知廣度,後者提升行動的精準度。## 從Vidu到Motubrain,同一套能力的逐步延伸

如果只看產品形態,生數科技從視頻生成走向具身智能,像是一次橫跨兩條賽道的業務擴張。但從其模型發展路徑來看,這更像是視頻建模能力向實時交互和物理行動的自然延伸。生數科技從成立之初便定位於基礎模型,並將視頻建模作為技術起點。在模型訓練過程中,團隊逐漸發現,視頻模型的能力上限並不只體現在畫質、時長和生成效果上。隨著數據和模型規模擴大,模型對人物、物體、空間關係與動態變化的理解也在持續增強。這意味著,視頻模型學習的不只是如何生成畫面,還包括世界如何隨時間變化。模型對時空結構、運動規律和狀態演化理解得越深入,就越有可能從內容生成進一步走向實時交互,乃至物理行動。

過去兩年,視頻基模也經歷了從展示技術可能性到進入真實生產環節的快速演進。以Vidu Q1為例,其推出的參考生視頻能力,允許用戶通過主體參考圖生成角色和視覺元素相對一致的視頻,讓視頻模型從隨機生成工具進一步走向可控制、可複用的生產工具。對於生數科技而言,這個過程強化了一個重要判斷:高質量視頻基模不僅能夠服務內容生產,其在大規模訓練中形成的時空理解、動態預測和狀態一致性能力,完全可以遷移至更廣泛的智能任務。在架構層面,生數科技採用Mixture-of-Transformer(MoT)架構,將環境理解、世界狀態預測和動作軌跡生成整合至統一框架。基於這一架構,三款產品分別承擔不同層級的任務。

世界生成模型Vidu支持文生視頻、圖生視頻、參考生視頻等多種創作方式,持續提升主體與場景一致性、運動表現、物理合理性及鏡頭控制能力。實時交互模型Vidu S1則將外部輸入納入生成循環,用戶可以通過語音指令讓角色實時改變表情、動作和行為,支持無限時長連續生成。世界動作模型Motubrain則將輸出從數字內容變為機器人可以執行的動作,定位於具身智能機器人的通用大腦。三款產品分別回答了三個遞進的問題:能否生成一個持續變化的數字世界?能否讓這個世界根據外部輸入實時更新?能否將對世界的理解和預測轉化為物理行動?它們不是三款產品的簡單並列,而是同一套世界建模能力從生成、交互到行動的逐步延伸。

## 數字世界與物理世界如何形成互補

生數科技同時佈局數字世界和物理世界,不只是因為二者可以共享底層技術,還因為兩條路線有可能在數據、反饋和能力驗證上形成互補循環。數字世界的優勢在於數據規模大、使用頻率高、試錯成本低。海量視頻可以幫助模型學習物體運動、人物行為和環境變化;廣告、短劇、影視和互動內容的生產,又能持續產生真實的用戶反饋。物理世界則提供更精確的動作數據和更嚴格的因果檢驗。機器人必須遵守真實空間中的尺寸、接觸、受力和運動約束,任務是否完成、物體是否被碰倒、動作是否安全穩定,無法依靠視覺效果來掩蓋。概括來說,數字世界幫助模型擴大對世界的認知範圍,並提供更快的產品反饋;物理世界則檢驗這些認知能否轉化為準確、穩定的行動。

生數科技這條路線真正值得觀察的,是二者能否形成正向循環:視頻預訓練為機器人提供通用世界知識,機器人行動為視頻模型補充物理約束,數字內容的規模化使用和商業回報則為長期的基座模型訓練提供持續支撐。這也是通用世界模型戰略最具想像空間、同時也最需要實際驗證的部分。## 最終仍要接受生產力的檢驗

過去一輪大模型發展,人工智能主要從語言和靜態知識中學習規律。世界模型則進一步將學習對象擴展至空間、時間、狀態變化和行動後果,這讓視頻生成、實時數字角色和機器人控制進入了同一個技術命題。對生數科技而言,Vidu不是通用世界模型戰略之前的舊業務,Motubrain也不是與視頻割裂的新方向。前者生成數字世界,Vidu S1讓數字世界接受實時反饋,後者則嘗試將理解和預測轉化為物理行動。在數字世界,要看模型能否提高內容可用率、減少返工並降低生產成本;在物理世界,則要看機器人能否走出仿真和演示,在不同本體、任務和動態環境中長期穩定運行。

當內容生成、實時交互與物理行動逐步建立在同一套世界建模能力之上,人工智能也將從理解和生成信息,進一步走向理解世界、預測世界,並行動於世界。對生數科技而言,這既是從Vidu走向Motubrain的技術路徑,也是其押注通用世界模型的長期邏輯所在。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

剛剛
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

8 分鐘前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

9 分鐘前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

13 分鐘前