從生成到行動,生數科技用通用世界模型連接「兩個世界」
重點摘要
在世界人工智能大會(WAIC)的展館裡,機器人通常是最搶鏡的一類展品。機械臂抓取物體、人形機器人聽從指令完成家務,“世界模型”也常常伴隨這些演示出現,用來解釋機器人如何理解環境、預測變化並完成行動。久而久之,世界模型似乎逐漸成為機器人和自動駕駛領域的專屬概念。
# 從生成到行動:生數科技用通用世界模型連接「兩個世界」
在世界人工智能大會(WAIC)的展館裡,機器人向來是最搶鏡的展品之一。機械臂精準抓取物體、人形機器人聽從指令完成家務,「世界模型」這個概念也經常伴隨這些演示出現,被用來解釋機器人如何理解環境、預測變化並完成行動。久而久之,世界模型似乎逐漸成為機器人和自動駕駛領域的專屬名詞。 但在生數科技創始人、清華大學人工智能研究院副院長朱軍看來,通用世界模型並不只服務於某個單一場景,其核心目標是通過統一的基座與架構,實現對世界的理解、預測與行動。7月20日,在生數科技與萬興科技聯合承辦的「世界模型驅動下的AI影視生產力新範式」專題論壇上,朱軍明確提出,世界模型不是視頻模型的升級版,也不是語言模型的延伸產物,而是人工智能從「生成內容」邁向「理解世界、推演世界、實時交互世界」的全新範式。 這項判斷的關鍵在於,基於同一套底層基座,模型既可以在像素空間生成高質量的視頻內容,也可以在動作空間輸出機器人可執行的精確動作。換句話說,AI視頻與具身智能並非兩條割裂的技術路線,而是世界建模能力在數字世界和物理世界中的不同延伸。這也是理解生數科技通用世界模型戰略的核心切入點。 ## 世界模型的核心,不只是「預測下一幀」
世界模型究竟需要具備什麼能力?朱軍將其概括為三個層次:理解、想象和行動。首先,模型要感知並理解當前環境的狀態;其次,要能夠預測不同輸入或動作可能帶來的變化;最後,還要把理解和預測轉化為可執行的決策。這與人類學習騎車、開車等技能的過程高度相似——人在採取動作前,會預判不同操作的結果,再選擇更安全、更穩定的方案。 因此,世界模型不只是生成一個看起來真實的未來畫面,也不只是簡單地預測下一幀視頻,而是要形成從理解當前狀態、推演未來變化到指導實際行動的完整閉環。機器人當然是這套能力最直觀、要求也最高的應用之一,但絕非唯一的應用場景。 數字內容同樣需要世界建模。圖片記錄的只是一個瞬間,視頻則包含時間、空間和狀態的連續變化。人物運動時,身體、衣服和背景要保持合理變化;鏡頭切換後,角色外貌、服裝和空間位置不能無故改變;隨著內容延長,模型還需要處理物體關係、事件順序和環境狀態的一致性。視頻模型不僅要知道物體「長什麼樣」,還要學習它如何運動、如何與環境發生關係,以及一個狀態如何演變為下一個狀態。 當然,能夠生成連貫的視頻並不等同於擁有完整的通用世界模型能力,但視頻生成所要求的時空建模、動態預測和狀態一致性,確實為模型進一步走向實時交互和物理行動提供了不可或缺的基礎。 ## 視頻數據,是構建通用世界模型的重要底座
從第一性原理出發,構建通用世界模型需要解決兩個核心問題:數據和架構。過去,大模型通過通用架構、規模化數據和算力形成了Scaling Law。要讓世界模型從特定場景的小模型走向通用基座,同樣需要大規模、多樣化的數據支撐。 生數科技將相關數據歸納為一個從互聯網視頻到機器人實採軌跡的「數據金字塔」,其中包括通用視頻、第一視角人類動作視頻、合成數據和機器人軌跡數據。這些數據的差異主要體現在規模和精度上。互聯網視頻規模龐大,記錄了大量人物、物體、環境、動作及其時空關係,影視劇、紀錄片、監控視頻和第一視角影像都保存了真實世界運行的重要信息。而機器人軌跡數據雖然能夠提供關節角度、控制信號、力反饋和動作結果,但採集成本高昂,規模遠小於互聯網視頻。 過去,由於缺少動作標註和機器人控制信號,通用視頻很難直接用於從狀態到動作的學習。但隨著視頻生成模型的發展,模型可以通過預測和重建視頻,學習空間、時間、動作和結果之間的深層關係,視頻數據也因此成為世界模型大規模預訓練的重要基礎。 不過,視頻數據不能替代機器人數據。視頻可以告訴模型動作在視覺上如何發生、環境如何變化,卻無法完整提供機器人執行所需的關節角度、力反饋、本體狀態和控制信號。更合理的路徑是,先通過海量視頻學習通用的世界規律,再通過機器人數據補充精確的動作知識和物理反饋:前者拓展世界模型的認知廣度,後者提升行動的精準度。 ## 從Vidu到Motubrain,同一套能力的逐步延伸
如果只看產品形態,生數科技從視頻生成走向具身智能,像是一次橫跨兩條賽道的業務擴張。但從其模型發展路徑來看,這更像是視頻建模能力向實時交互和物理行動的自然延伸。 生數科技從成立之初便定位於基礎模型,並將視頻建模作為技術起點。在模型訓練過程中,團隊逐漸發現,視頻模型的能力上限並不只體現在畫質、時長和生成效果上。隨著數據和模型規模擴大,模型對人物、物體、空間關係與動態變化的理解也在持續增強。這意味著,視頻模型學習的不只是如何生成畫面,還包括世界如何隨時間變化。模型對時空結構、運動規律和狀態演化理解得越深入,就越有可能從內容生成進一步走向實時交互,乃至物理行動。 過去兩年,視頻基模也經歷了從展示技術可能性到進入真實生產環節的快速演進。以Vidu Q1為例,其推出的參考生視頻能力,允許用戶通過主體參考圖生成角色和視覺元素相對一致的視頻,讓視頻模型從隨機生成工具進一步走向可控制、可複用的生產工具。對於生數科技而言,這個過程強化了一個重要判斷:高質量視頻基模不僅能夠服務內容生產,其在大規模訓練中形成的時空理解、動態預測和狀態一致性能力,完全可以遷移至更廣泛的智能任務。 在架構層面,生數科技採用Mixture-of-Transformer(MoT)架構,將環境理解、世界狀態預測和動作軌跡生成整合至統一框架。基於這一架構,三款產品分別承擔不同層級的任務。世界生成模型Vidu支持文生視頻、圖生視頻、參考生視頻等多種創作方式,持續提升主體與場景一致性、運動表現、物理合理性及鏡頭控制能力。實時交互模型Vidu S1則將外部輸入納入生成循環,用戶可以通過語音指令讓角色實時改變表情、動作和行為,支持無限時長連續生成。世界動作模型Motubrain則將輸出從數字內容變為機器人可以執行的動作,定位於具身智能機器人的通用大腦。 三款產品分別回答了三個遞進的問題:能否生成一個持續變化的數字世界?能否讓這個世界根據外部輸入實時更新?能否將對世界的理解和預測轉化為物理行動?它們不是三款產品的簡單並列,而是同一套世界建模能力從生成、交互到行動的逐步延伸。 ## 數字世界與物理世界如何形成互補
生數科技同時佈局數字世界和物理世界,不只是因為二者可以共享底層技術,還因為兩條路線有可能在數據、反饋和能力驗證上形成互補循環。 數字世界的優勢在於數據規模大、使用頻率高、試錯成本低。海量視頻可以幫助模型學習物體運動、人物行為和環境變化;廣告、短劇、影視和互動內容的生產,又能持續產生真實的用戶反饋。物理世界則提供更精確的動作數據和更嚴格的因果檢驗。機器人必須遵守真實空間中的尺寸、接觸、受力和運動約束,任務是否完成、物體是否被碰倒、動作是否安全穩定,無法依靠視覺效果來掩蓋。 概括來說,數字世界幫助模型擴大對世界的認知範圍,並提供更快的產品反饋;物理世界則檢驗這些認知能否轉化為準確、穩定的行動。生數科技這條路線真正值得觀察的,是二者能否形成正向循環:視頻預訓練為機器人提供通用世界知識,機器人行動為視頻模型補充物理約束,數字內容的規模化使用和商業回報則為長期的基座模型訓練提供持續支撐。這也是通用世界模型戰略最具想像空間、同時也最需要實際驗證的部分。 ## 最終仍要接受生產力的檢驗
過去一輪大模型發展,人工智能主要從語言和靜態知識中學習規律。世界模型則進一步將學習對象擴展至空間、時間、狀態變化和行動後果,這讓視頻生成、實時數字角色和機器人控制進入了同一個技術命題。 對生數科技而言,Vidu不是通用世界模型戰略之前的舊業務,Motubrain也不是與視頻割裂的新方向。前者生成數字世界,Vidu S1讓數字世界接受實時反饋,後者則嘗試將理解和預測轉化為物理行動。在數字世界,要看模型能否提高內容可用率、減少返工並降低生產成本;在物理世界,則要看機器人能否走出仿真和演示,在不同本體、任務和動態環境中長期穩定運行。 當內容生成、實時交互與物理行動逐步建立在同一套世界建模能力之上,人工智能也將從理解和生成信息,進一步走向理解世界、預測世界,並行動於世界。對生數科技而言,這既是從Vidu走向Motubrain的技術路徑,也是其押注通用世界模型的長期邏輯所在。
Related
相關文章

DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs
首頁 > 智能時代>人工智能 DeepSeek-v3 671B 測試:英偉達 Blackwell GB300 刷新 MoE 預訓練世界紀錄,每 GPU 算力 1648 TFLOPs 2026/7/22 14:20:55 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,英偉達昨日(7 月 21 日)發佈博文,宣佈其 Blackwell GB300 刷新 MoE 預訓練的世界紀錄,每 GPU 算力達 1648 TFLOPs(每秒萬億次浮點運算)。IT之家注:MoE(混合專家模型)是一種機器學習模型架構。它將大型模型分割為多個更小的“專家”子網絡,每次推理或訓練時僅激活其中一部分。該架構旨在以更低的計算成本實現更大規模的模型容量,常用於大語言模型以提升效率。模型預訓練是指在大規模無標註數據集上,利用自監督學習方法讓模型初步掌握通用的語言規律、視覺特徵或常識。在最新博文中,英偉達表示:使用 256 塊 GPU 預訓練 DeepSeek-v3 671B 模型,GB300 NVL72 實現了每 GPU 吞吐 1648 TFLOPs 的全新世界紀錄。在相同訓練任務上,GB300 NVL72 用更少的 GPU 硬件,達到了相同的性能。英偉達表示在過去 6 個多月時間裡,通過模擬超過 25 萬種不同配置,為 Blackwell 摸索發現了 38 項重大優化方案,累計進行了 140 萬小時的 GPU 優化測試。相比較 2025 年 11 月的預訓練測試(1088 TFLOPs)結果,GB300 NVL72 系統性能優化提升 50%。與上一代 GB200 每 GPU 606 TFLOPs 的成績相比,GB300 實現了約 3 倍的性能躍升。廣告聲明:文內含有的對外跳轉鏈接(包括不限於超鏈接、二維碼、口令等形式),用於傳遞更多信息,節省甄選時間,結果僅供參考,IT之

Claude Cowork 新增錄屏教學:用戶演示一遍即可教會 AI
首頁 > 智能時代>人工智能 Claude Cowork 新增錄屏教學:用戶演示一遍即可教會 AI 2026/7/22 13:48:04 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 22 日消息,@claudeai 官方賬號昨日(7 月 21 日)在 X 平臺發佈推文,邀請 Pro、Max 以及 Teams 訂閱用戶,體驗 Claude Cowork 中的“錄製技能”(Record a skill)功能。

安謀科技公開新一代NPU架構 並牽頭髮起開源AI操作系統聯盟
安謀科技在2026世界人工智能大會上首次公開新一代NPU架構「周易」X3-Pro,並牽頭髮起開源AI操作系統聯盟AIOS,展現從IP授權公司轉向平台型生態的意圖。該公司提出三條技術路徑因應端側AI資源受限問題,並推出星辰300異構計算平台,同時聯合多家晶片與模型廠商成立AIOS聯盟,以擴大在終端產品端的影響力。

天立啟鳴發佈教育AGI白皮書:破解教育“不可能三角”
天立啟鳴於WAIC 2026發布《世界模型驅動的教育AGI白皮書》,提出以認知世界模型為核心的技術架構,試圖破解教育質量、成本、規模難以兼顧的「不可能三角」。該白皮書已落地107所學校、服務超過25萬師生,並在2026年高考中獲得86.22%的漲分率驗證。

大廠AI入口大戰升級,誰是最能幹活的桌面Agent?
大廠AI入口大戰升級,誰是最能幹活的桌面Agent?劃重點KeyPoints2026.07.22 11:57 · 來自浙江全文4694字00:00 / 13:42實測騰訊WorkBuddy、字節豆包專業版、百度搭子、阿里QoderWork文 | 劃重點KeyPoints,作者|心怡,編輯|重點君互聯網大廠間的AI入口大戰打到了桌面端。先說一條剛出爐的消息。

Kimi K3其實“賤賣”了
Kimi K3其實“賤賣”了超聚焦2026.07.22 10:50 · 來自湖北全文4824字00:00 / 13:57別拿DeepSeek攬Kimi的活。文 | 超聚焦Kimi K3,可能是月之暗面成立以來最接近“封神”的一次。在7月17日公佈的Artificial Analysis獨立測試中,K3以57分登上綜合智能指數全球第三,超過Claude Opus 4.