智東西生成式AI

Matrix-Game 3.5WAIC首發!開源世界模型一哥,這次要“造世界”不只是“拍視頻”

2026年7月21日 12:16
Matrix-Game 3.5WAIC首發!開源世界模型一哥,這次要“造世界”不只是“拍視頻”

重點摘要

崑崙萬維於WAIC 2026正式發表世界模型Matrix-Game 3.5,主打長期記憶、相機控制與實時交互等技術升級,可在單張GPU上實現720P解析度、約20FPS的即時影片生成。該模型堅持開源策略,已成為英偉達、Adobe等國際大廠世界模型的對比基準,目標是從遊戲場景擴展至真實物理世界。

站內 AI 整理稿

世界人工智能大會 WAIC 2026 期間,崑崙萬維旗下 Skywork 團隊正式發布了世界模型 Matrix-Game 3.5。這款模型能夠根據用戶的動作與事件指令,持續生成可交互的虛擬世界,並在長時間生成過程中保持場景結構、空間佈局、角色身份與動態內容的一致性,為遊戲、機器人、具身智能與 XR 等應用提供可持續交互的生成基礎。 回顧過去一年,世界模型無疑是 AI 領域最受關注的方向之一。過去 18 個月內,全球世界模型相關企業累計吸納超過 100 億美元投資,圖靈獎得主楊立昆(Yann LeCun)甚至預言,三到五年內世界模型將取代大語言模型成為主流 AI 範式。然而,技術瓶頸也隨之浮現:長期記憶能力薄弱、相機控制精度不足、實時交互能力有限,多數產品仍停留在「生成視頻」而非「交互世界」的階段。更重要的是,市面上主流世界模型普遍缺乏對物理規則的理解,例如模型能生成一條狗跑動的畫面,卻不明白狗的四條腿為何按特定順序落地。 Matrix-Game 3.5 正是在這樣的背景下誕生。Skywork 團隊從模型吞吐優化、DiT 推理優化和 VAE 解碼優化三個層面,構建了完整的系統級加速方案,實現端到端實時推理。在模型吞吐方面,團隊透過蒸餾將採樣步數壓縮至 3-step Sampling,並設計分塊因果推理(Chunked Causal Inference),結合 KV Cache、Patch Latent 與預測 Latent,在維持生成品質的同時顯著提升單次推理吞吐,降低多步採樣帶來的延遲。DiT 推理優化則針對推理熱點進行系統性調整,包括 FFN INT8 量化、Memory Retrieval Optimization 以及 Torch.compile 等加速技術,幾乎不影響模型效果即可進一步降低耗時。VAE 解碼優化方面,團隊採用 3.0 版本中的 MG-LightVAE,對 Wan2.2 VAE Decoder 進行約 75% 結構化剪枝,在保持接近原始重建品質的前提下大幅降低解碼延遲。最終,Matrix-Game 3.5 在單張 GPU 上即可實現 720P 解析度、約 20FPS 的實時流式視頻生成。 除了即時生成能力,Matrix-Game 3.5 在長期記憶、動靜態解耦、相機控制精度與輕量化框架四個面向展現出差異化優勢。長期記憶方面,早期版本直接存儲歷史幀,推理時檢索相關幀拼入上下文,不僅佔用大量窗口,跨幀拼接也容易出現畫面衝突。3.5 版本則將歷史幀切分為三維座標系下的空間塊,檢索時按空間位置匹配,再重組成當前視角的記憶圖,讓畫面一致性更高、相機軌跡更穩定,且記憶可隨時更新、替換、刪除。這套名為 Patch Memory 的機制,是業界首個幾何對齊的 Patch 級長期記憶機制。行業評測顯示,主流世界模型的「物體重現得分」多數低於 0.6,意即相機離開後再回來,場景中的物體可能消失;Patch Memory 則能將局部圖像 patch 作為基本記憶單元,在空間上按需檢索、對齊與複用歷史內容,讓模型在相機重訪場景時準確找回先前觀察過的空間內容。 動靜解耦記憶機制則讓 Patch Memory 專注於記憶靜態場景結構,同時以主體參考 Token 維持動態主體的身份一致性。動態物體在寫入記憶前會被過濾,避免移動物體被誤認為多個靜態物體。相機控制精度方面,傳統視頻模型使用的 3D RoPE 僅編碼時間與二維空間位置,難以表達不同視角之間的真實幾何關係。Skywork 團隊發現,過去將鼠標信號透過 Self-Attention 注入、鍵盤信號透過 Cross-Attention 注入的做法,每次加入參數都會破壞模型對原始視頻分佈的認知,需要大量額外訓練修復基礎能力。3.5 版本改為採用相機位姿相對編碼 PRoPE 機制,讓模型透過相機投影矩陣直接感知相機相對位姿,並結合 Warped RoPE 重新定義記憶 Patch 在當前視角下應出現的位置,使位置編碼從簡單的時空索引升級為具備幾何語義的世界表示。此外,輕量化交互框架是另一亮點:除角色 Reference Adapter 外,核心功能幾乎不需新增模型參數即可實現交互世界建模,並能快速適配不同視頻基礎模型。 世界模型的發展瓶頸,除了架構設計,更大挑戰來自數據。互聯網視頻的數據分佈與世界模型所需的物理世界數據存在本質差異:網路內容多為娛樂性質,甚至包含反物理規律的畫面;世界模型需要的是接觸豐富、包含推拉擰拽等動作、涵蓋柔性物體、摩擦力、流體等真實物理交互的數據。更棘手的是數據規模,國際領先大語言模型的預訓練數據已達 100 萬億 Token,等效約 100 億小時的說話量;物理世界數據資訊密度遠低於文本,要實現更高階的物理常識判斷,可能需要「億小時」量級的真實世界數據。Skywork 團隊為此建置了三條自動化數據生產管線:第一條基於 Unreal Engine 5 的自主探索管線,在 UE5 中搭建常見遊戲場景,部署 RL Agent 自由探索,同步採集視覺畫面、動作狀態與語義資訊;第二條為跨遊戲自動化控制與探索管線,涵蓋《GTA V》《荒野大鏢客2》《賽博朋克2077》等主流 3A 遊戲,實現自動控制、探索、錄製與標註;第三條則是開放平台視頻自動挖掘管線,從開放平台獲取遊戲視頻,透過 VLM 評分篩選高品質片段,自動完成鏡頭切分、過濾與結構化標註。此外,團隊還建置了自動化離線標註管線,為每條視頻估計相機位姿、米制深度與相機內參,並基於多模態大模型開發視頻 Prompt 自動標註系統,以固定長度視頻窗口為標註單元,生成時序一致的統一描述,顯著降低標註成本。同時,Scene-Quality 自動評估系統可對每個場景進行多維品質分析,輸出統一的品質評分。 Matrix-Game 系列從 1.0 到 3.5,進化路徑清晰。2025 年 3 月發布的 1.0 版本是早期可交互世界模型的概念驗證;2025 年 8 月的 2.0 版本實現單卡 B100、720P 解析度下 25FPS 的實時交互,成為業界首個開源方案;2026 年 3 月的 3.0 版本則以 5B 參數蒸餾模型達成 720P 下 40FPS 的實時生成,補齊了記憶、長時程與實時性三大短板。此次正式發布的 3.5 版本最大變化是從遊戲場景向真實場景全面擴展,支援多風格動態切換與指令控制,引入 NPC 交互能力,並全新升級長時記憶能力。Matrix-Game 系列始終堅持開源策略,此前 DiT 作者、紐約大學助理教授謝賽寧團隊基於 Matrix-Game 2.0 開源底座發布了全球首個多人視頻世界模型 Solaris,從學術圈實際使用印證了該開源方案的基礎模型價值。英偉達與浙大聯合發布的 Light Interaction 工作基於 Matrix-Game 3.0 研發,英偉達的 SANA-WM 與 Adobe 的 RELIC 等國際頭部大廠世界模型工作,均將 Matrix-Game 相關模型作為對比基準。 崑崙萬維董事長兼 CEO 方漢在 WAIC 2026 專場論壇上給出判斷:2026 年是「世界模型元年」。他認為,今年世界模型的技術路線將逐漸收束,數據與訓練的難題也會被逐一攻破。Matrix-Game 3.5 的定位正是回應這個判斷——它不是只做渲染,也不是只做規劃,而是把狀態理解與動作生成放在同一框架中訓練,讓模型同時學會「理解世界」與「行動於世界」。這款模型也是崑崙萬維「4+3」AGI 戰略的核心組成部分,在該戰略框架下,視頻模型 SkyReels、音樂模型 Mureka、世界模型 Matrix-Game 與基座文本及多模態模型構成四大技術底座,AI 短劇、AI 音樂、AI 遊戲三大平台經濟體則承載商業化落地。在 WAIC 2026 期間,崑崙萬維集中完成了四大核心模型的全球首發,世界模型是其中關鍵的一塊拼圖。Matrix-Game 3.5 正式亮相後,行業關注的不只是其技術參數,還有它能否真正跨越遊戲與物理世界之間的那道門檻——而崑崙萬維的目標,指向的是更廣闊的物理世界。

Related

相關文章

智東西生成式AI

WAIC現場直擊:端側算力競賽爆發,聆思手握下一代AI終端落地關鍵籌碼

智東西(公眾號:zhidxcom) 作者 | 程茜 編輯 | 漠影 智東西7月21日報道,剛剛落幕的世界人工智能大會(WAIC 2026)上,掀起了一場終端智能硬件的集中爆發浪潮。 縱觀整場大會,行業賽道最直觀的轉向清晰可見:AI賽道的焦點正在從扎堆雲端超算集群、以參數規模和雲端算力論高下,向手機、AI PC、人形機器人、智能座艙、全屋中控等泛終端硬件轉移。 AI的落地形態也隨之革新。

剛剛
IT之家生成式AI

阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升

首頁 > 智能時代>人工智能 阿里千問 Qwen3.8-Max-Preview 最新版本已上線,前端表現獲提升 2026/7/21 19:29:06 來源:IT之家 作者:遠洋 責編:遠洋 評論: IT之家 7 月 21 日消息,據千問大模型官方消息,Qwen3.8-Max-Preview 最新版本已上線,能力又有提升,前端(WebDev)表現會更好。千問大模型稱:“Qwen3.

剛剛

WAIC觀點:最快兩年,迎來機器人“ChatGPT時刻”

在2026世界人工智能大會上,具身智能企業聚焦機器人真實場景落地,業界認為最快兩年內將迎來機器人「ChatGPT時刻」。然而,訓練世界模型仍面臨數據、表徵與閉環三大挑戰,各企業在數據來源與模型架構上各有不同策略。

剛剛

在下一個模型發佈之前

賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

剛剛