實時世界模型進入“全科生”階段,PixVerse R2先交卷!

2026年9月23日 14:19
實時世界模型進入“全科生”階段,PixVerse R2先交卷!
站內 AI 整理稿

畫面更夯,控制更細,但一旦走到實時生成這一步,繼續往上做能力,就會有個很難繞開的坎: 能力越強,實時越難守,整個行業也因此苦既要又要的增長難題久矣。更麻煩的是,實時世界模型還得面對世界模型的共性難題,相比LLM,能力想沿著穩定路徑持續增長也沒那麼容易。然而,這個困擾行業多年的實時世界模型的老bug,如今,已經有廠商用實際模型完成驗證並跑出了答案—— 實時性和通用能力,世界模型可以全都要。這個玩家的名字大家應該不陌生:愛詩科技。其實今年1月的時候,愛詩就發佈了首個通用實時世界模型R1,主打持續生成能力,當時直接在網上火出圈了一波。就在這兩天,全新的實時世界模型PixVerse R2,也上線了。

甚至一經上線,模型就直接衝到了X平臺的熱度總榜—— 這回,R2直接把LLM裡那套規模繼續加、能力繼續漲的Scaling邏輯,真正搬進實時世界模型裡。基於統一可擴展的世界模型框架,R2把完整的時空關係壓進模型,讓場景能夠沿著時間持續演化,前後狀態保持一致,讓這個世界真正「記得住」。不僅如此,R2還把文字、圖像、聲音、動作統一進模型,邊生成邊響應、音畫同步,讓世界真正「控得動」。比如下面這個探險世界,用戶不僅可以控制方向,還能基於Prompt控制場景角色,而且畫面是實時生成的內種: 文章鏈接: https://mp.weixin.qq.

com/s/h-YfJ-3Vd1rKuwgsZtbhQA 當然,腦洞完全可以再大一點,比如遊戲劇情也能DIY,一句指令就能改變眼前世界,世界劇情真·隨意拿捏了: 文章鏈接: https://mp.weixin.qq.com/s/h-YfJ-3Vd1rKuwgsZtbhQA 過去實時世界模型最大的難題之一,就是能力一旦往上堆,速度、穩定性和交互性往往也開始彼此拉扯。當實時和通用能力同時成立,世界模型的能力邊界和使用邊界也會一起外擴,逐漸進入遊戲、虛擬交互等場景。一種新的數字世界底座,這回,開始有了成形的可能。

從Scaling到能力預算,實時世界模型連撞兩堵工程牆 說實話,還真不能怪實時世界模型這麼多年一直卡在能力增長這件事上。主要在於,實時世界模型想把能力繼續往上做,前面先橫著技術工程上的兩道「硬門檻」。其中第一道門檻,便是整個視覺世界建模都繞不開的一道表徵難題:「信息」到底該怎麼被統一表示和建模?雖同樣都隸屬模型大類,世界模型在這件事上的先天條件,其實真沒LLM那麼友好。。。LLM裡的第二個L,就是Language(語言)。好巧不巧的是,語言其實在信息形態上天然就佔了便宜,因為它可以被壓縮成一套離散、序列化的符號系統。

在這套體系下,每個Token都是邊界清晰的語義單元,海量文本都可以被統一成有限符號的排列組合,訓練任務也被高度歸一為「預測下一個Token」。於是,數據、參數和算力都能沿著同一套框架持續擴展,資源投入也更容易穩定轉化為能力增長,這正是LLM能夠充分釋放Scaling潛力的底層前提。但扎心的是,到了世界模型這裡,這套邏輯就沒那麼順了。(doge) 因為圖像和視頻是一種連續、高維且高度冗餘的信息形態,色彩、光影連續變化,單個畫面就包含海量視覺變量,相鄰像素和視頻幀之間又存在大量重複。此外,模型還得從這些原始信號中進一步抽取語義、狀態變化乃至物理關係,信息結構遠比文本複雜。

也因此,視覺領域長期缺少一套像文本Token那樣緊湊、統一、可持續擴展的表徵體系,視頻模型想沿著同一條路徑持續增長,天然要難得多。△AI生成 當然了,這還只是第一層難題。因為一旦再加上實時兩個字,難度還會再高一檔,這也是實時世界模型面對的第二層門檻: 模型容量和實時計算預算天然互相拉扯。想維持穩定實時生成,每一幀留給模型的計算窗口可能只有幾十毫秒,可世界模型想理解更多場景、更復雜的物理關係和更長程的時空變化,又需要更大的模型容量、更復雜的建模,以及更多計算。這也解釋了為什麼,過去世界模型的擴展更多停留在局部能力上—— 畫質、時長、場景各自往前猛堆,卻很難匯成一條穩定、統一的增長曲線。

這個兩難問題,甚至早已被頭部模型反覆驗證。2024年,Google DeepMind 11B參數的Genie已經能生成可交互環境,但到了Genie 2,場景和物理能力繼續增強,實時性卻更難兼顧,想跑到實時往往需要以蒸餾為代價,同時還要犧牲部分畫質。換句話說,對實時世界模型而言,真正難的從來都不是單獨把模型做大,或者單獨把速度做快,而是讓通用能力和實時運行能夠同時成立。△Google DeepMind Genie 2報告 PixVerse R2:實時世界模型終於有了自己的增長曲線 所以說到這兒,實時世界模型碰到的難題就很清楚了。

想把實時性和通用能力一起做上去,先得解決一個底層問題——更多數據、任務和交互信號,怎麼持續進入同一套能力體系。前面我們說過,LLM能夠持續Scaling,一個重要前提,就是語言本身擁有相對統一的Token表示和序列建模方式。但對於實時世界模型來說,模型面對的不只有視覺,還包括動作、音頻、長短不一的時間尺度,以及不斷進入的各種控制信號!!這些信息的數據形態、時間粒度和作用方式都不一樣,想讓這些能力繼續一起增長,首先就得把它們收進一條統一的建模主線裡。而PixVerse R2這次做的一件關鍵的事—— 便是把視覺、動作、音頻、時序以及不同控制信號,放進同一套可持續擴展的因果建模框架。

需要提一嘴的是,這裡的Scaling可不單單指的是模型大小,還包括世界複雜度、控制力,以及怎麼穩定運行~ 更關鍵的是,當這些原本異構的信號開始被放進同一種表示體系裡,複雜動態的世界也就有機會擁有一套類似語言Token的統一計算座標系。而這觸及的也是Scaling最底層的問題—— 新增的數據、任務和交互經驗,能不能持續沉澱進同一個能力體系,並形成複利。具體來說,R2把Scaling拆成了模型、數據、任務、控制信號和時間尺度五個彼此「協同增長」的維度。模型規模決定容量,數據拓寬世界分佈,任務強化跨場景遷移,控制信號增加交互精度,時間尺度則決定模型能把多長、多複雜的動態過程納入建模。

任意一個維度增加資源,都能反過來增益其他維度,模型的整體能力就會上漲,不依賴單純擴大參數量。這也就意味著R2真正擴展的,已經開始從參數規模進入世界狀態空間本身。其實傳統Scaling走到後期,一個越來越現實的問題,就是資源繼續往上堆積,能力增益卻未必還能同比例增長,新增算力和數據的邊際收益開始變薄。反觀R2做的事情,更像是在世界模型身上重做投入產出邏輯,讓每一份新增資源都擁有更多能力出口,最終更充分地沉澱為整體模型能力。

落到咱用戶真實體驗上,就是生成質量更高、長程一致性更穩、跨場景泛化更強,多模態控制也更細~ △AI生成 當然了,多說無益,這實時世界模型R2到底能不能打,我們直接看實際效果~ 先插一句,這次R2相比上一代R1,能玩的東西明顯更多了。就比如我們不僅能在賽博世界中玩耍,甚至還能體驗互動影遊和實時數字人。先來個小試牛刀,前陣子剛看完《奧德賽》,於是我索性一頭扎進了一個奧德賽草原風格的世界裡,現場勇闖一下: 真別說,多少有點玩家、導演、編劇三權合一內味兒了~(doge) 文章鏈接: https://mp.weixin.qq.

com/s/h-YfJ-3Vd1rKuwgsZtbhQA WASD一按,視角和方向隨便轉動,Prompt一敲,角色動作、劇情走向也能直接改,可控性確實不錯。最重要的是,實際體驗下來,幾乎沒有卡頓和延時問題,實際在場感確實強,實時性也確實絲滑。接下來我們再上一波難度,直接玩一把互動影遊,體驗一把在魔法學院裡魔法大亂鬥: 文章鏈接: https://mp.weixin.qq.

com/s/h-YfJ-3Vd1rKuwgsZtbhQA 說實話,光看畫面,還真有種穿越哈利波特電影裡的感覺,確實蠻有大片感,畫面質量過關~ 但我最想說的,還不是畫質,大家有沒有發現,在這個互動影遊裡,眼前的世界是可以被你臨時改寫的。比如直接在Prompt框裡輸入想使出的攻擊魔法,下一秒畫面就會順著你的指令繼續往下演,確實有點爽。。。一段內容生成出來,實時性、畫面、交互、記憶這些能力都能同時在線。省下來的時間和精力,終於可以花在一件更重要的事上——到底想創造一個什麼樣的世界。能力先拉滿,實時再追回來 當然,問題也來了,R2到底是如何做到「實時」和「通用」能力既要又要的?

核心的答案,其實藏在其對底層技術路徑的重新拆分上。過去行業做實時生成底層技術設計,其實大多是在一筆固定的計算預算裡「做減法」。幀率和延遲一旦鎖定,單幀算力預算也基本見頂。行業往往只能靠縮模型、減採樣、壓計算,把重模型塞進毫秒級窗口,生成質量、複雜運動和長程一致性也會隨之受損。但R2的一個關鍵技術設計思路是:讓能力和實時分頭強化。先把基礎模型的能力上限做高,再解決實時化,這樣實時世界模型的天花板就不會過早被單幀計算預算鎖死,而更多取決於底層模型本身能學到多少世界規律。

這也是R2整個技術體系裡,Omni Causal AR和Real-Time Acceleration兩層架構真正的分工,前者管能力上限,後者管實時性。對於想持續Scaling的實時世界模型來說,一大難題在於模態、控制信號和時間尺度越加越多,建模很容易越做越碎。所以第一步,Omni Causal AR先把短視頻、長視頻、多模態參考、音頻和Action控制,統一進一套因果自迴歸框架—— 通過動態Chunk適配不同時間尺度,再用Hybrid Teacher/Diffusion Forcing、多時間尺度記憶和Error Bank解決長程生成中的誤差累積、角色漂移和狀態斷裂問題。

這樣一來,新增數據、任務、控制信號和模型規模,都可以持續轉化為更強的世界建模能力~ 這邊能力先做高之後,Real-Time Acceleration再接手第二道題—— 把這套通用能力直接蒸餾進實時加速層。持續預訓練後,Omni Causal AR先把生成質量、長程狀態和因果能力做紮實,再作為Teacher和Student共同的能力底座,讓後續蒸餾儘可能沿用同一套世界理解邏輯,把這套能力更完整地壓進實時預算裡。先造大腦,再給大腦做實時加速器,實時世界模型,這事兒成了。說實話,愛詩能把實時世界模型在行業裡率先跑出來,算不上太偶然。

長期面對億級用戶,意味著這家公司面對的一直都是真實世界裡最難處理的那部分: 需求高度分散、場景持續變化、長尾永遠收不完,模型每天都在被用戶用各種意想不到的方式重新「考試」。而世界模型最終要面對的,恰恰也是同一類問題:如何在一個持續變化、充滿噪聲、隨時會被外部輸入打斷的環境裡,維持狀態、理解變化,並繼續推演下一刻。R2這種先放大能力、再單獨解決實時效率的路線,也更像是長期產品實踐和技術積累自然形成的一種架構選擇。當然了,更值得注意的是,這套架構一旦成立,它的外溢價值就很難只停留在視頻生成層面。

在未來,內容生產、具身智能、虛擬人、遊戲實時渲染,都可能逐漸匯向同一種底層能力: 持續理解環境、維持狀態,並根據外部輸入實時生成下一瞬間。甚至在互動式娛樂市場這個生態場景裡,這種變化可能會更明顯。劇情、場景和角色不再只是預先寫好的固定內容,其會逐漸變成可以隨著用戶行為持續展開、持續變化的動態系統。到那時創作者需要親自定義的,也許會越來越少是某一幀、某一段資產,而越來越多地轉向一個世界如何運轉、角色如何行動,以及規則本身。由此,互動娛樂真正進入的,可能是一個「內容不再被完成」的時代。我們不再只是觀看故事、操控角色、通關世界。

我們開始真正生活在一個會回應你、記住你,並因為你的存在而改變的數字世界裡。版權所有,未經授權不得以任何形式轉載及使用,違者必究。

Related

相關文章

量子位生成式AI

DeepSeek新論文公開Agent訓練!梁文鋒署名

DeepSeek發表新論文,公開了名為DSec的Agent訓練基礎設施細節,該系統每秒可產生5000多個沙盒,每天達300萬個,並採用多層級隔離與鏡像按需加載等技術。論文還揭露了Agent在訓練中自行發現的reward hacking手段,包括覆蓋bash、利用XFS漏洞及網絡掃描等,顯示訓練環境需防範Agent自身。該論文由梁文鋒署名,已於arXiv公開。

剛剛
量子位生成式AI

Qwen一號位定了!劉大一恆接棒

阿里巴巴正式任命劉大一恆為Qwen LLM項目負責人,接替半年前離職的林俊暘。劉大一恆是四川大學博士,曾入選華為天才少年計劃,2021年加入阿里,參與Qwen早期預訓練及多代模型開發。他將帶領Qwen團隊,下一步聚焦「真實世界智能體」方向。

剛剛
量子位生成式AI

Jev vs Decitron:同為決策AI,為什麼不是一回事?

它來自TypeSafe AI。這支有OpenAI背景的團隊沒有繼續卷生成和推理,而是換了個方向:讓AI直接做判斷。他們甚至把口號直接寫成:Decisions, not strings(要決策,不要文本)。Jev的走紅,也讓“Decision”(決策)重新成為AI圈的熱門詞。

剛剛

Win11 驚現 AI 惡意軟件 ClosedQuorum:入侵後自主決策,專挖最有價值信息

該惡意軟件主要針對 Windows 11 平臺,會在成功入侵用戶電腦後調用谷歌 Gemini、DeepSeek、Qwen 和 Mistral 等 AI 模型自主決策,專門挖掘攻擊目標最有價值的信息。調用 Gemini、DeepSeek 等模型,入侵後自主決策Talos 深入分析後發現,ClosedQuorum 在成功入侵目標設備後,會藉助多個 AI 模型來決策攻擊方案,包括竊取瀏覽器登錄憑證、提取加密貨幣信息、持久化執行惡意軟件,以及向其他設備橫向散播惡意軟件。

剛剛