實時世界模型竟然能這麼玩?PixVerse R2登上Twitter熱榜

(公眾號:zhidxcom) 作者 | 畢偉豪 編輯|漠影 近日,一款實時世界模型在海外走紅,9月22日上線當天就登上了X(Twitter)趨勢榜第二。它為什麼會引發這麼大的關注?有海外網友認為,這款模型帶來的變化,是讓AI生成從“創作視頻”轉向“與AI世界互動”。還有網友稱讚這不像是看視頻,更像是身臨其境。這就是愛詩科技(AIsphere)最新發布的實時世界模型——PixVerse R2所呈現的效果,在PixVerse R2創造的世界中,用戶可以移動、說話,做出選擇。用戶輸入的每一個提示詞、做出的每一個動作,都會實時改變眼前的場景,甚至讓劇情走向不同的方向。
回過頭來看,AI誕生以來,世界最直觀的變化,是內容產生變得更快了,用戶輸入提示詞,就能得到一篇文章、一段代碼、一張圖片或者一條視頻。此前的生成大多以一次性交付為終點:提示詞觸發一段內容,生成結束,這次過程也隨之關閉。如何讓歷史狀態、當前輸入與後續生成形成連續的因果鏈,讓AI創造的是一個可以被進入、被持續操控和改變的世界,正是實時世界模型探索的重要方向。這也是愛詩科技(AIsphere)正在探索的方向。今年1月,愛詩科技發佈PixVerse R1通用實時世界模型,開始讓用戶進入AI實時生成的世界。與傳統視頻生成不同,用戶可以在生成過程中持續輸入指令、改變行動,模型也會隨之更新眼前的場景。
PixVerse R1首先證明了實時、連續、可交互的音視頻生成可以成立;R2則進一步處理這個實時生成的世界,讓用戶可以在其中移動、探索,也可以通過不同的行為改變眼前的環境和後續發展。R2的正式上線,也讓實時世界模型又一次進入大眾視野並引起熱議。▲PixVerse R2上線當天登上X(Twitter)趨勢榜 接下來,讓我們看一些真實的畫面。一、PixVerse R2實機演示:從看視頻到進入世界 進入PixVerse World後,我最先體驗的是一個草原越野的世界。我開著車在草原上馳騁,只需要通過WASD鍵,就能完成加速、轉向、爬坡等操作。
更有意思的是,操作並不侷限於移動,我還可以隨時給這個世界“加東西”,比如召喚一隻雄鷹站到車上、讓彩虹出現在指定位置,甚至直接把車點燃。這裡真正吸引人的,其實是輸入之後的反饋速度。整個過程中,我不需要退出場景、重新生成,也不用等待一段視頻渲染完成,操作和世界變化基本是連續發生的。進入逃離戰區這個世界以後,我發現不僅人物可以自由移動,輸入指令後還可以做出成功撤離的慶祝動作、召喚閃電或者身上發出代表勝利的金光。只不過這一次,背後不是遊戲開發者預先寫好的資源,是AI在即時響應。而且人物在跑動的時候,持槍姿勢也很專業,跳躍和轉向都很流暢,可以一邊移動一邊改變方向,整個過程不會因為一次操作就把交互打斷。
《草原奧德賽》這個世界也非常有趣,輸入提示詞後,我操控的人物身上直接長出翅膀飛起來了,覺得飛太高還能打開降落傘。整個世界的畫面隨著我不斷輸入提示詞,一直在發生各種各樣的變化。輸入指令後,世界很快就會給出反饋,不會出現傳統生成式產品裡那種“輸入一句話,然後盯著進度條等結果”的割裂感。這是互動影遊《零印法師》,我是真的“玩嗨了”,這個世界本身有比較完整的劇情線:主角從一個沒有法力的“零印”起步,隨著劇情推進簽訂契約、獲得能力,再一路完成逆襲。最主要的是,AI生成世界和劇情並沒有彼此割裂,在體驗過程中,我可以不斷輸入提示詞來操控世界。
比如在打前期一個小Boss的時候,我直接輸入一個“變小狗”的提示詞,下一刻,主角就釋放了一個魔法把Boss變成了一隻金毛。這種體驗和傳統互動遊戲最大的不同就在這裡:玩家不再只能從開發者預先設計好的幾個技能、幾個選項裡做選擇,而是可以直接用自然語言向世界提出要求。從這裡也能看出,PixVerse R2在前端和產品化的一些探索,不僅僅停留在WASD的控制上,還可以承載電影級別的畫質、音效以及有深度的劇情。
從這些案例中,我體驗到的其實是三層不同的交互: WASD控制角色,體現的是實時響應;自然語言改變世界,體現的是指令理解和動態生成;進入互動影遊,則進一步考驗AI能不能把交互、劇情、音效和世界狀態串在一起。這也讓PixVerse R2創造的世界,開始和傳統視頻生成拉開距離。它的目標,是讓用戶能夠持續介入其中,換句話說,用戶從“看視頻的人”,開始變成了這個世界裡的參與者。而問題也隨之出現:當用戶不再只是觀看,而是持續介入一個AI生成的世界時,模型真正需要解決的,就不只是生成速度,還需要記住已經發生的事情並且理解用戶在做什麼,然後讓這個世界穩定運行下去。
二、從R1到R2,真正困難的不是生成世界,是讓世界一直運行下去 關於上面這個問題,愛詩科技已經探尋了很久。2026年1月,愛詩科技推出PixVerse R1通用實時世界模型。和傳統視頻生成一次性輸出一段固定內容不同,R1嘗試讓用戶持續輸入指令、改變動作,模型則實時更新世界狀態,並連續生成音視頻。視頻生成也從確定的結果,變成一個能隨著用戶輸入持續變化的過程。此後半年,愛詩科技繼續沿著實時、交互、世界演化這條線擴展,陸續加入個性化Avatar、Shared Worlds與多人共同輸入。
同時,通過PixVerse Game Engine把實時世界模型與Agent、遊戲機制連接起來,讓目標、規則和狀態變化為實時生成的畫面。8月23日,愛詩科技發佈PixVerse R2技術報告,用Omni Causal AR持續擴展世界建模能力,Real-Time Acceleration則把這些能力帶進實時運行區間。PixVerse R2要解答的問題是:如果AI生成的是一個能夠被用戶持續干預的世界,這個世界究竟要具備什麼能力?
要讓一個AI生成的世界持續運行,模型首先得看懂用戶在做什麼,理解用戶的動作、意圖以及對環境產生的改變; 其次要記住世界發生過什麼,讓前面的交互能夠延續到後面,而不是每次都從頭開始; 同時還要維持世界的一致性,讓畫面、主體和空間關係在長時間運行後依然穩定;最後,還要及時響應用戶的下一步動作,讓世界能夠跟著用戶持續變化。上述要求,對應到PixVerse R2的技術報告中,體現為四個核心能力:長程一致性、多模態控制、因果響應和狀態保持。模型既要理解用戶的文字、語音和動作,又要讓這些輸入真正改變後續世界;既要接住前面發生的事情,又要保證世界運行得越久,角色、場景和空間關係不會逐漸失真。
這些要求放到一個實時世界裡,並不是彼此獨立的。模型理解得越深、需要保持的狀態越多、生成的時間跨度越長,背後需要處理的信息和計算量也會隨之增加,但實時交互又要求模型必須及時給出下一步結果。用戶對下一步變化的預期是就在下一秒發生,模型沒有太多時間把計算慢慢“算完”。於是,一個非常關鍵的問題出現了:如果實時世界模型既要保持實時輸出,又要不斷增強模型能力,它能不能像大模型一樣,找到一條持續Scaling的路徑?三、PixVerse R2,把能力上限和實時運行放進同一條路 事實上,實時世界模型既要不斷提升能力,又要滿足實時交互,這兩個目標天然存在矛盾。
PixVerse R2給出的思路,是把“模型能力”和“實時運行”拆開解決,再把兩者重新放進同一套訓練和推理路徑。具體而言,PixVerse R2通過Omni Causal AR將文字、參考圖像、音頻、動作等不同信號統一納入世界建模,讓模型進一步理解空間、時間以及用戶行為之間的關係,具備持續理解、生成和演化一個世界的基礎。其中最關鍵的是“Causal AR”,讓模型沿著時間持續推進世界,當前的世界狀態會成為下一步生成的依據,由此世界也就可以持續往下發展。Omni Causal AR解決的是實時世界模型的能力上限問題,但模型能力足夠強,並不意味著它就能實時運行。
對於實時世界來說,用戶不會願意去等待模型慢慢生成下一段內容。因此,R2又單獨做了一套Real-Time Acceleration框架,把推理加速等環節接入實時運行過程。這裡一個比較重要的設計是,同一套Omni Causal AR既作為蒸餾Teacher,也作為學生模型的初始化基礎,讓實時模型沿著原本的世界建模能力繼續演化,而不是重新從頭訓練一個只追求速度的模型。這樣一來,R2形成了兩個彼此銜接的核心層次:Omni Causal AR負責持續擴展世界模型的能力上限,Real-Time Acceleration負責將這些能力帶入實時、可交互的運行區間。
技術報告也將兩者概括為一條演進路徑:持續擴大世界模型的能力,再將這些能力穩定加速到實時運行。這條路徑並只對應R2的升級,它是愛詩科技對於實時世界模型Scaling方式的技術回答。PixVerse R2通過Omni Causal AR和Real-Time Acceleration的組合,將實時世界模型的能力擴展與實時運行連接起來。更重要的是,R2並沒有把Scaling簡單理解為擴大規模,而是將實時世界模型的擴展拆分為模型、數據、任務、控制信號、時間尺度五個維度。
這五個維度並不是彼此獨立的,模型規模決定能力上限,數據和任務決定模型能夠覆蓋的世界範圍,控制信號決定用戶能夠通過多少種方式介入世界,時間尺度則決定模型能否在更長時間裡保持世界狀態並持續演化。從這個角度看,R2探索的是一條從能力提升、實時加速到持續Scaling的路徑:讓這些維度能夠沿著同一套訓練路徑繼續擴展,並最終轉化為實時世界模型的能力增長。結語:從“生成一段視頻”到“創造一個世界” 從文章、代碼、圖片到視頻,生成式AI過去解決的,更多是“給我一個結果”,通用模型正在改變這個狀態。
當模型能夠理解用戶行為,並根據已經發生的狀態繼續生成,AI交付的就不再是一段固定內容,而是一個可以被進入、被操控、不斷變化的世界。PixVerse R2探索的,正是從“生成內容”到“生成世界”的演變過程。遊戲之外,互動影視、虛擬角色、教育培訓、工業仿真等場景,同樣存在大量需要根據用戶行為實時變化的內容。過去,這些變化需要提前設計和製作;未來,其中一部分可能在用戶真正進入之後才發生。這或許才是通用實時世界模型真正打開的空間——讓AI負責一個世界的誕生和運轉。
Related
相關文章

MiMo-V2.6剛發,小米羅福莉扔出MiMo-V3新架構!引用DeepSeek多項成果
(公眾號:zhidxcom) 作者 | 江宇 編輯 | 李水青 9月24日報道,昨晚,小米MiMo大模型負責人羅福莉發文,提前披露了MiMo-V3的新架構,其核心組件HySparse2率先登場,相關技術論文同步公佈。▲羅福莉發文 簡單來說,這套新架構主要解決Agent越做越多輪之後出現的三個問題:長輸入算得太多、緩存佔得太大,以及如何從越來越長的上下文裡準確找到需要的信息。

OpenAI、Anthropic同日模型大戰,“是兄弟就砍一刀”
光錐智能2026.09.24 16:43 · 來自廣西全文3968字00:00 / 10:28刀刀見骨,AI巨頭為自己畫過的大餅“填窟窿”文|光錐智能,作者 | 魏琳華 ,編輯|劉俊宏9月23日凌晨,OpenAI和Anthropic像約好了一樣,前後腳各自放出新模型:OpenAI端出了GPT-6 Sol和GPT-6 Luna兩款模型,把旗艦GPT-6 Astra的能力蒸進更快更便宜的型號裡;Anthropic則亮出Claude Opus 5.5,性能追平Fable 5.1的同時,成本只有上代Opus 5的六成。

騰訊混元推出"騰訊 Hy 翻譯"App:支持 33 種語言互譯,覆蓋 5 種民族語言
該產品基於騰訊混元 Hy-MT2 翻譯模型打造,支持 33 種語言互譯,並覆蓋 5 種中國少數民族語言及方言,提供語音翻譯、拍照翻譯與離線翻譯等多種方式。離線可用、覆蓋港澳臺及東南亞據介紹,離線翻譯模式下用戶可提前將翻譯模型下載至手機,在沒有網絡或信號不佳時仍能穩定使用。

谷歌確認新一代旗艦 Gemini 4 即將推出:已進入後訓練,有望遠早於年底
所謂後訓練,是在基礎模型完成後進一步調整、提升行為可靠性的階段。跳過 3.5 Pro,直接押注 Gemini 4卡武克奧盧希望 Gemini 4 在"遠早於年底"的時間點推出,並稱正儘快拿出後訓練階段的早期成果,"因為我們看到了結果,也很振奮",隨後谷歌會繼續快速迭代。

消息稱DeepSeek年化收入突破10億美元,擬募資500億元衝刺上交所上市
該業績躍升主要得益於近期產品定價的上調,以及其系列模型在開發者與企業端持續攀升的採用率。DeepSeek首席執行官梁文峰在近期舉辦的投資者會議上披露了這一核心財務數據。此舉被視為在資本市場關鍵節點提振投資人信心的重要舉措——目前DeepSeek正接近完成第二輪融資,並緊鑼密鼓地籌備在上海證券交易所上市。

谷歌確認新一代旗艦模型 Gemini 4 即將推出,有望不用等到年底
作者:清源 責編:清源 評論: 9 月 24 日消息,The Information 當地時間 23 日舉辦的 AI Agenda Live 峰會上,谷歌 DeepMind 負責人科拉伊 · 卡武克奧盧透露,谷歌新一代旗艦模型 Gemini 4 即將推出,現已進入開發流程中的後訓練初期。