越大越強,不再是 LLM 的專利:PixVerse R2 攻克實時世界模型 Scaling 難題
AI 視頻的下一戰:誰能讓世界保持運行 作者丨Reah 編輯丨李娜 岑峰 大語言模型已經用 Scaling 證明模型、數據和算力可以持續換來更強能力,必須一邊生成、一邊回應用戶的實時世界模型,能不能也走上這樣一條路?2026 年 1 月,愛詩科技提出“通用實時世界模型”這一產品方向,並推出 R1。目前,PixVerse R2 已全量上線用戶可以直接進入網頁端體驗動作指令和互動影遊的相關交互01實時世界模型,能走上 LLM 的 Scaling 之路嗎過去幾年,Scaling 最具確定性的成功故事來自大語言模型。
隨著模型容量、訓練數據和計算規模持續擴大,語言模型獲得了更強的理解、推理與泛化能力,“越大越強”也由此成為大模型產業最重要的認知基礎之一。但如果把這條經驗遷移到世界模型的話,問題就複雜很多,不能只是簡單地繼續放大視頻生成模型。語言模型可以在接收問題後集中計算再給出答案,但實時世界模型卻必須一邊運行,一邊接收用戶的動作、文字和聲音,同時繼續輸出連貫的音視頻內容。於是這形成了一組長期存在的矛盾:實時要求模型足夠快、足夠高效,通用則要求模型足夠強、見過足夠豐富的世界。模型能力向上擴展,計算負擔就要隨之增加;如果為了速度持續壓縮能力,實時體驗又容易停留在只能完成有限演示的專項模型。
為什麼實時世界模型不能簡單複製 LLM 的 Scaling?為什麼“快”和“強”會互相拉扯?PixVerse R2 給出了自己的答案——把能力與效率拆成兩層推進,具體的實現機制我們會在後文展開更詳細的討論。R2 將五類增長納入同一可擴展框架,使生成質量、長程一致性和多模態控制能夠共同提升02一次生成,怎樣變成一個持續運行的世界?進入 PixVerse R2 實時生成的世界“冬日宮殿”,用戶面對的是一個真實仍在運行的世界。WASD 和方向鍵用於控制移動與視角,新的指令可以繼續改變當前體驗;每次操作之後,頁面不會退回獨立的生成流程,用戶仍然留在同一個世界裡,決定下一刻發生什麼。
技術報告中的 Scaling 最終需要回到產品端接受檢驗:它能否讓用戶真正進入一個世界,而不是在一段視頻上疊加幾個控制按鈕?為此,我們除了進行實機體驗,還進一步分析了冬日宮殿會話的 HAR 網絡記錄。HAR 可以被理解為瀏覽器網絡活動的飛行記錄儀,它雖然沒辦法直接看見模型內部,但能幫我們記錄一次產品會話究竟怎樣被組織。本輪會話最關鍵的事實是客戶端全程只觀察到一次 sessioninit 和一次 generationstarted。此後八輪系統推薦 Prompt 共享同一條內容流,提示歷史從第一輪連續累積到第八輪,客戶端沒有為每一輪輸入重新預約資源、初始化會話或切換媒體通道。約 119.
5 秒的生成窗口裡,所有操作都被組織在同一條持續 session 中。這意味著,從用戶可見的產品流程看,八輪 Prompt 並不是八個彼此獨立的視頻任務拼湊起來的,而是當前世界下一步如何變化的連續控制輸入。也就是說,一次生成不再以交付文件為終點,還要成為後續行動不斷發生的環境。多輪輸入持續發生在同一產品會話;該數據反映客戶端協議,不外推服務端內部子任務在同一會話中,HAR 還記錄到 3,355 條結構化 actionframe。這些動作幀的發送間隔中位數約為 29.944 毫秒,折算頻率約 33.4Hz。
用戶按住 W、組合方向或調整鏡頭時,客戶端持續發送的是一條高頻、低層控制流,而不是把“向前走”轉寫成一句偶爾觸發的文字命令。這看似只是交互細節,實際對應著世界模型產品化的重要分水嶺。傳統 AI 視頻中的 Prompt 決定內容大致長成什麼樣,而在持續世界裡,Action 決定用戶此刻正在做什麼。當 Prompt 和 Action 能夠進入同一個運行過程,用戶與模型的關係才會從提出要求、等待結果,進一步變成進入環境、持續行動。WASD 以高頻結構化 Action 流進入實時會話,而不是被轉寫成一條文字 Prompt語言與動作也不需要輪流佔用這個世界。
每輪 Prompt 從發送到 promptgenerated 大約經歷 3.9 至 4.5 秒;在第三至第八輪中,Prompt 發出後約 8 至 26 毫秒,Action 就繼續進入控制通道,每個對應窗口內又持續發送了約 129 至 152 條動作幀。也就是說,處理語義指令時,WASD 通道仍然保持開放,兩類輸入可以同時進入一條運行中的世界會話。這正是“多模態控制”從技術名詞走向產品體驗的關鍵一步。它讓用戶不必在動作模式和語言模式之間反覆切換,可以在移動、觀察和探索的過程中繼續發出新的語義意圖,為邊行動、邊改變世界的體驗建立真實通道。
Prompt 處理期間,Action 仍持續進入同一會話;該圖證明協議並行,畫面效果由連續錄屏補充延遲數據進一步說明了這條實時鏈路怎樣工作。八輪推薦 Prompt 發出後,服務端 promptupdated 的中位耗時約為 1.33 秒,與愛詩所說的“約 1—2 秒響應”處在相同區間;完整 promptgenerated 事件的中位耗時約為 4.27 秒。前者代表當前世界流中的指令狀態已經更新,並不等同於用戶恰好在 1.33 秒看見完整目標變化,但它說明從接收、審核到世界流更新,R2 已經建立起一套秒級 Prompt 協議鏈路。R2 的 Prompt 響應分為多個協議階段;1.
33 秒是協議更新時間,不等同於完整視覺執行耗時冬日宮殿也展示了 R2 當前對外開放的產品形態。初始化消息顯示,它由一張首幀和 345 個字符的 world setting 啟動,同時配置了風格、音樂和 Action 等基礎信息,並未設置 presetvideouri。從客戶端可見流程看,頁面沒有播放一段預置底片,而是通過 pipeline=r2 返回持續生成的實時媒體。
Winter Palace 從首幀和世界設定啟動,由 R2 pipeline 持續返回實時媒體綜合來看,World 層已經把官方所說的控制信號與時間尺度 Scaling 外化成同一產品會話裡的 Text、Action 和持續媒體。更多輸入不再意味著更多彼此割裂的生成任務,而是共同作用於一個仍在運行的世界。03世界能力,怎樣被組織成一段更長的敘事?如果說冬日宮殿展示的是“世界怎樣持續回應用戶“,那麼互動影遊 Zero Mark 展示的,則是這套能力“如何進入一段更長、更有結構的內容產品”。
兩者在界面上已經呈現出明確分工:World 直接提供 WASD、鏡頭和 Prompt,強調自由移動與即時變化;Story 則以結構化劇情選擇和電影化演出組織長敘事,同時保留文本入口,為固定分支之外的變化預留空間。HAR 進一步確認,兩者採用了不同的產品 pipeline。Winter Palace 運行在 r2 pipeline 中,Zero Mark 則使用 director pipeline。後者維持了一條約 20 分鐘的長 session:53 次有效狀態響應始終指向同一脫敏 session,狀態保持為 ACTIVE,媒體通道也沒有改變。
同一長會話中還出現了多次媒體軌道分段切換,與 Director 的段落化編排形態相吻合;頁面記錄則確認了多次結構化劇情選擇,以及一次文本入口點擊。World 強調持續生成和低層控制,Story 強調長敘事的編排與節奏,兩者承擔不同產品任務Zero Mark 展示的是一條用 Director 維持長敘事的產品化路徑。在本輪網絡記錄中,同一會話裡同時出現了結構化選擇、實時媒體,以及八段預先準備的 1080p、24fps 關鍵電影資產。它們共同守住關鍵敘事節點的節奏與電影完成度,併為世界模型提供的開放變化留下入口。這種分工讓生成式內容更接近一個可穩定交付的互動產品。
World 提供腳本難以窮舉的開放性,Director 負責把變化組織進劇情結構,關鍵資產則確保重要演出具有穩定完成度。任務與時間尺度的 Scaling,因而不只體現為模型能生成更多畫面,也體現為模型能力開始被組織進一條更長、更完整的互動敘事。Zero Mark 以 Director 長會話組織關鍵電影資產、結構化選擇與實時媒體,使長敘事兼顧開放性、節奏與完成度04技術解法:R2 如何讓能力與效率不再互相妥協?PixVerse R2 上線後迅速登上twitter 熱度總榜我們在產品端看到的是一個持續會話,模型層要解決的則是能力如何擴展、擴展以後又如何保持實時。
過去的多階段路線往往需要在不同模型和訓練目標之間反覆遷移,每增加一種任務、數據或控制信號,都可能增加系統複雜度,並折損上游已經獲得的畫質、運動、控制和長程能力。PixVerse R2 給出的答案是把能力與效率拆到兩個層次分別推進:Omni Causal AR 負責持續抬高世界模型的能力上限,Real-Time Acceleration 再把上游能力帶回低延遲、可交互的運行區間。按照官方定義,R2 的 Scaling 同時發生在模型容量、數據、任務、控制信號和時間尺度五個維度上,最終轉化為用戶能夠感知的三類結果:更高的生成質量、更強的長程一致性,以及更豐富的多模態控制。
這也是“越大越強不再是 LLM 的專利”真正對應的技術命題。R2 並不只想在現有能力與速度曲線上尋找一個折中點,而是希望通過分層架構,讓實時通用世界模型擁有一條可以繼續擴展的系統路徑。Omni Causal AR 是 R2 的能力引擎,目標是把文字、參考圖、聲音和 Action 納入統一的因果世界模型。它用 Dynamic Chunk 適配不同控制信號的時間粒度,通過分層的歷史與對象狀態機制維持長期錨點、近期動態和關鍵對象,再借助 Error Bank 等設計,讓模型學習如何從已經發生的偏差中繼續運行。
這一層負責持續吸收更多模型容量、數據、任務、控制信號和時間尺度,把世界模型的能力上限盡可能做高。Real-Time Acceleration 則是加速引擎。R2 不讓一個新的少步模型從頭學習整個世界,而是從同一個 Omni Causal AR 基礎初始化 Student 與蒸餾 Teacher,再通過同源蒸餾、稀疏計算和金字塔式少步生成,將上游已經獲得的生成、控制和長程能力盡可能完整地帶回實時區間。按照官方公開口徑,這套系統還試圖把世界模型壓縮到消費級單卡可以實時運行的範圍,使更強的基礎模型不必天然意味著更遠離用戶的離線演示。
這就是品牌方所說的從五層接力到兩步直達:先窮盡能力邊界,再攻克效率邊界——讓能力與效率分工,而不是讓一個模型永遠在質量和速度之間做靜態妥協。官方技術材料解釋了內部訓練與加速機制,本輪測試中 HAR 則從產品端說明,這條路徑已經能夠承載持續會話、高頻 Action、多輪 Prompt 和實時媒體。R2 先擴展世界模型能力上限,再通過獨立加速層將能力帶入低延遲運行區間05從文件到 Session:世界模型真正改變的是什麼?▎PixVerse 為什麼走向實時世界?模型、C 端與實時系統愛詩走到 R2,首先源於對問題的不同定義。
它沒有去持續追問怎樣再生成一段更長的視頻,而是去思考怎樣讓生成內容成為一個用戶可以進入、可以行動、還願意繼續停留的世界。R1 先把生成視頻轉變為持續交互過程,R2 再把擴大能力上限與壓入實時運行拆成兩個層次,這條演進路線從一開始就同時包含模型問題與產品問題。AI 視頻基礎模型為這條路線提供了高質量生成起點。PixVerse 長期面對的是人物、鏡頭、運動、風格和敘事等真實創作需求,因此在進入世界模型時,天然更關注視覺完成度、內容表達和複雜場景。PixVerse WASD 實時世界體驗錄屏愛詩的 C 端和出海基因,則讓實時世界模型更早進入真實使用。按照官方口徑,PixVerse 已擁有全球 1.
5 億用戶,並從 2026 年 1 月起向普通用戶開放世界模型體驗。用戶會連續輸入,會在系統仍在運行時繼續操作,也會用意想不到的方式探索能力邊界。真實產品場景因此能夠更早暴露問題,並持續為產品與模型迭代提供反饋。與此同時,一次可用體驗還需要資源調度、實時控制、內容審核、音視頻傳輸、會話管理和結果歸檔共同工作。愛詩同時積累生成算法與大規模實時系統工程,使它能夠把實時世界模型從研究能力轉化為普通用戶點開就能進入的環境。C 端實時服務又會把延遲、併發和單位算力成本直接變成產品約束,因此 Real-Time Acceleration 不是基礎模型完成後的附加優化,而是整條路線本身的一部分。
R2 同時面向普通用戶、開發者和內容創作者開放,實時世界模型由技術預覽走向真實產品反饋▎世界模型正在競爭什麼?世界模型正在沿幾條不同路線快速抬高能力邊界。Google DeepMind 的 Genie 3 強調高分辨率、數分鐘一致性與 Agent 訓練;Decart Oasis 3 把低延遲、多視角和 Physical AI 部署作為重點;World Labs Marble 選擇先生成可持久、可編輯和可導出的顯式 3D 世界;HappyOyster、Odyssey 等路線,則分別向實時漫遊、導演模式和通用交互視頻推進。它們分別代表能力、部署效率、顯式空間和產品形態的不同方向。
如果用能力與通用性作為橫軸,用實時交互效率與產品可運行性作為縱軸,傳統方案往往需要在一條曲線上選擇位置:更強的模型可能運行得更慢,更快的模型又可能只覆蓋少量任務。R2 通過 Omni Causal AR 與 Real-Time Acceleration,讓能力和效率擁有可以分別推進的結構;它希望做到的,不只是在現有曲線上找到一個更好的靜態座標,而是讓整條曲線具備繼續向右上移動的可能。更強的模型可能運行得更慢,更快的模型又可能只覆蓋少量任務R2 的產品落地也構成了這套技術座標的一部分。
它不只提出兩層 Scaling 框架,還把 Action、Prompt、實時媒體、Director 長會話、C 端入口和 API 放進實際產品系統中。它的差異不僅來自一個新模型,也來自把模型、運行時和消費產品共同設計的路徑。▎當內容從文件變成 session,生成式娛樂會怎樣變化?AI 視頻與實時世界模型最根本的差別肯定不在於多了幾個控制鍵。AI 視頻的產品單位是文件:用戶輸入、等待,然後獲得一個可保存、可剪輯、可傳播的結果。實時世界模型的產品單位則開始變成 session:用戶進入、行動,世界持續回應;會話結束後仍然可以歸檔一段視頻,但視頻已經從最終目的變成這段共同經歷的記錄。
當內容單位從文件變成 session,行業關注的指標也會隨之變化。單幀畫質和成片時長依然重要,但輸入到反饋需要多久、狀態可以維持多長時間、用戶能否基於剛才的變化繼續行動、一次偏差後能否繼續運行,以及一條 session 能否容納更多角色、任務和參與者,都會成為新的產品競爭變量。世界模型創造的價值是讓內容能夠在每個用戶使用它的當下持續變化。
由此,一套生成式娛樂技術棧開始變得清晰:World Model 提供開放世界的生成與模擬能力,Agent 或 Director 負責理解意圖並維持任務與敘事結構,Runtime 管理狀態、輸入、媒體和實時反饋,Assets 與 Rules 則守住關鍵內容的完成度、安全性和可控性。這是從當前產品現象中抽象出的產業框架,而不是 PixVerse 官方公佈的服務端拓撲;它說明基礎模型決定上限,產品架構決定這些能力能否被穩定消費。
該圖根據產品與 HAR 現象形成,用於說明世界模型從能力走向內容產品所需的系統分工今天,普通用戶先進入官方搭建的世界,創作者與 PixVerse 共建互動影遊;接下來,API 和更完整的創作工具有機會讓遊戲、互動影視、直播、營銷與虛擬角色團隊定義自己的世界設定、劇情錨點和可生成區間。生成能力帶來的不只是少製作幾段素材,而是讓同一份內容面對不同用戶時,可以當場生長出不同過程。
PixVerse WASD 實時世界體驗錄屏再從長期看,如果模型能夠繼續容納更多任務、控制信號和時間尺度,Runtime 又能支撐更長會話、更多參與者與跨終端狀態,那麼世界模型就可能從內容工具進一步變成生成式數字世界的基礎設施。R2 已經開放了一組用戶可以直接進入的產品起點,並讓這條路徑獲得了真實體驗:生成不再只負責生產結果,也開始負責維持環境。06R2 還沒有解決什麼?目前,R2 還不是一套已經完成的遊戲引擎,也不是用戶可以從零創造一切的完全開放世界。實測中,從點擊 Explore 到首幀可見,耗時約為 7.
86 秒,其中包含資源預約、頁面加載、連接實時服務和首輪生成;進入世界後,推薦 Prompt 的 promptupdated 協議事件中位耗時約為 1.33 秒,完整 promptgenerated 事件中位耗時約為 4.27 秒。第一次進入世界和進入後的指令響應,已經成為兩條可以分別優化的產品鏈路。從模型 Demo 走向面向大規模用戶的產品,下一階段的考題將自然轉向冷啟動、資源調度、長會話穩定性和單位算力效率。Scaling 的意義,也不只是讓模型在理想條件下變得更強,而是讓這些能力能夠在真實約束中持續服務更多用戶。07當一次生成不再結束,實時世界模型會走向哪裡?
Winter Palace 的兩分鐘會話說明,R2 已經把三千多條動作幀和八輪推薦指令組織進同一個持續 session;Zero Mark 則展示了 Director 長會話如何進一步為開放能力補上敘事結構與電影完成度。PixVerse WASD 實時世界體驗錄屏AI 視頻是一種工具:輸入、等待,然後得到結果。實時世界模型則開始成為一種環境:用戶進入、行動,世界不斷回應。當這套能力沿著統一架構繼續吸收更多任務、信號和時間尺度,它還可能進一步成為下一代生成式數字世界的基礎設施。PixVerse WASD 實時世界體驗錄屏AI 視頻是一種工具:輸入、等待,然後得到結果。
實時世界模型則開始成為一種環境:用戶進入、行動,世界不斷回應。當這套能力沿著統一架構繼續吸收更多任務、信號和時間尺度,它還可能進一步成為下一代生成式數字世界的基礎設施。真正改變一個時代的技術是找到一條可以持續變強的路。R1 讓視頻開始實時回應人,R2 則讓這個世界擁有繼續變強的路徑。越大越強不再是 LLM 的專利,世界模型也終於走到了自己的 Scaling 時刻。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。
Related
相關文章

Anthropic,你是來給智譜打廣告的吧!
。 事情的起因,是Anthropic一紙檄文狀告了智譜的GLM-5.3,大致意思是說: GLM-5.3這個模型啊,它已經很會找軟件漏洞、編寫攻擊程序,而且防濫用限制容易被繞過。大家得小心嘍~ 但如果你把這篇文章讀完吧,就會越發覺得不對勁兒。 因為Anthropic為了證明自己說的是有道理的,所以特意拿出了實測成績。

微軟聯手哈佛MIT端出生物學世界模型Project Quine,一個週末篩出抗癌候選物
它與哈佛大學、麻省理工學院博德研究所聯手推出了一套實驗性多模態 AI 研究系統 Project Quine,定位很清晰:一套用於生物學研究的世界模型,要把計算生物學的建模和實驗室裡實打實的溼實驗接成一條線。Quine 的內核是一張覆蓋了基因組學、蛋白質、化學、細胞狀態和生物成像的聯合表徵世界模型,再配上交互式推理框架。

蘇姿豐下月訪韓劍指HBM4,三星有望躋身AMD AI加速器內存供應鏈
據外媒9月30日報道,她預計下個月親赴韓國,與三星電子高層面對面會談,議題直指 AI 芯片與技術合作,而最受關注的一筆,是三星有望成為 AMD HBM4的供應商。這樁合作並非臨時起意。AMD 與三星接觸已有一段時間,今年3月雙方就簽署了圍繞 AI 存儲芯片與計算技術合作的諒解備忘錄,當時便有傳聞稱,三星已被 AMD 選為其 AI 加速器 HBM4芯片的優先供應商。

獨家|元寶將殺入個人智能體大戰
字母榜2026.09.30 17:52 · 來自北京全文5253字00:00 / 15:20微信小微,繼續按兵不動文 | 字母AI騰訊正在加大對個人智能體(personal agent)的下注,這一次衝在前面的是元寶。字母榜(ID: wujicaijing)從知情人士處獨家瞭解到,元寶將推出個人智能體,產品形態和推出時間等尚未最終確定。

LG 聯手微軟秀智能家居語音助手:可中途"插話",年內登陸 ThinQ ON
它將被裝進 LG 的智能家居中樞設備"ThinQ ON",官方宣稱能提供接近真人交談的對話感受,這也是 LG 在智能家居入口爭奪中的最新落子。這套系統的內核是語音到語音(Speech to Speech)智能體技術,並融入了微軟的 Voice Live 能力。

Muse爆火,dots入場:Personal Agent開始和互聯網平臺搶入口
本文作者: 李娜 2026-09-30 16:35 導語:Personal Agent 正試圖成為互聯網的新中間層。Personal Agent,正在成為這一輪 AI 產品競爭裡最熱的新概念之一。9 月 29 日,OpenAI 發佈了可以長期在線的個人 Agent 產品 dots,提出“always-on agents”。