國產交互式世界模型上新,文本、圖片一鍵生成3D世界

(公眾號:zhidxcom) 作者 | 楊京麗 編輯 | 李水青 8月18日報道,昨天,多模態大模型公司智象未來(HiDream.ai)發佈原生全模態交互式世界模型HiDream-O1-World。該模型支持文本、圖像及交互等多模態輸入,具備漫遊、編輯和交互三大功能。用戶可一鍵生成時空一致、符合物理規律、可長時推演的完整世界。在第三方交互式世界模型評測基準WBench中,HiDream-O1-World以平均分80.9的成績登頂Navi分榜。其中,該模型在物理(Physical)維度獲得73.3分,位列第一,一致性(Consistency)維度得分為88.0。
HiDream-O1搭載智象自研的原生全模態(UiT)架構,在時空一致性與物理一致性上,取得了關鍵性突破:當鏡頭推拉搖移時,場景空間的幾何結構仍可保持高度穩定,物體不會消失或變形;物體間的碰撞、遮擋、重力響應高度符合真實世界的因果邏輯,而非隨機“猜”出來的畫面拼接。在實際體驗中,用戶可以從一段文字或一張圖片出發,以第一人稱或第三人稱視角探索生成場景,並控制角色動作、天氣及物體狀態。智象未來計劃將該模型用於AI互動影遊、具身智能仿真和3D場景生產等方向。
針對交互式世界模型容易出現的場景漂移、物體消失和物理失真等問題,該模型將3D空間信息寫入Memory上下文,並通過Test-Time Training(TTT,測試時訓練)在推理過程中持續調整模型,以維持長時間交互下的空間和物理一致性。值得注意的是,圍繞空間一致性,智象未來與復旦大學聯合開展的研究論文《DreamWorld:面向3D一致世界建模的幾何驅動視頻擴散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已被國際頂會ECCV 2026接收。
項目主頁: https://yanghb22-fdu.github.io/DreamWorld 論文地址: https://yanghb22-fdu.github.io/DreamWorld/asserts/DreamWorld.pdf 一、評測成績突出,物理維度位列第一 截至目前,智象HiDream-O1-World在第三方評測榜單WBench的Navi分榜中,以平均分80.9的成績登頂榜首,其中在物理(Physical)維度以73.3分位列第一,Consistency(一致性)維度達88.0分。
WBench由美團LongCat團隊與復旦大學聯合推出,是業內首個面向交互式世界模型的系統性評測基準。該基準涵蓋289個多輪交互案例、1058個交互輪次,並從視頻質量、設定遵循度、交互遵循度、一致性和物理真實性五個維度設置22項指標。WBench分為Navi和Full兩個榜單。其中,Navi分榜主要評估空間導航與視角控制能力,考察模型在連續運鏡過程中能否準確執行指令,同時維持場景結構與物體狀態。HiDream-O1-World在Navi分榜登頂,並在物理維度取得第一,一定程度上反映出智象自研UiT架構在時空一致性與物理一致性上的關鍵突破。
二、一張圖生成可探索空間,角色、天氣和場景可編輯 HiDream-O1-World支持文字、圖片和交互操控等多模態輸入方式。用戶可以輸入文字描述,上傳圖片或簡單交互,讓模型以此為起點補全周邊環境,生成可供後續探索的交互空間。以室內場景為例,用戶上傳一張臥室照片後,模型可以根據畫面中的空間關係繼續生成房間其他區域,並在鏡頭移動過程中維持傢俱尺寸、擺放位置和遮擋關係。與單張圖像擴展不同,這類生成不僅要補全畫面,還需要讓不同視角下的場景保持一致。模型提供第一人稱和第三人稱兩種漫遊視角。用戶既可以直接控制鏡頭前進、後退和轉向,也可以驅動場景中的角色行走,並調整視角方向。
在潛水案例中,鏡頭在海底移動時,水面光影、珊瑚紋理和魚群運動會同步變化;當鏡頭靠近珊瑚時,模型能夠繼續生成局部細節,並儘量維持整體場景的穩定性。此外,HiDream-O1-World還支持實時編輯。用戶可以讓角色完成抓取、奔跑、下蹲和跳躍等動作,也可以調度環境變化,如觸發降雨、物體墜落等環境事件。相應變化不侷限於某個局部區域,模型還需要同步調整場景中的幾何結構、光照、材質和物體關係。在角色生成方面,該模型可處理人類、動物和虛構角色等不同主體。以登雪山場景為例,登山者行走後會在雪地上留下腳印,雪花運動會隨風速變化,遠處山體輪廓和近處岩石紋理也會隨視角移動連續呈現。場景風格同樣具有較大的覆蓋範圍。
除城市街景、自然環境和室內空間外,模型還可以生成幻想世界、二次元動畫和3A遊戲渲染等風格化內容。三、空間信息寫入記憶,動態維護3D一致性 長時間保持時空一致性,是交互式世界模型面臨的核心難題之一。傳統視頻生成模型主要根據有限的上下文,預測後續畫面。當交互輪次增加、鏡頭運動範圍擴大後,前面出現過的物體容易發生漂移、形變甚至消失;當鏡頭重新回到原來的位置時,場景也可能變成另一種佈局。HiDream-O1-World通過“3D先驗注入Memory上下文”與“Test-Time Training(TTT,測試時訓練)”兩項機制,維持長時程空間一致性。
在生成過程中,模型會將場景幾何結構、物體位置及空間關係等3D先驗信息編碼,並存儲於Memory中。即使經過多輪鏡頭轉動和位置移動,模型仍可以調用此前存儲的空間信息,減少場景重置及物體位置變化。Test-Time Training則用來動態維護3D一致性,在推理階段,模型針對當前交互序列進行輕量級的在線自適應優化,使模型內部表徵與當前場景的3D幾何約束在推理過程中持續對齊。在物理一致性方面,智象未來從訓練數據和推理機制兩端入手。訓練階段,團隊利用生成式世界模擬器構建合成視頻,覆蓋剛體碰撞、流體運動、柔性形變、重力拋射及光影變化等容易出錯的物理場景,並通過時序因果建模強化跨幀依賴。
推理階段,TTT機制還可以針對當前場景中的材料和物體進行在線適應。例如,當畫面出現水流、剛體或此前較少見的物體類型時,模型會動態調整內部表徵,使後續生成結果儘量符合對應材料的運動特徵。智象未來稱,在WBench的視覺合理性評測中,HiDream-O1-World相比參測模型平均水平提升13.6%;在考察流體、碰撞和形變等物理關係的因果保真度評測中,提升幅度為12.7%。值得注意的是,該技術路線已得到國際頂會認可。
智象未來與復旦大學圍繞空間一致性開展的研究論文《DreamWorld:面向3D一致世界建模的幾何驅動視頻擴散》(DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling)已入選2026年歐洲計算機視覺國際會議(ECCV 2026)。四、瞄準互動影遊、具身智能仿真和3D場景生產 在應用層面,HiDream-O1-World主要瞄準AI互動影遊、具身智能仿真和3D場景生產三類場景。在AI互動影遊中,模型可根據用戶的移動、操作和選擇實時生成後續場景,使劇情不再侷限於預先製作的固定路線。
用戶可以直接參與敘事,並在同一世界中探索不同劇情分支。在具身智能領域,模型可生成城市、工廠和室內等仿真環境,用於機器人、自動駕駛及智能製造系統的虛擬訓練和測試。相比實景測試,仿真環境更容易批量構建低頻、危險或高成本場景。面向創作者和設計師,模型可用於生成手辦、家居及藝術空間等3D場景,並支持結構調整、風格切換和內容補全。智象未來還計劃進一步探索微觀世界模擬,將其用於細胞行為、蛋白質相互作用等生命過程研究。結語:世界模型競爭走向長時交互 HiDream-O1-World能夠在連續交互中維持空間結構、物體狀態和物理邏輯。
其在WBench導航分榜和物理維度取得第一,也說明世界模型的競爭正在從畫質和生成時長,進一步轉向空間記憶、交互控制與物理一致性。從互動影游到具身智能仿真,這些應用都要求模型生成的世界能夠持續存在,並響應操作。HiDream-O1-World展示了原生全模態架構在這一方向上的進展,但距離大規模產業應用,交互速度、生成成本、長時間穩定性和仿真精度仍是需要繼續驗證的指標。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。