原生全模態路線進階,智象未來發布交互式世界模型HiDream-O1-World
HiDream-O1-World,一款原生全模態交互式世界模型。HiDream-O1-World 具備漫遊、編輯、交互三大功能,支持文本、圖像、交互等多模態方式輸入。用戶可一鍵生成時空一致、符合物理規律、可長時推演的完整世界。HiDream-O1-World 搭載的是智象自研的原生全模態(UiT)架構。作為核心基座,UiT此次迎來升級,在交互式世界模型領域公認的核心技術挑戰——時空一致性與物理一致性上,取得了關鍵性突破。
在新發布的世界模型中,這種突破錶現為:當鏡頭推拉搖移時,場景空間的幾何結構保持高度穩定,物體不會消失或變形;物體間的碰撞、遮擋、重力響應高度符合真實世界的因果邏輯,而非隨機“猜”出來的畫面拼接。智象未來CTO姚霆表示:“交互式世界模型的價值,不在於生成一個逼真的三維場景,而在於AI開始真正理解空間的深度、物體的質感、運動的慣性與光影的邏輯。這是對物理世界運行規律的系統性認知與重塑。HiDreamO1World,正是這場系統性重塑的第一道橋樑——讓每一次交互,都通往一個從未抵達的世界。
它的突破性效果,既堅定了我們推動原生全模態架構技術路線縱深發展的信心,也為智象持續構建世界模型的核心技術壁壘提供了關鍵支撐。”不久前,HiDream-O1-World 在第三方評測中交出了首份成績單。由美團LongCat團隊與復旦大學聯合推出的交互式視頻世界模型評測基準WBench公佈了最新榜單。智象HiDream-O1-World在核心的Navi分榜中,以平均分80.9的成績登頂榜首,其中在物理(Physical)維度以73.3分位列第一,Consistency(一致性)維度達88.0分。兩項關鍵指標均位居前列,成為該榜單中綜合表現排名第一的模型。
WBench是業內首個面向交互式世界模型的系統性評測基準,涵蓋289個多輪交互案例、共計1058個交互輪次,並基於五大維度、22項指標構建起一套嚴謹的量化評測體系。評測分為Navi與Full兩個榜單,其中Navi分榜聚焦空間導航與視角控制,被業內視為衡量世界模型空間理解能力的核心標尺。HiDream-O1-World首次參評即登頂Navi分榜,刷新交互式世界模型性能上限。這背後,是智象自研UiT架構在時空一致性與物理一致性上的關鍵突破,讓“構建可信交互世界”有了堅實的技術支點。02.
一鍵生成世界,開啟沉浸式交互體驗模型支持文本、圖像、交互式操控等多模態輸入方式,用戶只需一段文字描述、一張圖片或簡單交互,即可一鍵生成結構完整、質感細膩、風格多元的交互世界。對用戶而言,這不只是“進入”一個世界,而是親手“創造”一個世界。比如,上傳一張室內照片,模型便能快速構建出高精度的數字孿生空間,自動補全整間臥室的全景圖——空間比例精準協調,畫面細節精準且質感十足,令人彷彿置身其中。在功能上,模型提供了第一人稱和第三人稱兩種視角的漫遊體驗。用戶可自由驅動角色行走並任意調整視角方向。以潛水場景為例,視角移動時,水面光影與海底碎光同步變幻,珊瑚礁色彩分明、魚群游弋自如。
鏡頭拉近後珊瑚的紋理細節清晰可見,畫面全程穩定無漂移。不止於漫遊,HiDream-O1-World 賦予用戶實時編輯能力。用戶可對畫面進行實時編輯:驅動角色完成抓取、奔跑、下蹲、跳躍等動作,或調度環境變化,如觸發降雨、物體墜落等動態事件。這並非簡單的局部微調,而是基於幾何、光照、材質到物理邏輯的全局統一,確保每一次交互都真實自洽。強大的泛化能力,是HiDream-O1-World構建多元交互世界的基礎。模型支持人類、動物、虛構角色等多種角色的構建。無論是街頭漫步的行人、空中盤旋的飛鳥,還是幻想中的異獸,模型都能精準適配其形態與運動,讓每一種角色都踩準自己“應有”的節奏。
以登雪山的場景為例:登山人行進中,腳印在雪面上壓出真實凹陷。雪花隨風飄落的動作緩急有致。遠處群山輪廓與腳下岩石紋理隨視角推移,銜接得非常自然。模型還擁有極其豐富的場景與風格化創造空間。它既可高度還原真實城市街景、自然地貌、室內空間等各類實景,讓光影、材質、空間結構高度貼合現實物理世界;亦可自由解鎖幻想異世界、二次元卡通、3A遊戲渲染等多元藝術風格,輕鬆打造極具想象力的風格化數字場景。虛實之間,遊刃有餘。03.兩大核心突破:長時程的時空一致性與物理一致性交互式世界模型長期受制於空間、物理與記憶三大核心難題。
動態交互中,相機視角切換常引發畫面模糊畸變、場景漂移乃至空間結構紊亂,三維形態難以維繫;同時,畫面中也極易出現人物穿牆、物體懸浮等,明顯違揹物理規律的情況,會嚴重摺損場景的可信度;而更棘手的是,模型缺乏長效記憶——視角稍作轉動,已生成物件便可能憑空消失或細節飄忽,世界狀態始終無法被忠實留存。這三重挑戰彼此糾纏,共同構成模型從即時生成邁向持續存在的根本壁壘HiDream-O1-World基於自研原生全模態(UiT)世界模型架構,在上述挑戰上實現了關鍵突破。在長時程交互中,畫面嚴格遵循物理法則,視角切換間始終保持了高度的空間穩定性。
這一能力的實現,依託於兩大核心能力的協同支撐:時空一致性與物理一致性。長時程時空一致性HiDream-O1-World的核心突破,在於將“3D先驗注入Memory上下文”與“Test-Time Training在線維護”進行協同設計:傳統世界模型如同“畫師逐幀作畫”——每次交互都要重新繪製整幅畫面,幾何與外觀深度耦合,任何微小偏差都會在長序列中被不斷放大,最終導致物體漂移、形變甚至憑空消失。
HiDream-O1-World則如同一位擁有“空間記憶”的導演:每到一個新場景,模型不是每步重新揣測環境,而是在Memory中持續記錄場景的空間結構;當鏡頭移動或視角切換時,依據這份記憶快速調取對應視角下的場景呈現,再通過實時的在線微調確保每一次生成都準確無誤。鏡頭推拉搖移之間,物體不消失、不漂移、不“失憶”。在WBench的Consistency(一致性)維度,HiDream-O1-World得分88.0,位列榜單前列,也充分印證了“Memory+TTT”架構在長時序交互中維持3D幾何與空間一致性的出色能力。
全局穩態物理一致性為實現物理層面的一致性並確保畫面符合現實邏輯,模型從訓練數據與推理機制兩端同時著手,形成合力。訓練階段——物理模擬數據驅動的歸納偏置學習推理階段——Test-Time Training在線適應物理場景TTT機制不僅作用於3D維度,同樣為物理一致性提供在線增強。在交互過程中,模型通過輕量級在線自適應,能夠針對當前場景的特定物理屬性進行快速微調。例如,當場景中出現新物體類型或材料時,模型可在推理中動態調整內部表徵,使後續生成幀更好地符合該場景特有的物理規律——如水的流動性、剛體的碰撞響應等。
這種“邊交互邊適應”的能力,使模型即使在訓練數據未完全覆蓋的物理情景下,依然能保持較高的物理合理性。這種“架構創新”與“數據策略”雙輪驅動的設計,使HiDream-O1-World在物理模擬真實感上帶來了實質性突破——在評估畫面運動是否符合常識物理的視覺合理性評測中,模型相比行業平均提升13.6%;在更具挑戰性的因果保真度評測中,通過對流體、碰撞、形變等物理維度的全面衡量,模型同樣實現了12.7%的大幅躍升。值得一提的是,這一技術路線已獲得國際頂會認可。
聚焦空間一致性研究的論文,正式入選2026年歐洲計算機視覺國際會議(ECCV 2026),為交互式世界模型在三維空間理解與長時序生成方向上,開闢了一條兼具理論原創性與工程可行性的技術路徑。ECCV(European Conference on Computer Vision):全球計算機視覺與人工智能領域的三大頂級學術會議之一,每兩年舉行一屆。論文標題:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling項目主頁:https://yanghb22-fdu.github.
io/DreamWorld04.三大全新產業格局,向新世界開啟除了技術突破之外,HiDream-O1-World也正在打開智能時代全新的產業重塑可能性。1.AI互動影遊——開啟互動影遊智能化新階段AI互動影遊是以影視級視聽敘事為外殼、用戶交互為內核的新興內容形態。然而,實現二者的高效統一,一直是制約行業升維的核心瓶頸。HiDream-O1-World交互式世界模型的發佈,讓我們看到了這一命題的全新可能性——用戶不再被動跟隨線性劇情,而是成為敘事的主動參與者,世界會隨其探索持續沿著不同的分支劇情演進。由此,用戶在影視級視覺質感中獲得前所未有的沉浸感,並享受探索多重結局的樂趣。2.
具身智能仿真——打造高精度仿真底座HiDream-O1-World世界模型能夠高效搭建高度還原、遵循物理規則的城市、工廠、室內等多類型仿真空間,為智能機器人訓練、自動駕駛、智能製造等場景提供高質量的虛擬試驗底座。這意味著,高成本、高風險的實景測試可由智能仿真替代,加速具身智能產業發展。3.3D場景生產——從創意捕捉,到微觀世界推演面向創作者與設計師,HiDream-O1-World能輕鬆生成3D手辦、家居場景及藝術空間等內容,結構完整、細節豐富,並支持結構微調、風格秒換與智能補全,有效縮短創意到成品的迭代路徑。
更具想象空間的是其向微觀世界的延伸:藉助HiDream-O1-World生成高精度的微觀世界,可以精準模擬細胞行為、蛋白相互作用等生命過程,為藥物發現與疾病機理研究開闢全新的數字仿真路徑。當物理世界可以被一鍵生成、自由交互,很多行業都值得被重新想象。這些領域,還只是冰山一角。隨著開發者與創作者不斷加入,交互式世界模型的應用邊界,將遠超我們今天所能描繪的範圍。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。