原生全模態路線進階,智象未來發布交互式世界模型HiDream-O1-World

2026年8月17日 08:46
站內 AI 整理稿

HiDream-O1-World,一款原生全模態交互式世界模型。HiDream-O1-World 具備漫遊、編輯、交互三大功能,支持文本、圖像、交互等多模態方式輸入。用戶可一鍵生成時空一致、符合物理規律、可長時推演的完整世界。HiDream-O1-World 搭載的是智象自研的原生全模態(UiT)架構。作為核心基座,UiT此次迎來升級,在交互式世界模型領域公認的核心技術挑戰——時空一致性與物理一致性上,取得了關鍵性突破。

在新發布的世界模型中,這種突破錶現為:當鏡頭推拉搖移時,場景空間的幾何結構保持高度穩定,物體不會消失或變形;物體間的碰撞、遮擋、重力響應高度符合真實世界的因果邏輯,而非隨機“猜”出來的畫面拼接。智象未來CTO姚霆表示:“交互式世界模型的價值,不在於生成一個逼真的三維場景,而在於AI開始真正理解空間的深度、物體的質感、運動的慣性與光影的邏輯。這是對物理世界運行規律的系統性認知與重塑。HiDreamO1World,正是這場系統性重塑的第一道橋樑——讓每一次交互,都通往一個從未抵達的世界。

它的突破性效果,既堅定了我們推動原生全模態架構技術路線縱深發展的信心,也為智象持續構建世界模型的核心技術壁壘提供了關鍵支撐。”不久前,HiDream-O1-World 在第三方評測中交出了首份成績單。由美團LongCat團隊與復旦大學聯合推出的交互式視頻世界模型評測基準WBench公佈了最新榜單。智象HiDream-O1-World在核心的Navi分榜中,以平均分80.9的成績登頂榜首,其中在物理(Physical)維度以73.3分位列第一,Consistency(一致性)維度達88.0分。兩項關鍵指標均位居前列,成為該榜單中綜合表現排名第一的模型。

WBench是業內首個面向交互式世界模型的系統性評測基準,涵蓋289個多輪交互案例、共計1058個交互輪次,並基於五大維度、22項指標構建起一套嚴謹的量化評測體系。評測分為Navi與Full兩個榜單,其中Navi分榜聚焦空間導航與視角控制,被業內視為衡量世界模型空間理解能力的核心標尺。HiDream-O1-World首次參評即登頂Navi分榜,刷新交互式世界模型性能上限。這背後,是智象自研UiT架構在時空一致性與物理一致性上的關鍵突破,讓“構建可信交互世界”有了堅實的技術支點。02.

一鍵生成世界,開啟沉浸式交互體驗模型支持文本、圖像、交互式操控等多模態輸入方式,用戶只需一段文字描述、一張圖片或簡單交互,即可一鍵生成結構完整、質感細膩、風格多元的交互世界。對用戶而言,這不只是“進入”一個世界,而是親手“創造”一個世界。比如,上傳一張室內照片,模型便能快速構建出高精度的數字孿生空間,自動補全整間臥室的全景圖——空間比例精準協調,畫面細節精準且質感十足,令人彷彿置身其中。在功能上,模型提供了第一人稱和第三人稱兩種視角的漫遊體驗。用戶可自由驅動角色行走並任意調整視角方向。以潛水場景為例,視角移動時,水面光影與海底碎光同步變幻,珊瑚礁色彩分明、魚群游弋自如。

鏡頭拉近後珊瑚的紋理細節清晰可見,畫面全程穩定無漂移。不止於漫遊,HiDream-O1-World 賦予用戶實時編輯能力。用戶可對畫面進行實時編輯:驅動角色完成抓取、奔跑、下蹲、跳躍等動作,或調度環境變化,如觸發降雨、物體墜落等動態事件。這並非簡單的局部微調,而是基於幾何、光照、材質到物理邏輯的全局統一,確保每一次交互都真實自洽。強大的泛化能力,是HiDream-O1-World構建多元交互世界的基礎。模型支持人類、動物、虛構角色等多種角色的構建。無論是街頭漫步的行人、空中盤旋的飛鳥,還是幻想中的異獸,模型都能精準適配其形態與運動,讓每一種角色都踩準自己“應有”的節奏。

以登雪山的場景為例:登山人行進中,腳印在雪面上壓出真實凹陷。雪花隨風飄落的動作緩急有致。遠處群山輪廓與腳下岩石紋理隨視角推移,銜接得非常自然。模型還擁有極其豐富的場景與風格化創造空間。它既可高度還原真實城市街景、自然地貌、室內空間等各類實景,讓光影、材質、空間結構高度貼合現實物理世界;亦可自由解鎖幻想異世界、二次元卡通、3A遊戲渲染等多元藝術風格,輕鬆打造極具想象力的風格化數字場景。虛實之間,遊刃有餘。03.兩大核心突破:長時程的時空一致性與物理一致性交互式世界模型長期受制於空間、物理與記憶三大核心難題。

動態交互中,相機視角切換常引發畫面模糊畸變、場景漂移乃至空間結構紊亂,三維形態難以維繫;同時,畫面中也極易出現人物穿牆、物體懸浮等,明顯違揹物理規律的情況,會嚴重摺損場景的可信度;而更棘手的是,模型缺乏長效記憶——視角稍作轉動,已生成物件便可能憑空消失或細節飄忽,世界狀態始終無法被忠實留存。這三重挑戰彼此糾纏,共同構成模型從即時生成邁向持續存在的根本壁壘HiDream-O1-World基於自研原生全模態(UiT)世界模型架構,在上述挑戰上實現了關鍵突破。在長時程交互中,畫面嚴格遵循物理法則,視角切換間始終保持了高度的空間穩定性。

這一能力的實現,依託於兩大核心能力的協同支撐:時空一致性與物理一致性。長時程時空一致性HiDream-O1-World的核心突破,在於將“3D先驗注入Memory上下文”與“Test-Time Training在線維護”進行協同設計:傳統世界模型如同“畫師逐幀作畫”——每次交互都要重新繪製整幅畫面,幾何與外觀深度耦合,任何微小偏差都會在長序列中被不斷放大,最終導致物體漂移、形變甚至憑空消失。

HiDream-O1-World則如同一位擁有“空間記憶”的導演:每到一個新場景,模型不是每步重新揣測環境,而是在Memory中持續記錄場景的空間結構;當鏡頭移動或視角切換時,依據這份記憶快速調取對應視角下的場景呈現,再通過實時的在線微調確保每一次生成都準確無誤。鏡頭推拉搖移之間,物體不消失、不漂移、不“失憶”。在WBench的Consistency(一致性)維度,HiDream-O1-World得分88.0,位列榜單前列,也充分印證了“Memory+TTT”架構在長時序交互中維持3D幾何與空間一致性的出色能力。

全局穩態物理一致性為實現物理層面的一致性並確保畫面符合現實邏輯,模型從訓練數據與推理機制兩端同時著手,形成合力。訓練階段——物理模擬數據驅動的歸納偏置學習推理階段——Test-Time Training在線適應物理場景TTT機制不僅作用於3D維度,同樣為物理一致性提供在線增強。在交互過程中,模型通過輕量級在線自適應,能夠針對當前場景的特定物理屬性進行快速微調。例如,當場景中出現新物體類型或材料時,模型可在推理中動態調整內部表徵,使後續生成幀更好地符合該場景特有的物理規律——如水的流動性、剛體的碰撞響應等。

這種“邊交互邊適應”的能力,使模型即使在訓練數據未完全覆蓋的物理情景下,依然能保持較高的物理合理性。這種“架構創新”與“數據策略”雙輪驅動的設計,使HiDream-O1-World在物理模擬真實感上帶來了實質性突破——在評估畫面運動是否符合常識物理的視覺合理性評測中,模型相比行業平均提升13.6%;在更具挑戰性的因果保真度評測中,通過對流體、碰撞、形變等物理維度的全面衡量,模型同樣實現了12.7%的大幅躍升。值得一提的是,這一技術路線已獲得國際頂會認可。

聚焦空間一致性研究的論文,正式入選2026年歐洲計算機視覺國際會議(ECCV 2026),為交互式世界模型在三維空間理解與長時序生成方向上,開闢了一條兼具理論原創性與工程可行性的技術路徑。ECCV(European Conference on Computer Vision):全球計算機視覺與人工智能領域的三大頂級學術會議之一,每兩年舉行一屆。論文標題:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling項目主頁:https://yanghb22-fdu.github.

io/DreamWorld04.三大全新產業格局,向新世界開啟除了技術突破之外,HiDream-O1-World也正在打開智能時代全新的產業重塑可能性。1.AI互動影遊——開啟互動影遊智能化新階段AI互動影遊是以影視級視聽敘事為外殼、用戶交互為內核的新興內容形態。然而,實現二者的高效統一,一直是制約行業升維的核心瓶頸。HiDream-O1-World交互式世界模型的發佈,讓我們看到了這一命題的全新可能性——用戶不再被動跟隨線性劇情,而是成為敘事的主動參與者,世界會隨其探索持續沿著不同的分支劇情演進。由此,用戶在影視級視覺質感中獲得前所未有的沉浸感,並享受探索多重結局的樂趣。2.

具身智能仿真——打造高精度仿真底座HiDream-O1-World世界模型能夠高效搭建高度還原、遵循物理規則的城市、工廠、室內等多類型仿真空間,為智能機器人訓練、自動駕駛、智能製造等場景提供高質量的虛擬試驗底座。這意味著,高成本、高風險的實景測試可由智能仿真替代,加速具身智能產業發展。3.3D場景生產——從創意捕捉,到微觀世界推演面向創作者與設計師,HiDream-O1-World能輕鬆生成3D手辦、家居場景及藝術空間等內容,結構完整、細節豐富,並支持結構微調、風格秒換與智能補全,有效縮短創意到成品的迭代路徑。

更具想象空間的是其向微觀世界的延伸:藉助HiDream-O1-World生成高精度的微觀世界,可以精準模擬細胞行為、蛋白相互作用等生命過程,為藥物發現與疾病機理研究開闢全新的數字仿真路徑。當物理世界可以被一鍵生成、自由交互,很多行業都值得被重新想象。這些領域,還只是冰山一角。隨著開發者與創作者不斷加入,交互式世界模型的應用邊界,將遠超我們今天所能描繪的範圍。

Related

相關文章

IT之家生成式AI

消息稱蔚來智駕負責人任少卿創立具身智能公司,蔚來將戰略投資

首頁 > IT資訊>人物 消息稱蔚來智駕負責人任少卿創立具身智能公司,蔚來將戰略投資 2026/8/24 18:46:59 來源:IT之家 作者:沁滄(實習) 責編:沁滄 評論: IT之家 8 月 24 日消息,據晚點 Auto 消息,8 月 24 日,蔚來 CEO 李斌在智駕全員會上宣佈,智能駕駛負責人任少卿已創立物理 AI 基礎模型和具身智能獨立公司,蔚來將戰略投資並與之開展合作。知情人士稱,“會議很簡短,沒有提及組織架構變動。”一位參與此次全員會的人士稱,李斌和任少卿在會議上明確表示,任少卿將繼續擔任蔚來智能駕駛業務負責人。報道稱任少卿創立的新公司已經完成註冊,估值達到獨角獸級別。任少卿,1988 年出生,2016 年取得中國科學技術大學與微軟亞洲研究院博士學位。2018 年,任少卿參與創立 momenta,任合夥人兼研發總監;2020 年 8 月加入蔚來汽車,後擔任蔚來自動駕駛研發首席專家、副總裁。IT之家查詢公開信息獲悉,除了在蔚來任職,2025 年 9 月,任少卿加入中國科學技術大學,擔任講席教授、博士生導師和通用人工智能研究所所長,研究方向包括人工智能、世界模型、具身智能、深度學習和 AI for Science 等。相關閱讀:《原 Momenta 研發總監任少卿入職,蔚來自動駕駛研發重心轉回國內》《消息稱蔚來智駕再調整:任少卿直管大模型部門,推進“端到端”量產交付》《中國科大教授任少卿、蔚來汽車 CEO 李斌獲中國人工智能最高獎》 投訴水文 我要糾錯 下載IT之家APP,簽到賺金幣兌豪禮 相關文章關鍵詞:蔚來,智駕,任少卿,具身智能智元聯合長隆打造全球首個具身智能主題樂園,含機器人服務酒店等秦力洪:純電滲透率今年有望超 50%,蔚來不會做增程車蔚來李斌稱中國汽車行業進入“決賽最殘酷階段”,接下來三五年最後的玩家差不多塵埃落定奇瑞捷豹路虎 FREELANDER

剛剛
鈦媒體生成式AI

偷書要賠15億美元,AI巨頭燒幾百萬本書反而合法了

偷書要賠15億美元,AI巨頭燒幾百萬本書反而合法了藍字計劃2026.08.24 18:01 · 來自廣東全文4120字00:00 / 11:49只要能訓練出更好的大模型,究竟要銷燬多少本實體書,甚至在實體書之外還會消耗多少前AI時代的“資產”,也許就再也沒人關心了。文 | 藍字計劃,作者|Chester一場現代版的“焚書”,正在美國發生。最近幾年,美國二手書市場出現了一個奇怪現象:不少神秘買家,一次性採購成百上千本書,不挑書、不問價,甚至連冷門舊書都照買不誤。隨著電子閱讀的普及,現在還有多少人看實體書?更別說這種成百上千的掃貨始買書。書商們自然也開始好奇:究竟是誰在買走這批書?最近,美國科技媒體404 Media聯繫到一名二手書商。對方剛剛通過書籍交易平臺Biblio,接到了一筆大約1000本舊書的訂單,其中還包括不少稀有、絕版和具有收藏價值的書。為了找出背後的買家,404 Media把一枚AirTag塞進其中一本書裡,然後一路追蹤。最終,這本書被送進了亞馬遜位於拉斯維加斯的一家倉庫。據404 Media調查,這些書到了亞馬遜倉庫後,命運卻只有三步:切掉書脊、批量掃描、然後扔進碎紙機。負責這項工作的VGT3團隊,甚至還給自己設計了一個頗為應景的Logo:一隻露著牙齒、手裡抓著書的霸王龍。 自己也賣書的亞馬遜卻幹起了銷燬實體書的活已經夠驚奇了,但更驚奇的是同樣這樣乾的,不只有亞馬遜。在更早之前,Anthropic就被曝光過一個代號為“巴拿馬計劃”的秘密項目。他們的目標,是把全世界的書都“破壞性掃描”一遍。在大約一年時間裡,Anthropic為此花費數千萬美元,買下數百萬本實體書,然後切掉書脊、掃描內容,再把剩下的紙張送去回收。美國的AI大公司,怎麼就和舊書幹上了?互聯網內容,不夠AI用了AI公司瘋狂買二手書,其實是想買下書裡的內容和數據。過去,互聯網是大模型最方便的數據來源。

剛剛
量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛