一張圖生成3D夢中情房,桌椅擺件隨心換,又一世界生成模型來了
作者 | 楊京麗 編輯 | 李水青 9月1日報道,今天,上海3D生成大模型公司影眸科技發佈世界生成模型Hyper3D WorldGen,推動3D生成從“單個資產”走向“完整場景”。用戶上傳一張場景圖片後,模型可以自動識別畫面中的主要物體,並生成對應的3D資產,也支持手動框選目標生成,並通過影眸Hyper3D團隊自研的CAST架構,重建物體之間的空間與物理關係,最終生成由多個獨立、可編輯、可替換、可交互資產組成的3D場景。CAST為“基於單張RGB圖像的組件對齊式3D場景重建”,是影眸Hyper3D團隊在2025年發佈的場景級生成研究成果。
其核心是從單張圖片中補全被遮擋物體的三維結構,判斷物體之間的接觸、支撐、懸掛等關係,並將多個獨立物體放入統一、物理合理的三維空間。該研究曾獲SIGGRAPH 2025最佳論文。值得注意的是,WorldGen的生成能力已經進入具身智能仿真訓練、影視製作、遊戲開發與XR等真實生產場景,推動場景級3D生成從視覺展示走向產業工作流。模型發佈前,等媒體採訪了影眸科技創始人、CEO吳迪和聯合創始人、CTO張啟煊,圍繞WorldGen的技術路線、應用進展及3D生成行業趨勢等問題進行了交流。
一、一張圖片生成場景,場景內資產可交互 媒體交流會上,張啟煊演示了WorldGen的生成過程:上傳一張辦公室盥洗室的圖片後,系統能夠自動識別水龍頭、盤子、水果等主要物體,約2-3秒生成單個物體的3D預覽,並在約2-3分鐘內還原出完整場景。這些物體都是可以被選擇、移動和替換的獨立資產。開啟SimReady功能後,系統可以為資產估計出物體質量、大小和摩擦係數等物理屬性,水果能夠在力的作用下滾入水池中。此外,用戶還可以根據物體的重要程度選擇不同的生成精度,先快速確定場景結構,再對重點資產進行精修。
吳迪舉例稱,如果用生成模型直接將會議室的圖片轉化為一個3D場景,畫面中的桌椅、牆壁和其他物體通常會被合併在一起,難以單獨選擇和編輯。WorldGen在生成過程中能夠拆分場景中的主要物體,分別生成獨立資產,同時還原它們之間的空間與物理關係。為了兼顧場景可用性與視覺完整性,WorldGen採用混合表達方式:需要編輯和交互的物體使用具備完整幾何結構的網格模型(Mesh),方便後續調整和添加物理屬性;背景則採用側重還原場景外觀的3D高斯潑濺(3D Gaussian Splatting),保留更多環境細節。
二、覆蓋四類應用場景,具身智能、影視領域率先推進 張啟煊向介紹,WorldGen並非針對某個單一行業開發的模型,其應用場景覆蓋具身智能、遊戲、影視製作和XR等領域。目前,WorldGen已經在不同方向上推進落地應用。在具身智能領域,影眸Hyper3D已與地瓜機器人、謀先飛展開合作,推出仿真訓練方案:WorldGen負責生成可用於仿真的3D場景,謀先飛則進行仿真適配,地瓜機器人提供算力與開發工具鏈。張啟煊稱:“生成式3D可以快速擴充物體種類和場景佈局,但不會完全替代真實數據,機器人訓練未來更可能混合使用仿真與真實數據。
” 在影視領域,WorldGen能夠解決視頻模型在多鏡頭中難以保持空間和物體位置一致的問題。創作者可以先生成空間結構明確的3D場景,在其中調整鏡頭、移動物體和修改佈局,再交給Seedance 2.5等視頻模型補充人物表現、材質、光影和畫面風格。在遊戲和專業3D製作領域,WorldGen生成的獨立網格資產可以進入Blender、Unity、PlayCanvas和Unreal Engine等數字內容創作(DCC)工具及實時引擎,繼續進行材質調整、動畫綁定、關卡編輯和性能優化。今年7月,影眸Hyper3D還與Unity中國宣佈合作,嘗試打通從3D生成到實時遊戲應用的流程。
在XR領域,WorldGen可以將參考圖片還原為可編輯的三維空間,用戶能夠從不同視角觀察場景,並調整物體和空間佈局,可用於室內設計、空間展示和沉浸式體驗。張啟煊告訴,WorldGen在上述行業的應用目前主要處於內測或技術驗證階段,團隊將根據實際客戶需求確定後續投入重點。三、以剛體生成為主,向“構建世界”繼續演進 在採訪交流環節,針對WorldGen技術邊界的提問,張啟煊稱,系統生成的質量、摩擦係數等物理屬性並非對真實物體的精確測量,主要結合資產體積、視覺信息、周圍物體關係、傳統估計算法以及視覺語言模型,對質量分佈、摩擦係數和碰撞體進行推斷。因而,這些結果不能作為精密工程數據使用。
現階段,WorldGen主要支持剛體生成,尚未覆蓋關節化資產、柔體和流體等。關於WorldGen與“世界模型”的關係,吳迪稱,世界模型既包括面向決策和行動的行動模型(Action Model),也包括生成可交互、可訓練環境的模型,WorldGen更接近後者。影眸Hyper3D不會因此將自身定義為世界模型公司,其核心定位仍是3D生成。吳迪認為,視頻模型擅長最終畫面呈現,3D則能夠明確保存物體、空間結構和物理關係,兩條路線並非相互取代,未來更可能以混合方式結合。從單個資產走向完整場景,WorldGen讓生成結果具備更強的可控性、可編輯性和工作流兼容能力。
隨著3D生成從“看起來好看”走向“真正可用”,場景級生成也正在成為連接遊戲、影視、具身智能和XR等行業的新基礎能力。結語:3D生成競爭轉向場景可用性 WorldGen的3D生成能力,並不只是侷限於生成單個資產或是一個3D空間,它能夠構建多個獨立資產、理解空間關係與物理屬性,形成可繼續編輯、交互和運行的完整場景。3D生成的競爭重點正在從單個模型的視覺質量,進一步轉向場景的可控性、物理合理性和工作流兼容能力。現階段,WorldGen仍以剛體生成為主,部分物理屬性也依賴模型推斷,在具身智能、遊戲、影視和XR等領域仍處於驗證與早期落地階段。
其後續價值能否真正釋放,還要看生成結果能否穩定進入專業生產流程,但從“生成資產”走向“構建場景”,已經成為3D生成領域可行性較高的方案。
Related
相關文章

3秒出片比播放還快,MiniMax打開了AI視頻的實時商業化路徑
MiniMax推出新一代影片生成模型H3 Max,生成5秒768p影片僅需不到3秒,速度已超越播放速度,並帶動AI即時直播與AI版短影片App等創新應用。該模型基於開源的H3進行後訓練與推理優化,吞吐量約為原版35倍,同時在圖生影片評比中拿下第一。市場上已出現多個由開發者打造的即時生成直播頻道,顯示此技術開啟新的商業化路徑,而MiniMax股價也在近期大漲。

奧特曼播客曝猛料:Astra操作電腦已達人類水平
OpenAI 執行長奧特曼(Sam Altman)近日在一場播客訪談中投下震撼彈,直言旗下 AI 代理系統 Astra 在操作電腦方面的能力,已經達到與人類相當的水準。這番談話迅速在科技圈發酵,外界普遍將其視為 AI 從「回答問題」邁向「實際動手執行任務」的關鍵分水嶺。 奧特曼在節目中並未停留在技術層面的描述,而是進一步闡述 AI 能力躍升後對社會結構的深遠影響。他特別點名高等教育體系,認為傳統四年制大學的養成模式已經跟不上時代,主張兩年就足以完成必要的學術訓練。

奧特曼直言:四年太久,大學兩年就夠
OpenAI 執行長山姆·奧特曼(Sam Altman)近日再度拋出震撼教育界的觀點。他向外界直言,傳統大學四年學制早已不合時宜,在人工智慧迅速改變知識取得與技能養成的當下,兩年時間便足以讓年輕人具備進入社會所需的核心能力。這番言論迅速在矽谷與科技圈引發熱烈討論,也讓外界重新審視高等教育的效率與未來走向。 奧特曼長期以來便對现行教育體系抱持批判態度。他認為,現行的大學課程設計源自工業時代的標準化思維,過度依賴課堂授課與學分累積,卻忽略了學生真正需要的是解決問題的能力與實作經驗。

月之暗面與微軟、谷歌、亞馬遜談判, 爭取最高30%服務分成
中國月之暗面就Kimi K3與美雲企談30%收入分成,具標誌性意義。 近日,財聯社報道,據消息人士透露,月之暗面正就Kimi K3 AI模型與微軟、亞馬遜、谷歌進行收入分成談判。月之暗面在初期談判中,正尋求從K3相關服務產生的收入中抽取最高30%的分成。 如果談成,這將是中國AI公司和美國雲巨頭之間,第一個大型模型收入分成協議。 不過談判仍處於早期階段,分成核算口徑、合作落地週期、服務邊界等核心細節尚未最終敲定。目前,涉及的三家雲廠商和月之暗面都拒絕對談判公開發表評論。

混元Hy4 preview輕量版來了!權重壓縮86%,性能幾乎不減
(公眾號:zhidxcom) 作者 | 程茜 編輯 | 心緣 9月1日報道,今日中午,騰訊發佈了其最新一代旗艦模型預覽版本Hy4 preview的輕量版模型,將模型權重從1.5TB壓縮到214GB。 騰訊混元的測試結果顯示,壓縮後的模型與Hy4 preview原始模型相比,長文理解、多輪長上下文檢索和原版基本在同一水平,數學有小幅回落。壓縮後模型能覆蓋日常編程輔助、工具調用、長文檔處理和常規問答。

2026年的一切,都只是Robocity的序幕
35分鐘前“最強大腦”與“最強小腦”相互需要2026-08-11百度AI的驗牌時刻到了2026-07-27閱讀更多內容,狠戳這裡查看AI測評DeepSeek選靠譜AI,看真實評測查看AI測評官方交流社區加入諮詢項目審核和入駐聯繫項目推薦訂閱號關注下一篇馬斯克狂贊,硅谷大佬驚呼:Grok Bot是下一個ChatGPT時刻硅谷投資人稱Grok Bot是新ChatGPT時刻,為AI生產革命。