騰訊3D世界生成框架來了:一句話生成世界,支持修改編輯
作者 | 楊京麗 編輯 | 李水青 8月13日消息,近日,騰訊混元3D團隊推出3D開放世界生成框架WorldClaw,相關論文已於8月5日公開。用戶輸入一句開放式文本描述,WorldClaw即可生成可自由探索、可繼續編輯的大規模3D世界。▲WorldClaw的生成案例 WorldClaw採用由粗到細的Agentic 3D世界生成方式。多個Agent協作完成用戶意圖分析、場景規劃和全局地形構建,再根據各區域的功能和地形條件,逐區生成建築、車輛、植被等內容,並將其轉換為可單獨編輯、替換和複用的3D資產。
初始場景完成後,Agent還會根據多視角渲染結果,持續檢查並修正物體尺度、姿態、懸浮和穿模等問題。騰訊混元團隊展示了四季村落、熱帶海盜島嶼、沙漠戰場等生成案例,並將WorldClaw與SynCity、Marble、MajutsuCity、WorldGen和GPT-5.6 Sol進行了定性對比。結果顯示,基於WorldClaw生成的複雜地形具有明顯高差、連續邊界和清晰的語義分區。論文鏈接: https://arxiv.org/abs/2608.05248 項目網頁: https://tencent-hunyuan.github.
io/Hunyuan3D-WorldClaw/ Github地址: https://github.com/Tencent-Hunyuan/Hunyuan3D-WorldClaw 一、先搭全局再填細節,四階段完成3D開放世界生成 生成式模型已能根據文本生成圖像、視頻和3D對象,但生成一段“看起來像世界”的畫面,與構建一個可進入、可繼續編輯和使用的3D世界並不相同。後者還需要連續一致的空間結構,以及可獨立編輯、替換和擴展的建築、道路、植被等場景元素。
針對這一問題,WorldClaw採用Global-to-Regional(從全局到區域)的生成方式:先規劃整體佈局、搭建全局地形,再根據不同區域的功能和地形條件生成局部內容。這套方法有三大技術亮點:一是先建全局地形、再逐區生成細節;二是通過語義佈局控制山地、森林、沙漠等地貌的分佈與組合;三是以真實3D地形的渲染結果為條件,生成與當地環境匹配的建築、車輛和植被等內容。WorldClaw生成世界的過程主要分成四個階段。▲Hunyuan3D-WorldClaw 場景生成的整體流程 第一階段是意圖分析和場景規劃。
WorldClaw首先理解用戶想要的場景,將一句開放式描述整理為清晰的世界規劃,明確場景包含哪些區域、採用什麼地形、需要哪些物體,以及它們之間如何連接。第二階段是全局地形生成。系統根據規劃生成整個世界的區域佈局,並構建不同區域的地形、材質和環境資產,讓山地、平原、森林和沙漠形成連續的三維空間。第三階段是區域對象生成。WorldClaw在全局地形上逐區生成建築、車輛和植被等內容,並將圖像中的物體轉化為獨立3D資產,再放置到相應的三維位置。第四階段是場景精修。初始場景完成後,Agent會從多個視角檢查生成結果,識別物體尺度、姿態、幾何質量,以及懸浮、穿模和地形接觸等問題,並進行局部修改。
簡單來說,這套流程就是先理解用戶想要的世界,再搭建地形、填充內容,最後自動檢查和精修。二、多Agent協作完成,生成後還能自己找問題 一句文本通常只能描述世界的大致樣貌,無法完整說明區域劃分、地形參數和物體空間關係。WorldClaw首先使用兩個Agent,將用戶需求轉化為可執行的場景規劃。其中,意圖分析Agent負責提取用戶已經明確給出的信息,如場景類型、視覺風格、關鍵區域、物體和空間關係,不主動補充用戶沒有提及的內容。場景規劃Agent則在此基礎上補全生成3D世界所需的信息,將區域、地形、物體及其關係整理成統一的場景規範。
生成地形時,WorldClaw會先準備一張劃分不同區域的語義佈局圖、一套岩石和植被等可複用3D環境資產,以及一套草地、岩石、沙土等地表材質。後續生成過程均遵循同一套區域規劃,避免地形、材質和場景資產各自生成、相互脫節。▲地形生成與優化過程 系統隨後通過PCG(程序化內容生成)構建3D高度場。不同區域採用相應的地貌規則,讓山地形成自然起伏、沙漠產生連續沙丘、平原保持相對舒緩,並使不同地貌自然銜接。岩石、植被等環境資產的分佈也會參考區域類型、局部高度和坡度,過濾過陡或不合理的位置。
地形生成完成後,地形優化Agent會重新渲染場景,檢查地形形態、材質尺度、資產密度和區域過渡,再對局部問題進行修改,形成“程序化生成—渲染檢查—Agent修正”的閉環。填充區域內容時,WorldClaw不會一次將整個世界塞滿,而是先挑選需要內容且地形條件合適的區域。系統將對應地形渲染成二維圖像,並讓圖像生成模型在圖中加入建築、車輛和植被等內容,以此確定對象的外觀和空間佈局。隨後,系統利用SAM3分割圖中的不同對象,再通過SAM3D將它們重建為獨立3D網格,並校準每個對象的尺度、位置和朝向。每個獨立生成的對象均可繼續編輯、替換和複用。
▲對象精修原理 完成放置後,場景精修Agent會通過MCP接口連接Blender,根據多視角渲染結果檢查對象。尺度或姿態不合理的對象會被重新調整,幾何和紋理質量不足的對象則交由混元3D進一步優化。發現懸浮或穿模後,系統還可以調整對象位置,或在局部範圍內抬升、平滑地形,讓物體與地面穩定接觸。▲地形精修原理 三、可生成海盜島、沙漠戰場,場景對象均可單獨編輯 騰訊混元團隊還將WorldClaw與SynCity、Marble、MajutsuCity、WorldGen和GPT-5.6 Sol進行了定性對比。
▲WorldClaw與代表性3D場景生成方法定性對比 結果顯示,WorldClaw能夠生成具有明顯高差、連續邊界和清晰語義分區的複雜地形,保留全局地形與獨立對象網格。同時,WorldClaw還支持自由探索及對象級編輯。此外,騰訊混元團隊展示了熱帶海盜島嶼和沙漠戰場等代表性案例。熱帶海盜島嶼案例中,WorldClaw生成了具有連續地形和明確區域劃分的島嶼,並在其中佈置了建築、碼頭、植被和船隻等場景元素。▲熱帶海盜島嶼案例 沙漠戰場案例中,WorldClaw在起伏的沙漠地形上生成了建築、載具和環境設施等內容,形成了可自由探索的完整戰場場景。
▲沙漠戰場案例 結語:從生成3D資產走向構建3D世界 WorldClaw將全局規劃、複雜地形生成、區域內容構建和渲染反饋串聯起來,讓大規模3D世界生成擁有了持續規劃、生成、檢查和修改的完整流程。最終產物由真實地形和獨立3D資產組成,可以繼續用於遊戲引擎和內容生產。隨著基礎模型的編程、空間理解和工具使用能力提升,Agent有望進入幾何建模、材質與Shader構建、PCG、動畫和交互邏輯等更多3D生產環節。3D生成也可能從“模型生成資產”逐步走向“Agent編程構建世界”,讓創作者可以把更多精力放在定義想要創造的世界上。
Related
相關文章

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”
阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

月之暗面第一代萬億參數多模態模型 Kimi K2.5 官宣月底結束服役
作者:歸瀧 責編:歸瀧 評論: 8 月 24 日消息,月之暗面 Kimi 官方微博今日宣佈,其第一代萬億參數多模態模型 —— Kimi K2.5 本月底即將結束服役。據此前報道,今年 1 月,月之暗面宣佈推出並開源了其最新的 Kimi K2.

消息稱知名 AI 研究員 Luke Metz 離開 OpenAI,加入 Meta 超級智能實驗室
作者:遠洋 責編:遠洋 評論: 感謝網友 華南吳彥祖 的線索投遞!8 月 24 日消息,據知情人士向 Axios 證實,知名 AI 研究員 Luke Metz 已加入 Meta 的超級智能實驗室(Superintelligence Labs)。

Anthropic 最強大模型 Fable 5 遇冷,企業用戶轉向更便宜 AI 產品
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,據英國《金融時報》報道,Anthropic 的美國客戶正在使用更便宜的替代品來替代其最強大的 AI 工具,這在其預計將實現有史以來規模最大的 IPO 之前,對其高支出的商業模式提出了質疑。

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入
作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

企業AI最後一公里:三路人馬在此交鋒
鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。