騰訊發佈混元三維模型
重點摘要
騰訊發布混元三維模型 Hunyuan3D-Buffalo 1.0,以單一架構整合三維理解、文字轉三維生成、指令引導編輯與部件生成。團隊建構了8700萬規模的三維多模態語料庫,並結合 VLM 與 DiT 模型,在生成與編輯基準上達到領先表現。
騰訊正式發表新一代統一多模態三維模型「Hunyuan3D-Buffalo 1.0」,這項技術突破將三維理解、生成與編輯功能整合在單一架構內,為電腦視覺與三維內容創作領域帶來全新解決方案。該模型由騰訊多媒體實驗室團隊主導開發,論文已於 arXiv 公開,並在 GitHub 與專案頁面提供完整技術細節。近年來,影像生成領域已證明統一多模態模型能同時處理理解、生成與編輯任務,但三維建模領域因缺乏大規模且幾何一致的編輯資料,進展相對緩慢。為解決此問題,騰訊團隊提出 Hunyuan3D-Buffalo 1.
0,以單一架構同時支援三維理解、文字轉三維生成、指令引導三維編輯,以及文字驅動的部件生成,讓模型不再僅能處理單一任務,而是具備完整的三維內容創作能力。為了實現大規模訓練,團隊建構了一個規模達 8700 萬筆樣本的三維多模態語料庫。其中包含 2500 萬筆理解樣本、5000 萬筆文字轉三維配對資料,以及 1200 萬筆編輯配對資料。這些編輯配對資料是透過團隊自行開發的 Nano3D-v2 工具自動生成,確保訓練資料在多樣性與一致性上達到足夠水準,為統一模型的訓練奠定堅實基礎。在架構設計上,Hunyuan3D-Buffalo 1.
0 結合了兩個核心模組:Hunyuan3D-VLM 負責語義、結構與空間理解,提供多模態語義條件;Hunyuan3D DiT 則負責高保真三維合成。當模型執行編輯或部件生成任務時,會額外以來源物件的表徵作為擴散過程的條件輸入,確保整體結構與未編輯區域得以保留,避免產生不連貫的變形或破壞。這套統一框架在實際應用中的優勢相當明顯。過去,三維模型往往需要針對不同任務分別訓練專用模型,不僅耗費大量運算資源,也難以在不同任務間共享知識。Hunyuan3D-Buffalo 1.0 透過單一模型同時處理多種任務,不僅簡化了部署流程,也讓模型在理解與生成之間互相增益,提升整體表現。
根據團隊在論文中公布的實驗結果,Hunyuan3D-Buffalo 1.0 在文字轉三維生成與三維編輯基準測試上均達到最先進或領先水準,同時展現出強大的理解能力與部件生成能力。分析更進一步指出,生成任務與理解任務之間的相互促進,證明了統一三維多模態訓練的有效性,也為未來三維模型發展提供了新方向。專案頁面目前已上線,提供模型論文、視覺化展示與更多技術細節。
團隊成員包括 Junliang Ye、Kenkun Liu、Guocun Wang、Yang Li、Yansong Qu、Chunshi Wang、Jingwei Xu、Yunhan Yang、Zibo Zhao、Jiachen Xu、Jiaao Yu、Lifu Wang、Zhihao Liang、Zhuo Chen 與 Chunchao Guo,論文於 8 月 3 日提交,8 月 5 日由社群使用者上傳至 arXiv 平台。
業界觀察人士指出,騰訊此次推出的統一三維模型,不僅展現了其在多模態 AI 領域的技術積累,也為自動化三維內容創作、虛擬世界建構、遊戲開發、工業設計等應用場景提供了更高效的工具。隨著數位孿生、元宇宙等概念持續升溫,能夠同時理解、生成與編輯三維內容的統一模型,將有望大幅降低內容創作的門檻與成本。值得注意的是,Hunyuan3D-Buffalo 1.0 的訓練資料規模達到 8700 萬筆,其中編輯配對資料的生成工具 Nano3D-v2 本身就是一個創新點。過去三維編輯資料難以大規模取得,團隊透過自動化方法解決了這個瓶頸,讓統一模型的訓練成為可能。
這也意味著,未來三維 AI 模型的發展將不再受限於資料稀缺,而可以更專注於架構與演算法的精進。目前,該模型已在 Hugging Face 社群獲得超過 73 個讚好,並有多篇相關論文在 Semantic Scholar 中被推薦比較,顯示學術界對此工作的關注度相當高。雖然尚未有模型或資料集直接引用此論文,但隨著專案頁面與論文的公開,預計後續將有更多研究團隊基於此框架進行延伸應用。整體而言,Hunyuan3D-Buffalo 1.0 的發表標誌著三維多模態模型從「分離任務」走向「統一框架」的重要一步。
騰訊透過建構大規模語料庫與創新架構,成功打破了過去三維理解、生成與編輯之間的壁壘,為未來更智慧、更靈活的三維內容創作平台鋪平了道路。
Related
相關文章

Meta 旗下 AI 模型測試時意外入侵第三方企業系統
Meta 在進行AI模型安全測試時,因第三方公司Irregular配置錯誤,導致模型意外入侵另一企業系統。涉事模型為Muse Spark 1.1,事件引發對AI模型可能衝出邊界、發動網絡攻擊的擔憂。

拆解“AI辦公入口戰”底層:怎麼做才能成為最終贏家?
字節、阿里、騰訊等大廠正透過組織調整與產品整合,全力爭奪AI辦公入口,關鍵在於模型、場景、生態與商業體系的全面競爭。這場戰爭的核心是透過AI產品實現Token經濟的商業閉環,並以「效果」為標準,透過自有體系與外部生態滿足企業用戶的真實需求。最終贏家需兼顧模型能力、場景積累與生態建設,才能在AI生產力時代站穩腳步。

千人聯機世界模型“RhOS-World: Khora”正式發佈
RhOS.ai與Ophilus.AI共同發布了千人聯機世界模型「RhOS-World: Khora」,該模型能讓多達1024個智能體在共享的3D空間中即時互動,且無需傳統物理引擎。其核心技術「STBoard(時空黑板)」架構,透過統一的物理狀態管理,解決了多視角一致性的難題,並大幅降低了擴展智能體數量的運算成本。
TutorMoments:AI 家教何時該出手,何時該放手?
今日我們推出 TutorMoments 預覽版,這是一個評估框架,旨在衡量尖端大型語言模型能否掌握教育中最難的平衡:何時介入協助學生,何時退後讓學生自行努力。TutorMoments 基於真實的一對一數學輔導課程,透過重播方式進行評估。經驗豐富的數學教師會檢視從美國收集的對話記錄。

告別反覆操作 OSD,華碩顯示器管理軟件 DisplayWidget Center 接入 AI 智能體
華碩顯示器管理軟體 DisplayWidget Center 推出重大更新,加入 AI 智能體功能,用戶可透過自然語言調整亮度、色溫等參數,無需操作 OSD。該功能支援 CLI 與 Agent Skill,可根據使用習慣自動切換模式,並適用於企業環境的統一部署。

千問App部分功能探索收費,想學豆包能跑通嗎?
千問App於8月7日更新,新增辦公助理等付費功能,基礎功能仍免費,但辦公場景使用額度需付費取得。此舉仿效豆包專業版等產品的訂閱模式,反映AI行業正集體轉向辦公場景收費,以尋求變現機會。