何夕2077模型更新

騰訊發佈混元三維模型

2026年8月6日 00:00

重點摘要

騰訊發布混元三維模型 Hunyuan3D-Buffalo 1.0,以單一架構整合三維理解、文字轉三維生成、指令引導編輯與部件生成。團隊建構了8700萬規模的三維多模態語料庫,並結合 VLM 與 DiT 模型,在生成與編輯基準上達到領先表現。

站內 AI 整理稿

騰訊正式發表新一代統一多模態三維模型「Hunyuan3D-Buffalo 1.0」,這項技術突破將三維理解、生成與編輯功能整合在單一架構內,為電腦視覺與三維內容創作領域帶來全新解決方案。該模型由騰訊多媒體實驗室團隊主導開發,論文已於 arXiv 公開,並在 GitHub 與專案頁面提供完整技術細節。 近年來,影像生成領域已證明統一多模態模型能同時處理理解、生成與編輯任務,但三維建模領域因缺乏大規模且幾何一致的編輯資料,進展相對緩慢。為解決此問題,騰訊團隊提出 Hunyuan3D-Buffalo 1.0,以單一架構同時支援三維理解、文字轉三維生成、指令引導三維編輯,以及文字驅動的部件生成,讓模型不再僅能處理單一任務,而是具備完整的三維內容創作能力。 為了實現大規模訓練,團隊建構了一個規模達 8700 萬筆樣本的三維多模態語料庫。其中包含 2500 萬筆理解樣本、5000 萬筆文字轉三維配對資料,以及 1200 萬筆編輯配對資料。這些編輯配對資料是透過團隊自行開發的 Nano3D-v2 工具自動生成,確保訓練資料在多樣性與一致性上達到足夠水準,為統一模型的訓練奠定堅實基礎。 在架構設計上,Hunyuan3D-Buffalo 1.0 結合了兩個核心模組:Hunyuan3D-VLM 負責語義、結構與空間理解,提供多模態語義條件;Hunyuan3D DiT 則負責高保真三維合成。當模型執行編輯或部件生成任務時,會額外以來源物件的表徵作為擴散過程的條件輸入,確保整體結構與未編輯區域得以保留,避免產生不連貫的變形或破壞。 這套統一框架在實際應用中的優勢相當明顯。過去,三維模型往往需要針對不同任務分別訓練專用模型,不僅耗費大量運算資源,也難以在不同任務間共享知識。Hunyuan3D-Buffalo 1.0 透過單一模型同時處理多種任務,不僅簡化了部署流程,也讓模型在理解與生成之間互相增益,提升整體表現。 根據團隊在論文中公布的實驗結果,Hunyuan3D-Buffalo 1.0 在文字轉三維生成與三維編輯基準測試上均達到最先進或領先水準,同時展現出強大的理解能力與部件生成能力。分析更進一步指出,生成任務與理解任務之間的相互促進,證明了統一三維多模態訓練的有效性,也為未來三維模型發展提供了新方向。 專案頁面目前已上線,提供模型論文、視覺化展示與更多技術細節。團隊成員包括 Junliang Ye、Kenkun Liu、Guocun Wang、Yang Li、Yansong Qu、Chunshi Wang、Jingwei Xu、Yunhan Yang、Zibo Zhao、Jiachen Xu、Jiaao Yu、Lifu Wang、Zhihao Liang、Zhuo Chen 與 Chunchao Guo,論文於 8 月 3 日提交,8 月 5 日由社群使用者上傳至 arXiv 平台。 業界觀察人士指出,騰訊此次推出的統一三維模型,不僅展現了其在多模態 AI 領域的技術積累,也為自動化三維內容創作、虛擬世界建構、遊戲開發、工業設計等應用場景提供了更高效的工具。隨著數位孿生、元宇宙等概念持續升溫,能夠同時理解、生成與編輯三維內容的統一模型,將有望大幅降低內容創作的門檻與成本。 值得注意的是,Hunyuan3D-Buffalo 1.0 的訓練資料規模達到 8700 萬筆,其中編輯配對資料的生成工具 Nano3D-v2 本身就是一個創新點。過去三維編輯資料難以大規模取得,團隊透過自動化方法解決了這個瓶頸,讓統一模型的訓練成為可能。這也意味著,未來三維 AI 模型的發展將不再受限於資料稀缺,而可以更專注於架構與演算法的精進。 目前,該模型已在 Hugging Face 社群獲得超過 73 個讚好,並有多篇相關論文在 Semantic Scholar 中被推薦比較,顯示學術界對此工作的關注度相當高。雖然尚未有模型或資料集直接引用此論文,但隨著專案頁面與論文的公開,預計後續將有更多研究團隊基於此框架進行延伸應用。 整體而言,Hunyuan3D-Buffalo 1.0 的發表標誌著三維多模態模型從「分離任務」走向「統一框架」的重要一步。騰訊透過建構大規模語料庫與創新架構,成功打破了過去三維理解、生成與編輯之間的壁壘,為未來更智慧、更靈活的三維內容創作平台鋪平了道路。

Related

相關文章

鈦媒體模型更新

耗時41分鐘,千問辦公押注了怎樣的Agent未來?

千問辦公在生成具身智能行業週報的測試中耗時41分鐘,速度雖慢但強調深度判斷與信源核實,與其他追求效率的AI辦公產品形成對比。文章探討了Token作為AI時代商業語言,以及企業可能推動Agent走向更「重」的未來,以建立用戶信任。三款產品代表不同路線,千問辦公選擇了更注重判斷過程的路徑。

剛剛
鈦媒體模型更新

辦公智能體平臺“Work”大作戰

騰訊WorkBuddy崛起帶動辦公智能體平台賽道競爭加劇,阿里、字節等大廠加速整合旗下產品迎戰,市場規模快速成長。各大廠商在商業化模式上持續摸索,飛書、滴普等業者表現不一,未來競爭將更為激烈。

剛剛

飛書併入豆包、千問辦公整合,大廠AI大戰從“賽馬”到“合兵”?

字節跳動近日發佈內部信,宣布對旗下豆包、飛書與火山引擎相關業務進行整合。其中,飛書產品團隊與豆包產品團隊正式合併,組成新的豆包產品團隊,由原本的豆包負責人趙祺統一管理。這是字節跳動自2021年設立六大業務單元以來,針對B端業務所進行的一次關鍵架構調整。字節跳動在內部信中說明,AI正深刻改變企業生產力與個人工作方式,這項整合旨在打通辦公與生產力產品的研發體系,進一步強化服務企業客戶的能力。 這波調整並非單純的團隊合併,而是一次從產品、技術到底層商業化體系的全面重組。

剛剛