​打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務

2026年7月21日 10:027700 次瀏覽

重點摘要

AI資訊AI新閒資訊正文​打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘谷歌 DeepMind 團隊近日推出了全新的 GenCeption 模型,嘗試將傳統的視頻生成 AI 逆向改造成能夠深度理解現實世界的視覺分析引擎。

站內 AI 整理稿

Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。使用者只需輸入簡單的文字提示,例如描述場景或目標物體,模型便能精準輸出深度圖、分割掩碼以及相機運動軌跡等多種資訊。這項設計讓 GenCeption 在實務應用上極具彈性,無論是自動駕駛、機器人導航、擴增實境還是影像後製,都能透過單一模型快速取得所需的視覺理解結果。 值得注意的是,GenCeption 的訓練資料規模遠比外界想像的小。團隊僅使用約 7500 段由 Blender 渲染的單人合成視頻進行訓練,但模型展現出驚人的泛化能力。在實際測試中,它不僅能流暢處理真實世界中的多人視頻,還能輕鬆將分析能力遷移至動物與機器人類別。即便是細微的髮絲、動物的毛髮或機器人關節等細節,模型都能保留精確的輪廓與深度資訊,顯示其學習到的視覺特徵具有高度通用性。 在處理速度方面,GenCeption 也交出亮眼成績。根據團隊公布的數據,小模型處理 81 幀視頻僅需約 6 秒,而具備 140 億參數的大模型也只需要約 10 秒左右。這意味著即使在邊緣裝置或即時應用場景中,GenCeption 也能提供接近即時的視覺分析能力,大幅降低以往需要多個模型輪流運算所帶來的延遲與資源消耗。 這項技術的誕生,源於 Google DeepMind 團隊對視頻生成模型潛力的重新思考。傳統上,視頻生成模型被視為創造內容的工具,但團隊發現,這些模型內部其實已內建對空間關係、物體邊界與運動軌跡的深刻理解。若能將這份理解反向提取出來,就能讓生成模型「看」懂世界,而非只是「畫」出世界。GenCeption 正是這個概念的具體實現,它將生成過程中的中間表徵轉化為可用的視覺任務輸出,從而繞過傳統監督學習需要大量標註資料的瓶頸。 對於機器人領域而言,GenCeption 的出現尤其具有意義。機器人需要在未知環境中即時感知深度、辨識物體、估計自身姿態,過去這些功能往往需要整合多個獨立模型,導致系統複雜且反應遲緩。如今單一模型便能同時提供深度圖、分割掩碼與相機軌跡,讓機器人能夠更快速且精準地理解周遭環境,有助於提升自主導航與操作的安全性。 此外,GenCeption 的訓練方式也為未來視覺 AI 的發展提供了新方向。傳統的視覺模型仰賴大量人工標註的真實影像,成本高昂且難以涵蓋所有情境。而 GenCeption 僅使用合成數據就能達到令人滿意的泛化表現,代表合成資料與生成模型的結合可能成為降低訓練門檻的有效途徑。這不僅能加速模型開發,也能讓更多資源有限的團隊投入視覺 AI 的創新。 在實際應用層面,GenCeption 的潛力橫跨多個產業。例如在影視後製中,創作者可以透過文字描述快速獲得場景的深度圖與分割遮罩,大幅簡化合成特效的流程。在醫療影像分析中,模型能協助標註器官邊界與病灶位置。在自動駕駛領域,即時產生的深度圖與物體分割資訊可作為感知系統的備援輸入,提升決策的可靠性。而對於擴增實境開發者來說,一次性取得相機姿態與場景幾何資訊,能讓虛擬物體更自然地融入真實環境。 Google DeepMind 團隊表示,GenCeption 目前仍處於研究階段,但已開放部分技術細節供學術界與產業界參考。未來他們計劃進一步優化模型架構,探索更高效的訓練策略,並將任務範圍擴展至更多視覺理解領域。這項成果不僅挑戰了「專用模型才能做好專用任務」的傳統思維,也為多任務視覺 AI 的發展開闢了全新路徑。 隨著 GenCeption 的問世,業界對於視覺 AI 的想像正在被重新定義。從單一任務的專用工具,到能夠同時處理深度、分割、姿態等多種資訊的通用引擎,這項技術有望加速許多垂直領域的智慧化進程。而更令人期待的是,GenCeption 所採用的「逆向生成」策略,或許只是冰山一角,未來還有更多生成模型中的隱藏知識等待被挖掘。

Related

相關文章

IT之家電腦視覺

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏

首頁 > 智能時代>人工智能 谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏 2026/7/21 15:00:10 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。

1 小時前

Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破

AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。

1 天前4200
智東西電腦視覺

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結

國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。

4 天前

Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉

AI資訊AI新閒資訊正文Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘據《金融時報》報道,Meta正研發一款具備全天候多模態感知能力的智能眼鏡原型機。該設備支持“超級感知”模式,能夠以“每隔幾秒”的頻率連續錄製音頻並拍攝照片,用戶可通過Meta AI對捕捉到的音視頻內容進行即時提問與交互。

1 週前6400

具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”

AI資訊AI新閒資訊正文具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”發布於AI新閒資訊時間 :Jul 8, 2026閱讀 :1分鐘在具身智能領域,如何讓機器人像人類一樣精準感知物理空間,一直是一個核心難題。近日,螞蟻集團旗下的具身智能公司Robbyant正式開源了LingBot-Vision模型家族。

1 週前4500
智東西電腦視覺

機器人“空間感”迎來新解法:螞蟻靈波全新視覺模型,11億參數挑戰70億級能力

機器人前瞻(公眾號:robot_pro) 作者 | 李水青 編輯 | 漠影 機器人前瞻7月7日報道,今日,螞蟻靈波同時丟出兩顆“炸彈”:正式發佈空間感知模型LingBot-Depth 2.0,並同步開源其自研的視覺基座模型LingBot-Vision。一套從機器人視覺表徵底層到深度感知能力的完整技術方案的首次集中亮相。 ▲螞蟻靈波發文(圖源:社交媒體X) LingBot-Depth 2.

2 週前