谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏

重點摘要
首頁 > 智能時代>人工智能 谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏 2026/7/21 15:00:10 來源:IT之家 作者:故淵 責編:故淵 評論: IT之家 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
谷歌 DeepMind 近日發表了一項名為 GenCeption 的創新模型,這項技術打破了傳統計算機視覺領域「一個任務一個專用模型」的格局,僅靠單一模型就能同時勝任深度估計、圖像分割、3D 姿態估計、表面法線預測與相機姿態估計等多項核心視覺任務。根據科技媒體 The Decoder 在昨日(7 月 20 日)的報導,GenCeption 的核心思路是將一個預先訓練好的影片生成模型,逆向改造成能夠理解世界視覺資訊的分析引擎,從而為計算機視覺帶來全新的發展路徑。 在當前的人工智慧領域,大語言模型已經展現出極強的泛化能力。這類模型在學習預測下一個 token 的過程中,會自然吸收語法規則、世界知識與上下文關係,因此能夠靈活應對多種語言任務。然而,計算機視覺領域的發展路徑卻截然不同。傳統的視覺模型大多採用專用架構,例如專門負責分割的「Segment Anything」以及專門負責深度估計的「Depth Anything」,每個模型都只針對單一任務進行最佳化,彼此之間無法共用知識或架構,導致開發與部署成本居高不下。 Google DeepMind 團隊提出的 GenCeption 模型,正是為了解決這個瓶頸。他們選擇以阿里巴巴開源的影片生成模型「通義萬相 Wan2.1」系列為基礎,利用其強大的生成能力,並將其反向應用於視覺理解任務。不同於傳統擴散模型需要透過多步去噪程序才能產生結果,GenCeption 僅需一次前向傳播(one forward pass)就能完成預測,大幅提升了視覺任務的處理速度,同時也降低了運算資源的需求。 GenCeption 的操作方式相當直覺:使用者只需透過文字提示(text prompt)指定任務類型,模型便能自動輸出對應的視覺資訊。例如,它可以輸出深度圖(depth map)、表面法線圖(surface normal map)、分割掩碼(segmentation mask),甚至還能處理相機運動的表示。這表示同一個模型可以同時擔任深度感測器、影像分割器與姿態估計器,不再需要為每個任務分別訓練與部署不同的專用模型。 這項技術的突破在於,它打破了生成式模型與判别式模型之間的壁壘。過去,影片生成模型主要被用來創造新的視覺內容,例如根據文字描述生成動畫或影片片段;而 GenCeption 則證明,這些生成模型在訓練過程中其實已經學會了豐富的視覺結構與空間關係,只要適當地調整輸出方式,就能將這些內部知識轉化為精確的視覺分析結果。換句話說,生成影片的 AI 模型本身就具備理解世界的能力,只是過去沒有人想到要反向利用它。 值得注意的是,GenCeption 採用的基礎模型是阿里巴巴的開源影片模型 Wan2.1。這項選擇不僅展現了 Google DeepMind 對開源社群的重視,也凸顯了跨平台合作的可能性。Wan2.1 本身具備強大的影片生成能力,能夠處理複雜的動態場景與時序資訊,而 GenCeption 則進一步將這些能力延伸到靜態影像的深度理解上,使得模型在面對不同視覺任務時都能保持穩定的表現。 從實際應用角度來看,GenCeption 的出現可能為機器人視覺、自動駕駛、擴增實境(AR)與醫療影像分析等領域帶來新的解決方案。過去,這些領域往往需要同時搭載多個專用模型,才能完成環境感知、物體辨識與空間定位等工作;現在,一個 GenCeption 模型就能一體化處理這些任務,不僅簡化了系統架構,也降低了維護成本與能耗。特別是在邊緣運算裝置上,單一模型的優勢更加明顯,因為它不需要在記憶體中同時載入多個大型模型。 此外,GenCeption 的一次前向傳播特性也讓它在即時應用中佔有優勢。傳統擴散模型為了達到高品質的生成結果,往往需要迭代數十步甚至上百步的去噪過程,這對即時性要求高的場景(如機器人導航或自動駕駛)來說並不實用。GenCeption 跳過了這個冗長的流程,直接從輸入影像與文字提示中產生最終的視覺分析結果,使得反應時間大幅縮短,更接近人類視覺系統的即時感知能力。 Google DeepMind 團隊在發表論文中詳細展示了 GenCeption 在多項標準基準測試中的表現,包括深度估計的準確度、分割的邊界清晰度以及姿態估計的誤差率。結果顯示,儘管 GenCeption 並非為單一任務專門設計,但在多數任務上都能達到與專用模型相當甚至更優的水準,尤其是在跨任務的泛化能力上表現突出。這也證明了「生成模型反轉為理解模型」這條路徑的可行性。 整體而言,GenCeption 的推出象徵著計算機視覺領域正從「專用模型時代」邁向「通用視覺模型時代」。未來,或許我們不再需要為每個視覺任務開發獨立的模型,而是像大語言模型一樣,用一個統一的架構處理所有視覺理解需求。這項技術不僅為研究人員提供了新的思考方向,也為產業界帶來了更高效、更經濟的部署選項。隨著開源生態的持續發展,類似 GenCeption 的跨界模型有望在更多場景中落地應用。
Related
相關文章
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
AI資訊AI新閒資訊正文打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務發布於AI新閒資訊時間 :Jul 21, 2026閱讀 :1分鐘谷歌 DeepMind 團隊近日推出了全新的 GenCeption 模型,嘗試將傳統的視頻生成 AI 逆向改造成能夠深度理解現實世界的視覺分析引擎。
Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結
國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。
Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉
AI資訊AI新閒資訊正文Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘據《金融時報》報道,Meta正研發一款具備全天候多模態感知能力的智能眼鏡原型機。該設備支持“超級感知”模式,能夠以“每隔幾秒”的頻率連續錄製音頻並拍攝照片,用戶可通過Meta AI對捕捉到的音視頻內容進行即時提問與交互。
具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”
AI資訊AI新閒資訊正文具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”發布於AI新閒資訊時間 :Jul 8, 2026閱讀 :1分鐘在具身智能領域,如何讓機器人像人類一樣精準感知物理空間,一直是一個核心難題。近日,螞蟻集團旗下的具身智能公司Robbyant正式開源了LingBot-Vision模型家族。
機器人“空間感”迎來新解法:螞蟻靈波全新視覺模型,11億參數挑戰70億級能力
機器人前瞻(公眾號:robot_pro) 作者 | 李水青 編輯 | 漠影 機器人前瞻7月7日報道,今日,螞蟻靈波同時丟出兩顆“炸彈”:正式發佈空間感知模型LingBot-Depth 2.0,並同步開源其自研的視覺基座模型LingBot-Vision。一套從機器人視覺表徵底層到深度感知能力的完整技術方案的首次集中亮相。 ▲螞蟻靈波發文(圖源:社交媒體X) LingBot-Depth 2.