Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
重點摘要
AI資訊AI新閒資訊正文Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破發布於AI新閒資訊時間 :Jul 20, 2026閱讀 :1分鐘Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。
Google DeepMind 近日發表了一款名為 GenCeption 的全新模型,這項研究最大的特點在於利用預先訓練好的影片生成模型,來解決深度估計、影像分割、3D 姿態估計等經典電腦視覺任務。根據 DeepMind 公布的測試結果,GenCeption 在多項主流基準中表現接近甚至超越當前領域的頂尖水準,更值得關注的是,它所需要使用到的訓練資料規模遠低於傳統的專用視覺模型,為電腦視覺的發展帶來截然不同的路徑。 目前電腦視覺領域的主流做法仍以任務專用模型為主,例如專門用於影像分割的 Segment Anything,以及專注於深度估計的 Depth Anything。不同任務往往需要各自獨立設計的架構,從資料蒐集、標註到訓練流程都必須量身打造,不僅耗費大量時間與運算資源,也導致模型之間難以共享學習到的空間理解能力。DeepMind 研究團隊認為,大型文字到影片模型在預訓練過程中已經學會了場景的空間結構、物體的運動規律,以及語言與視覺之間的對應關係,這樣的特質讓它們有潛力成為通用的視覺基礎模型。 GenCeption 正是基於這個想法而誕生。它採用阿里巴巴開源的影片生成模型 Wan2.1 作為骨幹,並透過簡化的架構設計,實現只需要一次前向傳播便能完成多種視覺任務預測。相較於過去需要為不同任務訓練獨立網路的做法,GenCeption 統一了推理流程,在同一個模型內同時處理多項輸出,大幅提升效率。 在功能方面,GenCeption 可依據文字提示,從同一段影片中生成深度圖、表面法線、分割遮罩以及姿態估計結果。除此之外,它的設計還能透過額外的可訓練模組支援非圖像形式的輸出,例如 3D 關鍵點的定位。這讓 GenCeption 不僅止於 2D 影像的理解,更跨足立體空間的感知,為機器人、自動駕駛、擴增實境等應用領域提供了更全面的視覺基礎。 為了訓練這樣一個多工模型,研究團隊使用了合成資料集,總計包含 7,500 部影片,由 800 個人體模型搭配 200 組動作序列所構成,並透過 Blender 渲染引擎生成。這種完全合成生成的訓練方式,最大的好處是不需要耗費大量人力進行真實世界資料的標註,同時能提供非常精確的像素級標註資訊,讓模型學會準確的幾何與語義理解。 在實際測試中,GenCeption 在深度估計、表面法線預測、3D 姿態辨識以及語言引導分割等任務上都繳出亮眼成績。研究報告指出,它在多項基準測試中達到接近或超過當前領先專用模型的表現,而背後所使用的訓練資料量僅為目前某些業界模型的七分之一到五百分之一。如此懸殊的資料需求差距,不僅證明了影片生成模型作為通用視覺基礎的可行性,也為未來訓練更大規模、更通用的視覺模型打開一扇門。 這項研究的意義在於,它挑戰了電腦視覺多年來「一個任務一個模型」的既定典範。若能持續驗證生成模型內涵的空間與運動知識確實可以遷移到各種感知任務,未來的視覺系統或許不再需要為每個新任務從頭收集龐大的標註資料,而是像語言模型一樣,在預訓練階段就具備大量常識,再透過少量微調或提示來適應多樣的需求。 GenCeption 的出現也反映生成式模型與判別式任務之間正在加速融合。過去生成模型主要被用來創造影像與影片,如今 DeepMind 證明了這些模型內部表徵同樣可以用來解決傳統的感知問題。這種跨界的應用思維,有可能改寫電腦視覺的研究方向,尤其對於資料取得不易或標註成本過高的應用場景,提供一條更輕量、更高效的解決路徑。 當然,從研究到實際落地還有不少挑戰需要克服。GenCeption 目前仍在特定基準上進行驗證,合成資料訓練出的模型能否無縫遷移到真實世界多變的場景,以及模型在複雜遮擋、光影變化等邊際狀況下的穩定性,都是下一步需要深入探討的課題。不過,單就這項研究所展現的成果來看,將影片生成模型重新定位為通用視覺理解引擎,已經為業界帶來全新的思考方向。 隨著生成式 AI 技術持續進展,GenCeption 這類工作很可能只是一個起點。未來我們或許會看到更多研究工作投入探索如何從大型生成模型中萃取空間與運動知識,並將其應用於機器人操作、自動駕駛感知、醫學影像分析等領域。藉由降低對大規模人工標註資料的依賴,電腦視覺的開發門檻有望進一步下降,讓更多創新應用得以更快實現。
Related
相關文章

國產視覺AI老大,用一款開源模型宣告“縫合怪”時代終結
國內視覺AI領域的龍頭企業,近日正式開源一款全新模型,此舉被業界視為終結「縫合怪」時代的關鍵信號。所謂「縫合怪」,過去常被用來形容那些為了快速上線而雜湊多種不相關技術、甚至混入安全判斷或思考模板的模型,導致核心視覺能力不純、難以真正落地。這家國產大廠選擇以開源方式推出純粹的視覺模型,意在宣告此類拼湊式開發已走到盡頭。
Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉
AI資訊AI新閒資訊正文Meta被曝研發全天候AI眼鏡:支持超級感知與無感音視頻捕捉發布於AI新閒資訊時間 :Jul 9, 2026閱讀 :1分鐘據《金融時報》報道,Meta正研發一款具備全天候多模態感知能力的智能眼鏡原型機。該設備支持“超級感知”模式,能夠以“每隔幾秒”的頻率連續錄製音頻並拍攝照片,用戶可通過Meta AI對捕捉到的音視頻內容進行即時提問與交互。
具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”
AI資訊AI新閒資訊正文具身智能新突破:螞蟻集團開源LingBot-Vision,讓機器人擁有“空間感”發布於AI新閒資訊時間 :Jul 8, 2026閱讀 :1分鐘在具身智能領域,如何讓機器人像人類一樣精準感知物理空間,一直是一個核心難題。近日,螞蟻集團旗下的具身智能公司Robbyant正式開源了LingBot-Vision模型家族。
機器人“空間感”迎來新解法:螞蟻靈波全新視覺模型,11億參數挑戰70億級能力
機器人前瞻(公眾號:robot_pro) 作者 | 李水青 編輯 | 漠影 機器人前瞻7月7日報道,今日,螞蟻靈波同時丟出兩顆“炸彈”:正式發佈空間感知模型LingBot-Depth 2.0,並同步開源其自研的視覺基座模型LingBot-Vision。一套從機器人視覺表徵底層到深度感知能力的完整技術方案的首次集中亮相。 ▲螞蟻靈波發文(圖源:社交媒體X) LingBot-Depth 2.

CVPR 2026最熱方向,被一家杭州團隊率先跑進了端側!
response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。</think>: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。 response: 杭州團隊在CVPR 2026熱門方向上取得突破,繼VLM-R1之後,推出了全球首個端側流式多模態模型。這項進展讓該技術率先在終端設備上實現應用。相關成果展現了端側AI領域的最新發展動向。
PP-OCRv6 登上 Hugging Face:支援 50 種語言的 OCR,參數量從 150 萬到 3450 萬
PP-OCRv6 是 PaddleOCR 最新一代通用 OCR 模型系列,專為真實世界的文字檢測與識別而設計,適用於文件、螢幕截圖、多語言影像、數位顯示等場景。您可先在線評估 PP-OCRv6,再透過 PaddlePaddle、Transformers 或 ONNX Runtime 後端整合輕量且生產就緒的 OCR 功能。