TUM 教授 Angela Dai:放下完美數據執念,「逆向自監督」重構 3D 空間智能 | ECCV 2026

2026年9月14日 02:47
站內 AI 整理稿

2D去噪範式在真實3D遮擋前失效,破局關鍵在於將物理機制轉化為結構先驗。作者丨張璐 編輯丨岑峰 大模型在文本與 2D 圖像上的狂飆,歸功於互聯網上近乎無窮的乾淨數據。但當 AI 試圖跨越屏幕、理解真實的 3D 物理世界時,這套經驗法則瞬間失效。真實掃描數據充斥著噪點與死角,物理遮擋造成的幾何缺失既非隨機發生,更無法用簡單的去噪算法抹平。面對這一死結,多數團隊選擇用人工合成數據去“硬碰硬”,卻始終難以跨越虛實結合的鴻溝。在 ECCV 現場,慕尼黑工業大學(TUM)Angela Dai 教授展示了一套逆轉行業思路的解法:不必強行克服數據的“不完整”,把真實的物理遮擋機制,直接變成算法的結構先驗。

這項研究不僅打破了 3D 場景重建中困擾已久的“均值模糊”魔咒,更清晰地標定了空間智能(Spatial AI)從“靜態 3D 拼圖”走向“原生具身大腦”的技術演進路線。整套破局邏輯由三個層層遞進的技術支柱構成:第一,將物理遮擋轉化為逆向自監督(SG-NN)。團隊先是將傳感器的視野拆解為已知空域、已觀測表面與未知盲區的三狀態編碼。團隊摒棄對盲區的盲目強行預測,通過故意扣除觀測幀構建訓練對,用掩碼損失(Mask Loss)讓物理遮擋本身成為最天然的自監督標靶。第二,用“幾何骨架 + 2D 渲染”破解均值模糊(Seen2Scene)。

面對大面積盲區帶來的嚴重歧義,引入可見性引導的流匹配(Seen2Scene)與 3D 高斯濺射(WorldMesh)。由穩定幾何提供不漂移、不坍塌的“骨架”,再借由 2D 圖像先驗反哺高保真“皮肉”,首次將連貫生成的尺度拉伸到了七八個房間的環境級空間。第三,從生成反哺重構,走向機器人的“主動感知”(GenRecon):將合成場景學到的結構先驗反向注入真實重構(GenRecon),更順理成章地將物理可見性推演至具身智能領域。讓 AI 不再是被動接收殘缺圖像的畫師,而是能夠預判未觀測空間、自主規劃最佳探路路徑的空間智能體。

以下為演講全文,AI科技評論在不改變原意的基礎上,對內容進行了整理與編輯: 01數據天然“殘缺”:為什麼 2D 擴散範式在 3D 空間徹底失效?文本和圖像生成的爆發,本質上建立在互聯網海量公開數據的紅利之上。無論是能侃侃而談的大語言模型,還是瞬間繪圖的生成算法,背後都有龐大的文本文獻、藝術作品和照片庫作為支撐。然而,當人工智能嘗試踏入物理空間去生成 3D 場景時,這種基於海量數據的經驗法則迅速失效了。現實環境不僅雜亂且充斥著傳感器噪聲,更難以克服的是物體相互遮擋帶來的視角盲區。

這種遮擋造成的幾何缺失既非隨機產生,也不符合常規的統計分佈,導致在 2D 領域大獲成功的“加噪-去噪”擴散範式無法直接套用。如果退而求其次使用人工構建的合成場景,模型雖然能獲得完整的幾何結構,卻又會因為缺失現實生活的隨機佈局與複雜雜亂感,陷入“合成與現實”之間難以跨越的鴻溝。在最新的研討會分享中,她給出了一個兼具工程美感與物理直覺的解法:不再強行克服數據的“不完整”,而是直接引入空間本身的物理原則,讓 AI 學會利用已知的空無與遮擋關係,主動在殘缺的觀測中推演完整的現實。

02把遮擋變先驗:用“已知空無”推演未知的物理結構要打破 3D 數據採集的天然缺陷,首要突破在於將物理相機的觀測機制轉化為算法能理解的幾何先驗。當深度傳感器觀測一個場景時,它不僅捕捉到了物體的表面,還隱性地界定出了三類空間狀態:在傳感器與表面之間,是確定的已知空域;表面本身是已觀測幾何;而被表面遮擋的後方,則是狀態未知的未觀測區域。這種天然的空間劃分構成了自監督訓練的核心依據。傳統模型試圖對全局每一個點進行強行預測,往往會導致盲目填補未觀測盲區。Angela 教授團隊提出了一套逆向自監督公式,從多幀融合的場景掃描中故意移除部分觀測幀,構建出“更殘缺的輸入”與“相對完整的標靶”組成的訓練對。

在訓練過程中,損失函數會通過掩碼顯式地忽略所有未觀測的未知空間,僅僅針對已被人工製造出的缺陷區域施加監督。網絡在第一層將場景編碼為稀疏 TSDF 體素,並藉助稀疏卷積僅在有表面的區域進行高效計算。在空間壓縮的瓶頸層,模型開始預測需要衍生出新幾何的具體位置,隨著分辨率層級的逐步倍增,實時識別並丟棄為空的區域,最終輸出緊湊且完整的幾何結構。這種針對多類不完整模式訓練出的模型,不僅能恢復被遮擋的角落,甚至能生成比原始採集目標更加完整的 3D 場景。不過,單純依靠迴歸損失的解法依然存在瓶頸。

在缺失區域較小、周圍語義明確時,迴歸模型表現優異;但面對大面積的物理盲區,傳統損失往往會陷入均值收斂的魔咒,導致預測出的幾何變成模稜兩可的模糊塊狀或乾脆留空。要解決這種深度歧義,就必須從確定性迴歸走向具備概率建模能力的生成式範式。03別長距離漂移:基於幾何骨架與 3DGS 的全景長圖渲染為了解決大面積幾何缺失帶來的歧義,生成式擴散模型被引入到了 3D 場景重建中。團隊在基於激光傳感器的 ScanNet++ 數據集上進行訓練,將可見性原則徹底融進 token 的序列化表達裡。

模型將已知表面、已知空域和未知體素分別映射為潛在編碼,並允許引入場景佈局、文本提示乃至由大語言模型生成的邊界框作為先驗條件。這種以局部小區域(例如 1.5×2 米)為單位的切片計算方式,使得模型不僅能在像浴室馬桶缺失這樣的複雜盲區合理推演並補全結構,更能無縫平移擴展到任意尺寸的空間。在獲得了高質量的幾何“骨架”之後,場景的外觀“皮肉”合成展現出了更高的自由度。雖然單純依賴大語言模型安排佈局容易顯得僵硬人工,但成熟的 2D 圖像生成模型卻天然具備生成逼真且富含生活雜亂感畫面的能力。算法先生成基礎幾何,隨後藉助圖像模型跨視角採樣併合成具有豐富紋理的圖像,再將這些像素反向提取回網格。

最終,整個場景由 3D 高斯(3DGS)技術進行全局優化,並利用基礎網格進行幾何正則化,從而在稀疏視角的輸入下依然能保持極高的畫面質量與視角一致性。這種由幾何底層提供穩定支撐的生成路線,一舉解決了傳統全景生成方法在離開中心視角後容易出現畫面漂移和坍塌的難題。藉助這一框架,模型甚至可以跨越七到八個房間的連貫空間,無論是充滿現實細節的大型室內環境,還是富有奇幻色彩的抽象場景,都能實現長距離、高一致性的穩定渲染。04終局形態:從原生 3D 統一大模型到機器人的“主動感知”除了在真實數據上利用掩碼進行自監督學習,另一種互補的思路是逆向利用合成數據的結構優勢。

通過在 SAGE 這種乾淨且完整的合成場景數據集上訓練生成模型,算法能夠先一步學會在局部輸入下生成完整結構的通用幾何先驗,隨後再將這種先驗反向遷移應用至現實世界。算法將多視角圖像、相機參數以及稀疏點雲統一投影到全局空間進行聚合,即使現實中的書架或雜物超出了合成數據的分佈範圍,模型依然能憑藉強大的通用先驗填補掃描盲區,還原出清晰完整的物理結構。站在更長遠的視角來看,空間 AI 的終局在於幾何、外觀與語義的深度融合。當前行業普遍將這三者割裂處理,甚至只是把 2D 視覺模型的語義特徵簡單疊加到 3D 表達之上。

真正高效的範式應當是建立原生的 3D 統一大模型,因為在明確知道要生成一張椅子時,幾何結構的構建本身就會變得更加容易。不僅如此,物理可見性原則還將推演至機器人的主動探索領域。當 AI 不再是被動接收人類拍到的殘缺圖像,而是能夠主動預測未觀測區域的面貌時,它就能自主決定下一個最佳觀測位置,從而以最優路徑完成複雜空間內的感知與任務交接。05現場 Q&A:技術邊界與落地現實在 Q&A 環節中,Angela 教授明確指出了當前 3D 生成落地的兩大現實邊界:一是擴散生成模型繁複採樣帶來的高延遲問題,二是複雜場景下精度與速度的平衡。

這預示著輕量化稀疏體素與局部包圍盒(Bounding Box)優化將是工業級部署的關鍵。▎Q:三平面(Triplane)表達機制是否存在無法生成高保真 3D 的天然缺陷?A: 模型難以生成極細粒度結構的核心瓶頸在於分辨率上限,而非三平面生成先驗本身的邏輯缺陷。在室內合成數據集上訓練的三平面生成器擁有足夠大的數據吞吐量,能夠處理絕大多數場景物件。只要訓練數據與目標環境分佈保持相似,且相機位姿處於合理精度範圍內,從合成空間遷移到真實環境完全可行。▎Q:這套生成與重建框架在實際運行時的速度表現如何?能否做到實時生成?

A: 目前展示的模型未經專門的速度優化,需要根據具體應用場景在精度與速度之間做出權衡。基於稀疏體素的迴歸模型在前向傳播時計算極快,足以滿足絕大多數實時性需求;但具備高擬真度的擴散生成模型由於採樣過程繁複,目前尚難以做到實時運行。儘管通過將龐大場景切分為局部小盒(Local Bounding Box)能夠有效控制計算負載,但要想在數秒內即時重構出超大範圍的複雜真實空間,仍有待在擴散採樣與渲染架構上實現進一步的工程加速。為了方便大家抱團交流、互通會議消息,我們專門建了 ECCV 2026 參會交流群!進群你會解鎖這些「福利」?

會議情報站:投稿 DDL、格式規範、評審進度……關鍵節點第一時間送達,再也不怕錯過 deadline,投稿準備穩穩的。同行茶話會:天南海北的同行都在群裡,聊心得、碰思路、攢人脈,科研路上我們同行。前沿補給站:最新研究成果、熱點方向實時同步,結合會議主題幫你捋清投稿脈絡,給論文靈感加滿油。現場後援團:(會議期間專屬開啟):到了會場也不用慌——路線導航:場館分佈、報告廳怎麼走,群裡隨時問;議題共讀:熱門 session、Keynote 現場探討,錯過也能追;Poster 彙編:現場海報精華整理,一鍵收藏不遺漏;約局廣場:約飯局、採訪局、交流局……想嘮嗑、想合作、想面基,群裡發起就成。?

進群傳送門: 掃碼進群或添加微信Qvv0909777,備註:ECCV + 單位/學校+姓名+方向。搞科研/搞技術,信息差很重要。來,一起快人一步!上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

無問芯穹與華環電子簽署戰略合作,共同探索國產異構算力AI基礎設施新方向

無問芯穹與華環電子簽署戰略合作協議,雙方將結合各自在AI軟體平台、網路通信與硬體研發的優勢,共同探索國產異構算力基礎設施的協同方案。此次合作聚焦於智算中心解決方案及「Token工廠」新模式,目標是推動計算、網路與AI原生基礎設施深度融合,為AI規模化應用提供高效穩定的支撐。

9 分鐘前
IT之家生成式AI

優步全球範圍裁員 10%,被裁員工稱 AI 已大舉滲透日常工作

作者:清源 責編:清源 評論: 9 月 18 日消息,據《商業內幕》今天(18 日)晚間報道,在優步(Uber),AI 已經滲透到員工工作的許多環節,從回答 Slack 裡的內部問題,到替乘客行程中聯繫客服時收到的消息撰寫回復。6 名近期遭裁員的員工透露,過去幾個月,AI 在工作中的使用範圍明顯擴大,其中一些人甚至會通過提示詞讓 AI 完成相當一部分任務。

3 小時前
鈦媒體生成式AI

月之暗面遞表之後,Kimi 的成色要被驗算三遍

舒澤品牌手記2026.09.18 18:16 · 來自浙江全文4982字00:00 / 14:05Anthropic 的 30 萬次指控,會成為招股書的第幾頁?文 | 舒澤品牌手記9月17日,月之暗面發佈了一套金融行業解決方案。按官方披露,中信建投、中金公司、易方達等數十家金融機構已經在用 Kimi 處理投研建模、風險排查和盡調材料——研究人員把管理層報表、審計報告和盡調文件交給 Kimi,拿回一份可以繼續調整假設的 Excel 模型。同一天,深圳商報記者就港股上市進展、股東架構調整等事項向月之暗面發去採訪函。

5 小時前

Calibre上手 AI 互動寫作:電子書管理器搖身變成"文字冒險遊戲引擎"

這個遊戲默認藏而不發,不會跟著 Calibre 啟動就冒出來。用戶得主動在"首選項 — 工具欄和菜單"裡把它請到主工具欄,才算真正激活。它的玩法很清晰:由 AI 在後臺搭起並掌管一個虛構世界,用戶通過不斷輸入文字來推著故事往前走,等於把"讀電子書"這件事,翻轉成了"和 AI 一起寫故事"。

7 小時前