雷峰網生成式AI

登頂 ICML Oral !專訪上交大團隊:這個 3D 自動標註 AI 太強了

2026年7月15日 03:27

重點摘要

3D空間數據的瓶頸,從來不是算法,而是標註。 作者丨張 璐 編輯丨齊鋮湧 一段普通的室內視頻,讓以前的AI識別,十樣東西能認錯八樣;現在再看,準確率直接飆升到81.06%。這種飛躍,沒靠激光雷達,也沒靠人工標註,全憑AI自己開悟。這是Holi-Spatial在ScanNet++上的實測結果。

站內 AI 整理稿

# 登頂 ICML Oral!專訪上交大團隊:這個 3D 自動標註 AI 太強了

一段普通的室內視頻,讓過去的 AI 來識別,十樣東西可能認錯八樣;如今同樣的畫面,準確率直接飆升到 81.06%。這項飛躍沒有依靠昂貴的雷射雷達,也沒有經過繁瑣的人工標註,而是全憑 AI 自己「開悟」。這項名為 Holi-Spatial 的工作,由全華人頂尖團隊打造,論文已入選 ICML 2026 Oral。團隊來自上海交通大學人工智能學院,他們用一套純軟體管線,從根本上重新定義了 3D 空間數據的獲取方式。長期以來,3D 空間數據是制約整個行業的「硬傷」。硬體上必須依賴雷射雷達或專業深度掃描儀,光是數據採集就把大量開發者拒之門外。

標註環節更是噩夢:標註員要在複雜的點雲或網格中,人眼識別並手動調整每一個物體的三維邊界框,工序極其繁瑣,錯標、漏標家常便飯。學術界也曾嘗試用「前向傳播模型」直接預測包圍框,但缺乏多視角幾何約束,預測結果常常飄在半空中或陷進地板,完全違背物理定律。人工昂貴、算法不穩,3D 標註就這樣卡了業界十年。Holi-Spatial 的誕生,就是為了打破這個困局。團隊巧妙地將最先進的 3D 幾何重建算法與大語言模型結合,設計出一套「三階段數據精煉管線」。輸入普通 2D 視頻,輸出精確的結構化 3D 智能數據,不需要任何人為干預。**第一階段:幾何優化。

** 系統首先利用運動恢復結構(SfM)精確計算相機參數,同時引入單目深度估計模型 Depth-Anything-V3 作為深度先驗。但單目估計常伴隨噪聲與視角不一致,容易出現邊緣「鬼影」。為此,團隊加入 3D 高斯潑濺(3DGS)技術,以前向深度圖與多視角渲染深度進行幾何一致性約束,在連續影片中優化數百萬個高斯點。這一步幾乎完全消除了飄浮物與邊緣虛影,為後續的三維投影打下堅實的物理地基。**第二階段:圖像級感知與 2D-to-3D 升維。** 在乾淨的幾何深度基礎上,系統均勻抽取關鍵幀,利用 Gemini 3 Pro 等強大多模態模型對畫面進行細緻語義描述。

為了防止同一物體在不同幀被賦予不同類名(例如「桌子」變成「寫字檯」),團隊設計了動態類名記憶庫,強制各幀類別命名一致。隨後由 SAM3 生成高質量實例掩膜。關鍵在於,團隊發明「邊緣腐蝕」策略:投影前將 2D 掩膜向內收縮若干像素,僅保留最置信的核心區域,再結合多視角點雲一致性過濾離群點,從而使 3D 包圍框的邊緣誤差壓縮到亞像素級。**第三階段:場景級精煉。** 多視角投影出的包圍框難免有重疊或碎片化。系統先以 3D IoU 閾值 0.2 將空間重疊的同類框合併,再引入三級決策過濾器:置信度高於 0.9 的框直接保留,低於 0.

8 的直接丟棄,處於中間模糊地帶的則由 AI Agent 進行類似人工的二次確認。Agent 配備局部圖像縮放與重新分割工具,極大提升了最終標註的準確率與召回率。確認後的 3D 實體最後被送入 Qwen3-VL-30B,自動生成長文本描述與空間問答對。Holi-Spatial 的問世,恰好呼應了兩位 AI 領袖的判斷。史丹佛教授李飛飛曾強調:「真正的智能必須理解並駕馭三維物理世界」,空間智能是 AI 的必經之路;Tesla 前 AI 負責人 Karpathy 則論斷自動標註不是權宜之計,而是大規模擴展的必要條件。

Holi-Spatial 在室內 3D 空間實現了類似 Tesla 在 2D 駕駛場景完成的標註閉環,而難度與價值高出一個量級。在 ScanNet++ 等權威基準上,Holi-Spatial 給出了近乎斷層的成績。其訓練出的模型在 3D 目標檢測 AP25 上達到 81.06%,AP50 達到 70.05%,而此前最先進的 LLaVA-3D 僅有 12.2% 和 4.80%,提升超過五倍。在空間推理問答任務中,用 Holi-Spatial-4M 數據集微調 Qwen3-VL-8B,準確率從 29.4% 暴漲至 49.1%;3D Grounding 的 AP50 也實現翻倍成長。

然而,這份成績單背後存在一個「溫和的烏托邦」假設:Holi-Spatial 目前僅適用於靜態室內環境。其底層的 SfM 與 3DGS 均假定所有物體絕對靜止,無法處理走動的人、奔跑的寵物或移動的車輛;一旦出現動態物體,高斯重影會導致包圍框徹底變形。此外,每個場景皆需從頭訓練 3DGS,算力開銷極大,無法做到即時載具標註。針對這些局限,團隊負責人、上海交大人工智能學院副教授鍾志航表示,這正是他們正在攻堅的方向。目前學生團隊已在嘗試建立 4D 高斯管線,並探索將重建與生成式模型結合,攻克室外大場景與稀疏視角帶來的挑戰。

他強調:「當算法能自動將『運動的貓咪』與『靜止的客廳』完美剝離時,數據飛輪將爆發出更恐怖的能量。」

談到靈感來源,鍾志航指出,團隊長期深耕 3D/4D 重建,過去這類幾何工作與多模態大模型幾乎沒有交集。直到近兩年,他們意識到 3DGS、SAM3 等工具的能力已跨過臨界點,可以串聯起來為大模型「造」數據。他特別提到,開發過程中大量使用了「Vibe Coding」與 AI Agent,大大減輕了工程細節的負擔,讓團隊能高效完成這套複雜系統。關於偏見問題,鍾志航認為,現有通用基座模型在化學實驗室等垂直領域確實會「抓瞎」,但隨著工業大模型逐步成熟,這類長尾語義偏見將被克服。

而對於大規模重建的用戶隱私,他提醒,未來的具身設備如家庭機器人可能主動獲取場景資訊,如何防範這種「主動式洩密」是硬件廠商需深思考量的端側底線。在被問到首個突破性應用場景時,鍾志航毫不猶豫地回答:「機器人。」目前版本的 Holi-Spatial 可以幫助你在家中找出掉落角落的鑰匙,但要實現「渴了走過去開冰箱拿可樂」,仍需訓練物理意義上可交互的 4D 空間數據。他最後熱情表示:「我們團隊非常年輕,還有很大的野心。歡迎對空間智能、三維多模態感興趣的優秀同學加入,一起探索真正的具身世界!」

空間智能的時代正在加速到來。從靜態室內到動態世界,從理解到交互,Holi-Spatial 已用純軟體管線證明了「數據飛輪」的可行性。當大模型不再只是在 2D 紙上談兵,而是真正走入三維物理世界的那一刻,這項工作或許將成為關鍵的基石。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

34 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前