高德發佈首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,以12幀重建萬幀3D場景

高德於8月28日正式推出首個無長程依賴的萬幀級流式3D重建模型ABot-Recon,這款模型以輕量輸入與高密度輸出的特性,僅需12幀畫面即可重建涵蓋萬幀規模的3D場景,為當前少見突破長序列依賴限制的流式重建方案,也讓空間智慧技術的應用界線再次向前推進。不同於傳統3D重建模型往往需要大量連續幀數才能運作,ABot-Recon的設計核心在於擺脫對長期依賴的仰賴。過去,重建模型若想生成完整3D場景,通常必須依賴數十甚至數百張連續畫面作為基礎,這不僅增加運算負擔,也限制了即時應用的可能性。
ABot-Recon則改以少量幀數作為起點,逐步擴展並生成完整、連貫的3D場景,讓整體運算效率與即時性獲得顯著提升。這項技術突破的意義在於,過往3D重建往往受限於輸入資料的數量與連續性,系統必須先累積足夠幀數才能開始運算,導致從輸入到輸出的延遲較高。而ABot-Recon透過流式架構,讓模型可以在獲得少量畫面後便開始重建,並在後續資料持續輸入的過程中,不斷擴展場景細節。這種機制讓3D場景建置不再需要等待完整資料集,而是可以邊接收資料、邊生成場景,大幅縮短從感知到理解的時間差距。對於需要快速理解空間環境的應用場景而言,這項能力具有相當潛力。
以導航服務為例,傳統地圖建置往往需要大量時間與成本,才能完成一個區域的3D建模,但若ABot-Recon這類模型未來能與地圖服務整合,將有望降低3D場景建置的門檻,讓動態地圖體驗變得更加即時。特別是當道路狀況、建築環境發生變化時,若能以少量畫面快速更新3D場景,地圖服務的準確度與時效性都能獲得明顯改善。自動駕駛領域同樣是這項技術的重要應用方向。自駕車在行駛過程中,必須即時感知周圍環境並做出判斷,而3D場景重建正是車輛理解空間關係的關鍵環節之一。ABot-Recon以少量幀數即可啟動重建的特性,意味著車輛能在更短時間內建立對環境的理解,進而提升決策效率與行車安全。
此外,地圖建置也是這款模型的重要應用場域。傳統3D地圖的製作往往需要專業設備進行大量掃描,再經過繁複的後製處理,才能產出可用的3D模型。ABot-Recon的流式重建機制,讓3D場景可以根據輸入資料持續擴展,這對大規模地圖建置而言,代表著更低的成本與更高的彈性。未來若能應用於城市級3D地圖的建置與更新,將有助於加速數位孿生城市的發展。此次發佈也顯示高德在AI與空間智慧領域的佈局持續加深。作為阿里巴巴集團旗下業務,高德累積了大量地理與交通數據,這些數據正是3D重建模型訓練與應用的重要基礎。
ABot-Recon這類模型若能與高德既有的地圖服務深度整合,將能發揮數據與技術的綜效,進而帶動更即時的動態地圖體驗。從技術層面來看,ABot-Recon的流式重建架構也回應了當前3D視覺領域的一項重要挑戰。傳統重建模型往往受限於長序列依賴問題,也就是模型必須處理大量連續幀才能維持場景的一致性,這不僅消耗大量記憶體,也讓運算時間難以縮短。ABot-Recon透過設計上的調整,讓模型不再需要仰賴長序列輸入,而是在少量幀數的基礎上進行擴展,這對資源有限的應用場景而言,是一項重要的技術進展。對比市場上其他3D重建方案,ABot-Recon的特別之處在於其萬幀級的場景重建能力。
多數重建模型能處理的幀數規模有限,當場景範圍擴大時,往往需要分段處理再進行拼接,這可能導致場景之間出現不一致或縫隙。ABot-Recon則以12幀啟動、逐步擴展的方式,讓模型可以在萬幀規模的場景中維持連貫性,這對大範圍空間的理解與重建而言,具有實質意義。在產品定位上,ABot-Recon的輕量輸入特性也讓它具有更高的應用彈性。對於手機、車載裝置等運算資源相對受限的終端設備而言,能夠以少量畫面啟動3D重建,意味著更多裝置有機會搭載這項功能,而不需要依賴高階運算硬體。這也讓3D重建技術從專業設備走向普及應用的可能性大幅增加。不過,目前官方尚未透露ABot-Recon的具體商用時程。
技術方向已引起業界關注,但要真正落地於導航、自駕或地圖服務,仍需經過實際場景的驗證與調整。3D重建模型的效能表現,往往會受到真實環境中的光線、遮蔽、動態物體等因素影響,如何在實際應用中維持穩定表現,將是後續發展的觀察重點。整體而言,高德推出ABot-Recon,不僅展現了其在AI技術研發上的投入,也透露出空間智慧將成為未來地圖服務競爭的重要戰場。從導航到自動駕駛,從地圖建置到數位孿生,3D重建技術的進步,正在逐步改變人類與空間資訊互動的方式。ABot-Recon以少量幀數啟動萬幀場景重建的突破,為這項技術的應用打開了新的想像空間,也讓外界對高德在空間智慧領域的下一步動作充滿期待。
Related
相關文章

Transformer開始構建三維世界:開源模型幾張圖片秒級生成可探索3D場景
開源模型「影溯」利用Transformer架構,能從少量二維照片在數秒內生成可自由探索的三維場景,大幅降低3D內容生產門檻。該技術已開源釋出,讓用戶只需用手機拍攝數張照片,即可將現實場景轉化為可互動的立體空間,應用於回憶保存、電商展示等領域。儘管對透明物體等複雜場景仍有局限,但影溯正推動三維內容的民主化與即時生產。

與AI共生:2026微信小程序開發大賽WAIC官宣啟動
2026年微信小程序開發大賽於近日在WAIC(世界人工智能大會)上正式宣布啟動,本屆賽事以「與AI共生」為核心主題,旨在鼓勵開發者將人工智能技術深度融入小程序生態,探索人機協作的新應用場景。隨著AI技術持續滲透日常生活,微信團隊期望透過這場競賽,激發更多創新思維,讓小程序不僅成為工具,更能成為用戶與AI互動的智慧節點。

谷歌 DeepMind 發佈 GenCeption:基於阿里 Wan2.1,打破計算機視覺桎梏
作者:故淵 責編:故淵 評論: 7 月 21 日消息,科技媒體 The Decoder 昨日(7 月 20 日)發佈博文,報道稱谷歌 DeepMind 發佈 GenCeption 模型,將預訓練的視頻生成器重新用於深度估計和分割等經典計算機視覺任務。
打破專用模型桎梏!谷歌 DeepMind 發佈 GenCeption,一個 AI 搞定五大視覺任務
Google DeepMind 近日發表了名為 GenCeption 的全新模型,這項突破性技術打破過去視覺任務各自為政的格局,以單一模型同時勝任深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。不同於傳統做法需要針對每項任務訓練專屬模型,GenCeption 將視頻生成 AI 逆向改造為深度理解現實世界的視覺分析引擎,僅需一次前向傳播就能完成預測,大幅提升處理效率。 該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練。

大模型給圖片打分不再“靠嘴說”,結構圖、頻譜圖當“物證”,用“視覺證據”來給圖片打分
西北工業大學與香港科技大學團隊提出IQA-T1框架,讓多模態大模型在評估圖像質量時,不再僅憑直覺,而是透過生成噪聲殘差圖、頻譜圖等視覺證據來進行判斷。此方法在七個圖像質量評估基準上取得綜合最優成績,平均PLCC/SRCC達到0.784,並使評估過程更具可解釋性。
Google DeepMind發佈GenCeption:基於視頻生成模型實現多項計算機視覺突破
Google DeepMind 近日發表了一款名為 GenCeption 的全新模型,這項研究最大的特點在於利用預先訓練好的影片生成模型,來解決深度估計、影像分割、3D 姿態估計等經典電腦視覺任務。根據 DeepMind 公布的測試結果,GenCeption 在多項主流基準中表現接近甚至超越當前領域的頂尖水準,更值得關注的是,它所需要使用到的訓練資料規模遠低於傳統的專用視覺模型,為電腦視覺的發展帶來截然不同的路徑。