MarkTechPost AIAI工具與產品

A Tutorial on GeoAI: Designing Footprint Extraction from NAIP Imagery Using U-Net, Grounding DINO, SAM, and Mask R-CNN

2026年8月2日 21:19

重點摘要

本教學示範如何從高解析度NAIP航照影像中提取建築物足跡,涵蓋從環境設置、資料下載、圖像切割到模型訓練的完整工作流程。使用U-Net(ResNet-34編碼器)進行語義分割,並與Grounding DINO、SAM及預訓練Mask R-CNN進行零樣本與實例分割比較。最後將預測遮罩轉換為正規化建築物多邊形,並計算IoU與F1指標。

站內 AI 整理稿

### GeoAI新教程:結合U-Net、Grounding DINO、SAM與Mask R-CNN實現高精度建築物足跡提取

地理空間人工智慧(GeoAI)領域近期出現一套完整的端到端工作流程,專門針對從高解析度航拍影像中提取建築物足跡。該教程由一群技術專家設計,涵蓋從環境配置、資料下載、模型訓練到推論評估的每一個環節,並整合了多種深度學習架構,包括U-Net、Grounding DINO、SAM以及Mask R-CNN。這項工作不僅展示了傳統語意分割的應用,還探索了零樣本分割以及預訓練實例分割模型的效能,為地理空間資料分析樹立了現代化的實作典範。整份教程以NAIP(國家農業影像計畫)高解析度航拍正射影像作為主要資料來源,並搭配對應的建築物標籤向量資料。

研究團隊首先建立一個基於Python的地理空間深度學習環境,安裝必要的套件如`geoai-py`、`segmentation-models-pytorch`與`buildingregulariser`,並確認GPU加速的可用性。在Colab環境中,若無偵測到GPU,訓練速度會大幅下降,因此作者建議使用者啟用T4 GPU運行時。環境準備完成後,第一步是下載樣本資料。團隊從Hugging Face資料集下載了訓練用的NAIP RGB影像(`naip_rgb_train.tif`)、建築物足跡向量(`naip_train_buildings.geojson`)以及測試影像(`naip_test.

tif`)。接著進行資料檢查,利用`geoai`套件提供的函式讀取光柵影像的資訊,包括座標參考系統、維度、波段統計,以及向量資料的欄位結構與幾何類型。視覺化環節中,建築物標籤以黃色邊框疊加在影像上,並提供互動式地圖供進一步探索。為了讓模型能夠有效學習,團隊將原始NAIP影像切割成固定大小的地理參考圖塊(chips)。每個圖塊尺寸設為512×512像素,步長為256像素,並在標籤遮罩中保留建築物輪廓的緩衝區。切塊後,系統會統計包含建築物的圖塊比例以及前景像素數量,並以6×6的網格展示訓練樣本。這一步驟確保了資料能夠符合模型輸入格式,同時維持空間解析度。

訓練階段採用U-Net架構,並以ResNet-34作為編碼器,預訓練權重來自ImageNet。模型配置包括3個輸入通道(RGB)、2個輸出類別(背景與建築物)、批次大小為8、學習率0.001,最多訓練12個epoch,並保留20%資料作為驗證集。訓練過程中,程式會自動儲存最佳檢查點,並在驗證IoU(交並比)連續5個epoch未改善時提前停止。最終模型檔案大小約為數十MB。訓練完成後,團隊繪製了損失曲線與IoU曲線,以診斷模型是否過擬合或欠擬合。若驗證損失上升而訓練損失下降,表示過擬合;若兩者均平坦且高,則需增加epoch數或改用更大的編碼器。

他們記錄到最佳驗證IoU出現在第幾個epoch,這為後續的模型選擇提供了依據。接著,他們將訓練好的U-Net應用於未見過的測試場景。由於測試影像可能比訓練圖塊大,團隊採用滑動窗口推論(sliding-window inference),窗口大小與重疊率與訓練時的切塊參數一致。推論結果會輸出為二值化遮罩,並進一步透過後處理轉換為乾淨、規則化的建築物多邊形,同時計算IoU和F1分數作為評估指標。除了語意分割,教程還探索了零樣本分割的潛力。

他們使用Grounding DINO進行開放詞彙目標檢測,結合SAM(Segment Anything Model)對建築物進行分割,無需任何訓練資料即可直接對測試影像進行推論。這項技術展示了強大的泛化能力,但作者也指出,在特定領域中,其精確度可能仍不如專門訓練的模型。另外,團隊也載入了一個預訓練的Mask R-CNN實例分割模型,並將結果與U-Net進行比較。Mask R-CNN能夠同時輸出邊界框與實例遮罩,適合需要區分個別建築物的場景。透過比較,讀者可以了解不同架構在建築物足跡提取任務上的優缺點。最後,教程展示了如何將同樣的管線擴展到真實世界區域。

他們使用Microsoft Planetary Computer上的NAIP影像以及Overture Maps提供的建築物標籤,重複執行相同的切塊、訓練、推論流程,證明該方法具有可複製性與實用性。研究團隊還將所有配置參數集中管理,包括圖塊大小、步長、學習率、訓練epoch數等,讓使用者可以輕鬆調整以適應不同資料集。整體而言,這套GeoAI工作流程不僅涵蓋了深度學習模型訓練的標準步驟,更整合了資料處理、視覺化、後處理、零樣本分割以及多模型比較,為地理空間資訊從業者提供了一份詳實的參考藍圖。

從環境安裝到最終成果評估,每一個環節都有具體的程式碼與說明,顯示出GeoAI在建築物提取任務上的成熟度與靈活性。隨著遙測資料與開放地理資料的快速增長,這類端到端的解決方案將有助於加速城市規劃、防災減災與環境監測等領域的應用。

Related

相關文章

秋招信息戰打不動?我們測了千問的新功能,讓Agent全程陪跑

阿里巴巴旗下大模型「千問」近日推出全新功能,針對秋季招聘季中求職者面臨的海量資訊與繁複流程,打造「Agent 全程陪跑」服務。根據官方測試,這項功能能協助使用者自動篩選職缺、整理企業資訊,甚至模擬面試問答,大幅減輕求職者自行蒐集與比對資訊的負擔。 在實際體驗中,用戶只需輸入自身學經歷與目標產業,Agent 便會自動爬取最新的秋招公告,並按職位匹配度、截止日期等條件排序,同時附上企業背景與筆面試經驗摘要。

剛剛

AI寫的PR堆成山,Rust已忍無可忍

Rust 語言社群近期強烈反彈大量由 AI 生成的公關稿與行銷文淹沒官方討論區,這些內容缺乏深度且帶有商業目的,讓資深貢獻者不堪其擾。社群管理團隊正研擬加強審查機制與提高發文門檻,但同時也擔心誤傷真正的新手使用者。這場爭議凸顯開源專案在 AI 時代面臨資訊過濾成本攀升的困境。

1 小時前