MarkTechPost AIAI工具與產品

A Tutorial on GeoAI: Designing Footprint Extraction from NAIP Imagery Using U-Net, Grounding DINO, SAM, and Mask R-CNN

2026年8月2日 21:19

重點摘要

本教學示範如何從高解析度NAIP航照影像中提取建築物足跡,涵蓋從環境設置、資料下載、圖像切割到模型訓練的完整工作流程。使用U-Net(ResNet-34編碼器)進行語義分割,並與Grounding DINO、SAM及預訓練Mask R-CNN進行零樣本與實例分割比較。最後將預測遮罩轉換為正規化建築物多邊形,並計算IoU與F1指標。

站內 AI 整理稿

### GeoAI新教程:結合U-Net、Grounding DINO、SAM與Mask R-CNN實現高精度建築物足跡提取

地理空間人工智慧(GeoAI)領域近期出現一套完整的端到端工作流程,專門針對從高解析度航拍影像中提取建築物足跡。該教程由一群技術專家設計,涵蓋從環境配置、資料下載、模型訓練到推論評估的每一個環節,並整合了多種深度學習架構,包括U-Net、Grounding DINO、SAM以及Mask R-CNN。這項工作不僅展示了傳統語意分割的應用,還探索了零樣本分割以及預訓練實例分割模型的效能,為地理空間資料分析樹立了現代化的實作典範。 整份教程以NAIP(國家農業影像計畫)高解析度航拍正射影像作為主要資料來源,並搭配對應的建築物標籤向量資料。研究團隊首先建立一個基於Python的地理空間深度學習環境,安裝必要的套件如`geoai-py`、`segmentation-models-pytorch`與`buildingregulariser`,並確認GPU加速的可用性。在Colab環境中,若無偵測到GPU,訓練速度會大幅下降,因此作者建議使用者啟用T4 GPU運行時。 環境準備完成後,第一步是下載樣本資料。團隊從Hugging Face資料集下載了訓練用的NAIP RGB影像(`naip_rgb_train.tif`)、建築物足跡向量(`naip_train_buildings.geojson`)以及測試影像(`naip_test.tif`)。接著進行資料檢查,利用`geoai`套件提供的函式讀取光柵影像的資訊,包括座標參考系統、維度、波段統計,以及向量資料的欄位結構與幾何類型。視覺化環節中,建築物標籤以黃色邊框疊加在影像上,並提供互動式地圖供進一步探索。 為了讓模型能夠有效學習,團隊將原始NAIP影像切割成固定大小的地理參考圖塊(chips)。每個圖塊尺寸設為512×512像素,步長為256像素,並在標籤遮罩中保留建築物輪廓的緩衝區。切塊後,系統會統計包含建築物的圖塊比例以及前景像素數量,並以6×6的網格展示訓練樣本。這一步驟確保了資料能夠符合模型輸入格式,同時維持空間解析度。 訓練階段採用U-Net架構,並以ResNet-34作為編碼器,預訓練權重來自ImageNet。模型配置包括3個輸入通道(RGB)、2個輸出類別(背景與建築物)、批次大小為8、學習率0.001,最多訓練12個epoch,並保留20%資料作為驗證集。訓練過程中,程式會自動儲存最佳檢查點,並在驗證IoU(交並比)連續5個epoch未改善時提前停止。最終模型檔案大小約為數十MB。 訓練完成後,團隊繪製了損失曲線與IoU曲線,以診斷模型是否過擬合或欠擬合。若驗證損失上升而訓練損失下降,表示過擬合;若兩者均平坦且高,則需增加epoch數或改用更大的編碼器。他們記錄到最佳驗證IoU出現在第幾個epoch,這為後續的模型選擇提供了依據。 接著,他們將訓練好的U-Net應用於未見過的測試場景。由於測試影像可能比訓練圖塊大,團隊採用滑動窗口推論(sliding-window inference),窗口大小與重疊率與訓練時的切塊參數一致。推論結果會輸出為二值化遮罩,並進一步透過後處理轉換為乾淨、規則化的建築物多邊形,同時計算IoU和F1分數作為評估指標。 除了語意分割,教程還探索了零樣本分割的潛力。他們使用Grounding DINO進行開放詞彙目標檢測,結合SAM(Segment Anything Model)對建築物進行分割,無需任何訓練資料即可直接對測試影像進行推論。這項技術展示了強大的泛化能力,但作者也指出,在特定領域中,其精確度可能仍不如專門訓練的模型。 另外,團隊也載入了一個預訓練的Mask R-CNN實例分割模型,並將結果與U-Net進行比較。Mask R-CNN能夠同時輸出邊界框與實例遮罩,適合需要區分個別建築物的場景。透過比較,讀者可以了解不同架構在建築物足跡提取任務上的優缺點。 最後,教程展示了如何將同樣的管線擴展到真實世界區域。他們使用Microsoft Planetary Computer上的NAIP影像以及Overture Maps提供的建築物標籤,重複執行相同的切塊、訓練、推論流程,證明該方法具有可複製性與實用性。研究團隊還將所有配置參數集中管理,包括圖塊大小、步長、學習率、訓練epoch數等,讓使用者可以輕鬆調整以適應不同資料集。 整體而言,這套GeoAI工作流程不僅涵蓋了深度學習模型訓練的標準步驟,更整合了資料處理、視覺化、後處理、零樣本分割以及多模型比較,為地理空間資訊從業者提供了一份詳實的參考藍圖。從環境安裝到最終成果評估,每一個環節都有具體的程式碼與說明,顯示出GeoAI在建築物提取任務上的成熟度與靈活性。隨著遙測資料與開放地理資料的快速增長,這類端到端的解決方案將有助於加速城市規劃、防災減災與環境監測等領域的應用。

Related

相關文章

賈躍亭:法拉第未來 FF EAI 機器人 7 月實現銷售及出貨 152 臺,創單月新高

首頁 > 智能時代>具身智能 賈躍亭:法拉第未來 FF EAI 機器人 7 月實現銷售及出貨 152 臺,創單月新高 2026/8/3 7:16:23 來源:IT之家 作者:浩渺 責編:浩渺 評論: IT之家 8 月 3 日消息,法拉第未來創始人賈躍亭今日發文透露,FF EAI 機器人 7 月實現銷售及出貨 152 臺,再創單月新高。

剛剛

上緯新材啟元宣佈與暴雪《魔獸世界》合作,推出限定“魚人定製款”Q1 機器人

上緯新材料科技股份有限公司旗下消費級具身智能品牌「啟元機器人」,近日在 2026 年度 ChinaJoy 展會期間正式宣布與暴雪娛樂旗下經典遊戲《魔獸世界》合作,推出活動限定版「魚人定製款」啟元 Q1 機器人。這款跨界產品以啟元 Q1 探索版的模組化設計為基礎,結合軟硬體開源能力,將《魔獸世界》中最具代表性的魚人角色元素融入機器人外觀與互動功能,成為展場中最吸睛的焦點之一。 在 ChinaJoy 現場,啟元 Q1《魔獸世界》魚人定製款機器人與多位 Coser 結伴逛展,穿梭於各個攤位之間,實現所謂的「串門」打卡。

7 小時前

WorkBuddy給騰訊長臉了

WorkBuddy近期在市場上的亮眼表現,為騰訊在人工智慧領域的布局注入一劑強心針,也讓外界對這家科技巨頭的AI實力有了新的評價。這款產品的突破,不僅替騰訊在競爭激烈的AI賽道上扳回一城,更意外地將一位核心人物推至鎂光燈前——湯道生成為那個最先需要替騰訊AI節奏破局,卻也最終成功扭轉局面的關鍵角色。 作為騰訊雲與智慧產業事業群的掌舵者,湯道生在AI戰略的推進上一直承受著內部與外部的雙重壓力。

15 小時前

谷歌地球AI工具一日下線

TechAINewsGoogle Earth’s AI deepfake tool only lasted one dayLetting people easily alter images with an AI prompt was a bad idea.Letting people easily alter images with an AI prompt was a bad idea.

2 天前

安卓遠控工具升級免去連接線

安卓遠控工具升級免去連接線。 全新版本允許智能體無線操控真實手機。用戶前往遠控軟件發佈說明主頁面能下載體驗。該工具可以在不獲取根權限時獲取屏幕。新版順利攻克了部分敏感軟件的顯示障礙。它為自動化測試帶來了 ��� 巨大便利。

2 天前

卡帕西力推的 LLM Wiki,會淘汰傳統 RAG 嗎?

看清 Agent Wiki ≠ AI 用戶記憶,你的知識庫落地就成功一半了。 作者丨樊天驕 編輯丨鄭佳美 2026 年 4 月,AI 領域知名研究者 Andrej Karpathy 在 GitHub 發佈了一篇技術 Gist,提出「LLM Wiki」的技術構想,迅速在行業內引發跟進熱潮。

2 天前