NVIDIA Released DeepStream 9.1: Bringing Agentic AI to Vision AI With 13 Skills and Multi-View 3D Tracking
重點摘要
NVIDIA 發布 DeepStream 9.1,新增多視角 3D 追蹤(MV3DT)與自動校準(AutoMagicCalib)功能,解決跨攝影機物體追蹤需手動校正的難題。新版提供 13 個代理技能,開發者可透過自然語言描述部署管線,並支援 JetPack 7.2 與統一開源 GitHub 儲存庫。
NVIDIA 今日正式釋出 DeepStream 9.1 版本,這項重大更新瞄準了視訊分析領域長期存在的跨攝影機追蹤難題。以往要讓多支攝影機共同鎖定同一物體,必須仰賴手動校準與複雜計算,如今新版透過兩項全新功能——多視角 3D 追蹤(Multi-View 3D Tracking,MV3DT)與自動校準工具(AutoMagicCalib,AMC)——將開發門檻大幅降低,且兩者均以「代理技能」(agentic skills)形式納入編碼代理(coding agents)中,讓開發者從概念到可運行的管線變得更加快速。
DeepStream 是 NVIDIA 專為 AI 影片與影像理解打造的串流分析工具套件,其底層採用 GStreamer 框架,可在 NVIDIA GPU 上進行多串流、多模型的推論。管線整合了硬體加速的解碼編碼、TensorRT 推論、物件追蹤以及訊息代理(message broker)整合功能。在此基礎上,9.1 版新增了五大重點:13 個代理技能、跨攝影機追蹤的 MV3DT 技能、自動校準的 AMC 技能、支援 Jetson Orin 與 Thor 邊緣裝置的 JetPack 7.2,以及以 CC-BY-4.0 與 Apache-2.0 授權統一的開源 GitHub 倉庫。
MV3DT 是本次更新的核心技能。其運作原理是將多台已完成校準的攝影機所產生的偵測結果,投射到共享的 3D 世界座標系統中,再比對不同攝影機視角下同一物體的觀測資料,最後賦予一個全域一致的物件 ID。整個資料流程分為四個階段。在偵測階段,每支攝影機串流執行一個物件偵測器,MV3DT 提供三種可直接使用的模型:以 Transformer 為基礎的 PeopleNetTransformer(預設用於行人場景)、基於 DetectNet_v2 架構的高效率 PeopleNet v2.6.3,以及多類別偵測器 RT-DETR 2D(可偵測行人、搬運車與堆高機)。
接著在單眼 3D 感知階段,每支攝影機利用儲存在 YAML 校準檔案中的 3×4 投影矩陣,將 2D 邊界框透過地面平面假設反投影到 3D 世界空間中。然後進行多視角關聯,追蹤器透過輕量級發布/訂閱通訊協定 MQTT(Message Queuing Telemetry Transport)共享軌跡資料;當兩支攝影機觀察到同一個人時,根據 3D 世界空間中的距離比對並匹配軌跡。
最後,結果以三種形式輸出:螢幕顯示(OSD)呈現含 2D 與 3D 邊界框的格狀畫面;鳥瞰圖(BEV)提供俯視軌跡地圖;Kafka 訊息則傳送每幀的 protobuf 元數據,包含感測器 ID、物件 ID 與 3D 邊界框。MV3DT 依賴已校準的攝影機,傳統校準需要使用棋盤格進行手動設定,耗時且影響運作。AutoMagicCalib 則改變了這個流程:它透過分析現有影片檔案或串流中的追蹤物件,自動估計每部攝影機的內參(焦距、主點、鏡頭畸變)與外參(旋轉、平移、世界位置)。
其內部管線包含五個階段:單一攝影機軌跡提取、單視圖校正、多視角軌跡匹配、捆綁調整(bundle adjustment),以及可選的 VGGT 細化步驟——當物件移動有限時,VGGT(Visual Geometry Grounded Transformer)可提供額外幫助。AMC 以微服務形式運行,提供 REST API 與網頁介面,使用者只需提供一張佈局影像與少數對齊點即可。代理技能的工作流程也經過重新設計。開發者不再需要手動編輯設定檔,而是以自然語言描述意圖。這些技能可與 Claude Code、Codex、Cursor 等代理工具搭配使用。
安裝方式簡短:複製 DeepStream GitHub 倉庫後,將技能複製到代理的技能目錄,接著執行一個簡單的提示詞,例如「deploy mv3dt on the 12-camera sample dataset」,MV3DT 技能便會自動驗證先決條件、拉取容器、安裝 Kafka 與 Mosquitto 代理服務、下載模型權重、產生管線設定檔並啟動追蹤。若缺少校準檔案,技能還會自動觸發 AMC 完成校準。對比前一代 DeepStream 9.0,9.1 的進化相當顯著。
代理技能從 2 個增加到 13 個;跨攝影機 3D 追蹤從未以技能形式提供,升級為完整的 MV3DT 技能與參考應用程式;攝影機校準從手動轉變為 AMC 微服務自動化;Jetson 支援從 JetPack 7.1 GA 提升至 7.2,涵蓋 Orin 與 Thor 平台;樣本資料集新增 4 攝影機與 12 攝影機的 MV3DT 測試集;套件發佈方式則從 NGC 套件與 GitHub 原始碼分開,統一為 GitHub 單一倉庫。這些功能對應到實際部署場景相當明確。
在倉庫安全管理中,可利用 RT-DETR 2D 以單一 ID 追蹤在貨架間移動的工人與堆高機動態;零售業分析可透過攝影機區域無縫追蹤消費者,精準測量停留時間,避免重複辨識錯誤;智慧建築監控能計算各樓層人員數量,並將 Kafka 元數據餵入儀表板;機器人與智慧城市應用則依靠一致的世界座標進行導航與事件回顧。總結關鍵要點:DeepStream 9.
1 提供 13 個代理技能,讓編碼代理能透過自然語言提示建構多攝影機視覺管線;MV3DT 將每支攝影機的偵測結果融合到共享 3D 世界中,維持單一全域物件 ID;AutoMagicCalib 以現有影片取代手動棋盤格校準,自動估算內外參;JetPack 7.2 支援擴展到 Jetson Orin 與 Thor 裝置;輸出可透過 OSD、鳥瞰圖與 Kafka protobuf 元數據直接整合至下游分析與儀表板。相關資源已開放於 NVIDIA 官方 GitHub 倉庫,開發者及企業用戶可立即下載嘗試。
Related
相關文章

當 human in the loop 變成“閉著眼睛點確認”,企業Agent 安全還能靠誰?
專家指出,AI Agent 從內容安全轉向行為安全,提示詞注入、工具濫用與過度授權成為主要風險。企業應建立可視、可管、可追溯的安全基線,並對工具權限進行最小化與臨時化管理,避免 human in the loop 淪為形式。安全防護需從靜態入口轉向動態行為約束,以因應 Agent 自主執行帶來的全新挑戰。

開源Agent框架刷爆ARC-AGI-3,「自我改進」的RLM harness引爭議
一套開源Agent框架在ARC-AGI-3基準測試中創下超過85%的正確率,大幅領先其他解決方案,其核心是名為「RLM harness」的自我改進機制。然而,該方法引發學術爭議,部分研究者批評它透過反覆試錯「鑽漏洞」,不符合ARC-AGI評測一次性推理的精神。這場討論促使AI社群重新審視評測標準,並可能影響未來ARC-AGI版本的設計方向。

騰訊是在“賽馬”,還是在打造 “Agent工廠”?
騰訊內部正在探討其發展策略究竟是「賽馬」機制還是打造「Agent工廠」。相關討論聚焦於公司如何平衡內部競爭與統一平台建設。目前站內已移除相關混雜文字,保留原始主題供讀者參考。
ChinaJoy 2026 AI遊戲規模化落地,邊緣雲與API安全重構產業底層邏輯
2026年ChinaJoy展館,“與AI同遊”的主題隨處可見。行業調查顯示,僅有21%的企業擁有完整的API資產清單,大量後臺AI接口仍在無人監控的狀態下裸奔。合規與安全也同步下沉。算力下沉還不夠,API安全必須同步前移邊緣雲解決了體驗問題,但AI交互入口的安全,同樣需要前置到邊緣。算力與安全,缺一不可Akamai的判斷很明確:遊戲AI轉型不能割裂算力與安全。這也是遊戲廠商規模化落地AI智能體、構建AI原生遊戲的標準化底層方案。

openJiuwen發佈業界首個企業級分佈式蜂群架構,聯合郵儲成功落地金融生產環境
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

螞蟻集團開源Avernet,讓人與智能體像組織一樣高效協作
**螞蟻集團開源Avernet:打造人與智能體高效協作的“組織級”基礎設施** **來源:量子位** **2026-08-07 11:08:51** 近日,螞蟻集團正式宣佈開源多智能體協作基礎設施Avernet,其社區版本已同步上線。作為業界首個聚焦於“組織級協作”的智能體基礎設施,Avernet的首個版本重點開放了智能體協作網絡能力,旨在支持不同智能體之間的發現、共識達成、跨團隊協作與治理,為人工智能從“單點智能”走向“系統智能”提供關鍵支撐。