給黑盒導航機器人「使絆子」:AdvNav 如何揭示具身智能系統潛在安全風險 | GAIR Paper 117

2026年8月13日 09:02
站內 AI 整理稿

AdvNav 首次在黑盒條件下,對導航智能體完成系統性安全驗證。作者丨李晨陽 編輯丨陳淑瑜 近兩年,能自己走路、自己帶路的機器人正從實驗室走向真實場景:醫院的配送機器人按醫囑送藥,倉庫裡的搬運機器人找貨架,家裡的掃拖機器人按指令去某個房間。它們靠的不是提前存好的地圖,而是“看懂畫面 + 聽懂指令 + 自己決定下一步往哪走”——這正是視覺語言導航(VLN)要解決的問題。這類系統藏著一個少被提起的前提:它完全相信自己的“眼睛”。攝像頭拍到什麼,它就當成事實去決策。▎於是真正的痛點浮現了:視覺是它最脆弱的入口。

機器人的所有判斷都建立在像素之上,可真實世界的光照變化、物體遮擋、甚至鏡頭上一點汙漬,都可能讓“同一段路”在它眼裡變得不一樣。越聰明,越怕“看不見的偏差”。大模型加持的導航機器人推理更強,卻也更依賴視覺輸入;一旦輸入被輕微擾動,小錯會一步步放大成“走錯整個樓層”。更難的是“驗傷”。真實部署的機器人是封閉產品,你拿不到它的內部參數和梯度,傳統那種“拆開看腦子”的評測方式根本用不上——而我們恰恰最該知道:它在受干擾時到底有多不靠譜?過去的研究大多盯著“怎麼讓機器人在乾淨環境裡走得更準”,卻很少有人問“它在被擾動時會不會崩”。

這正是這篇論文要補的缺口:香港科技大學(廣州)陳昶昊教授團隊提出的 AdvNav,在不打開機器人、不依賴任何內部信息的前提下,僅靠觀察它的行走行為,就係統性地證明了:當前視覺語言導航系統普遍存在一個看不見的視覺軟肋。他們提出了 AdvNav——首個面向視覺語言導航任務的黑盒行為引導對抗攻擊框架。相關成果已被 ACM Multimedia 2026(ACM MM 2026)錄用。AdvNav無需訪問模型參數或梯度,僅通過觀察智能體的導航行為即可不斷優化攻擊擾動。框架設計了基於智能體行為的雙粒度反饋機制,綜合利用軌跡級性能、動作級獎勵以及軌跡偏離信息,引導攻擊過程持續尋找更具破壞性的擾動。

同時,結合擾動強度自適應調整和遺傳算法優化噪聲結構,在有限查詢預算下即可獲得高效攻擊效果。在經典R2R數據集上,AdvNav針對Transformer架構的HAMT模型以及基於大語言模型的MapGPT模型,分別取得了49.70%、65.96%和87.30%的攻擊成功率,充分揭示了當前視覺語言導航系統普遍存在的潛在視覺脆弱性。論文標題:AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation論文地址:https://arxiv.org/abs/2607.

1106301針對視覺與語言導航任務的黑盒對抗攻擊難點在哪?傳統圖像分類中的黑盒攻擊通常只需面對一次預測:輸入一張圖像,模型立即給出分類結果,攻擊者便可以根據輸出不斷調整擾動。而視覺語言導航則完全不同。首先,智能體需要同時理解視覺信息與語言指令,並結合歷史導航過程進行連續決策,屬於典型的多模態時序任務。其次,導航具有明顯的長期依賴特性。某一步的錯誤決策未必意味著任務失敗,智能體往往能夠依靠後續推理重新回到正確軌跡,自我修正能力使攻擊難度大幅增加。此外,導航任務的最終反饋具有明顯的延遲性。攻擊者通常只有在整個導航結束後,才能知道此次攻擊是否真正導致任務失敗。

這種稀疏且滯後的反饋,使傳統黑盒優化方法難以發揮作用。因此,如何僅依靠智能體外部行為,在沒有梯度信息的情況下持續優化擾動,成為 VLN 黑盒攻擊的核心難題。02AdvNav 框架介紹針對上述問題,陳昶昊教授團隊提出了 AdvNav——首個面向視覺語言導航任務的黑盒行為引導對抗攻擊框架。它的核心思路非常“剋制”:不碰模型內部,只在機器人“看到的圖像”上疊加一點點精心設計的擾動,然後觀察它怎麼走,再根據走出來的結果反過來優化這層擾動。

整個框架靠兩樣東西撐起來:雙粒度反饋機制:從機器人的行為裡提取“它有多偏離”的信號,代替白盒攻擊裡才有的梯度信息,指引攻擊方向;自適應擾動優化 + 遺傳算法:在有限的“提問次數”(查詢預算)內,把擾動的強度和形態調到最有效。▎基於智能體行為的雙粒度反饋指導為在黑盒設定下提供替代白盒設定下梯度信息的有效攻擊優化指導,AdvNav設計了一種從智能體輸出行為中提取出的雙粒度反饋作為優化目標,該反饋包括:1.

軌跡級表現得分:利用標準VLN評估指標路徑加權成功率(Success weighted by Path Length,SPL)和導航誤差(Navigation Error,NE)構建聯合軌跡級攻擊表現得分:其中用於對齊SPL和NE的尺度,表示擾動條件和乾淨條件下對應度量的差異。最大化 會促使智能逐漸偏離目標位置(NE 更高),並降低其軌跡效率(SPL 更低),這表明導航受到更嚴重的干擾,因此符合攻擊目標。2.

動作級獎勵得分:由於環境和指令構建時的限制,僅憑藉標準VLN評估指標有些時候是稀疏的,無法提供有效的噪聲優化指導,因此引入累計動作獎勵得分:以量化擾動在每一個時間步上對智能體選擇正確動作能力的影響。其中, 表示選擇參考動作的可能性, 表示選擇最可能的錯誤動作的可能性。對所有時間步進行聚合符合 VLN 的時序依賴性,即每個決策都可能影響後續選擇,從而累積形成長期行為漂移。3.

雙粒度聚合反饋集:將上述信號整合為一個統一的攻擊反饋集,用於第輪的每個候選擾動,如下所示:具體來說,對於每個候選單輪擾動參數,我們生成對應候選單輪擾動 ,更新上一輪的累計擾動 以形成本輪的候選累計擾動 ,並在此擾動下評估智能體。表示軌跡層面的擾動, 表示動作層面的漂移,而 則表示智能體是否實際偏離了參考軌跡。▎自適應擾動優化初始化並維護一個累積擾動,並在每一輪中執行以下操作:1.候選累計擾動生成:通過將從噪聲群體衍生出的擾動作為候選單輪擾動以固定的步長和累積符號疊加到當前累計擾動上,生成新的候選累計擾動;2.

攻擊效果評估:根據智能體在每個候選累計擾動下的軌跡和動作,得到該擾動的雙粒度聚合反饋集,進一步計算相對攻擊收益作為所有候選擾動的評估標準。相對攻擊收益是指如果該候選累計擾動造成了實際軌跡偏離,則為該候選累計擾動的軌跡級表現得分與上一輪累計擾動的軌跡級表現得分之差,如果沒有,則為兩者動作級獎勵得分之差;3.擾動更新:對所有候選累計擾動的相對攻擊收益進行排序,過濾掉收益為負的候選,並優先造成實際軌跡偏離的候選。如果最佳候選累計擾動有效,則將其更新為最新的累計擾動;如果無效,則保留上一輪的累計擾動並改變累計符號,然後進行噪聲群體遺傳進化。

03實驗結果論文從定量實驗、消融實驗和可視化結果三個方面驗證了提出的 AdvNav 框架的有效性,AdvNav 在攻擊效果和自然程度上都展現出了明顯優勢。▎攻擊效果遠遠超過基線方法論文展示了在 R2R 數據集上對基於 Transformer 的 HAMT 模型和基於 LLM 的 MapGPT 模型的定量實驗結果。對於 HAMT 的攻擊效果,AdvNav 在 11 個場景上平均攻擊率達到了 49.7%,特定場景攻擊率可以達到最高 100%,伴隨著導航效率的大幅下降和最終誤差的穩定上漲,說明 AdvNav 在各種場景佈局和指令下均展現出穩定的黑盒攻擊性能,無需任何特定的前提條件。

對於 MapGPT 的攻擊效果,論文采用了開源模型 Qwen3-VL 和閉源模型 GPT-4V 作為骨幹網絡,AdvNav 分別達到了 65.96% 和 87.30% 的攻擊成功率。AdvNav 在 HAMT 和 MapGPT 上均表現出的強大攻擊性能,凸顯了其有效性和廣泛的適用性,表明 AdvNav 可以作為通用的壓力測試框架,有效識別視覺漏洞,而無需考慮 VLN 智能體的底層視覺感知和決策範式。▎AdvNav 核心組件作用驗證論文對提出的 AdvNav 框架中的擾動強度更新、結構進化和雙粒度反饋進行了消融實驗。在隨機擾動下,攻擊成功率僅 23.

40%,移除雙粒度反饋中的動作級獎勵得分和軌跡級表現得分後,攻擊成功率分別下降 17.02% 和 2.13%,移除擾動結構進化和強度更新,攻擊成功率分別下降至 38.30% 和 26.60%。這表明結合強度更新和結構進化,並使用雙粒度反饋進行優化引導對於實現有效、穩定的對抗攻擊影響至關重要。▎可視化結果論文引入了學習感知圖像塊相似度(Learned Perceptual Image Patch Similarity,LPIPS)來衡量擾動圖像與原始圖像之間的感知距離,該值越接近於零,表明擾動越難以察覺,視覺上與原始圖像越相似。

與其他擾動相比,AdvNav 獲得了顯著更低的 LPIPS 值,這表明其在保持強大攻擊效力的同時,也具有良好的感知隱蔽性。AdvNav 優化得到的擾動形成了一個低頻相干亮度場,類似於鏡頭上的霧霾或灰塵,降低了結構線索的對比度,並且難以被標準預處理抑制,從而導致導航行為出現持續偏差。04結語AdvNav 替整個行業做了一件沒人願意直視的事:把具身導航那個藏在視覺裡的軟肋,擺到了檯面上。我們正把"帶路"越來越多地交給機器人,可一旦它們"信了自己的眼睛"又看不見干擾,風險就藏在每一次配送、每一趟搬運裡。

AdvNav 的價值,正在於用一種現實裡做得到的黑盒方式(只看行為、不碰內部),提前把這種脆弱性量化出來——它是一把安全標尺:上崗前先"考一考",避免帶病部署;它揭示的"低頻擾動難以被抑制"現象,也反過來指引我們設計更抗干擾的模型。一句話總結:讓機器人走得更遠的,不只是更強的眼睛,還有提前知道"眼睛可能被矇住"的清醒。AdvNav 做的,正是幫我們在機器人真正上路前,先看清那層看不見的霧。除了能夠作為評估視覺語言導航系統安全性的攻擊方法和壓力測試工具外,AdvNav還為具身智能的魯棒性研究提供了新的技術路線。

未來,該框架有望進一步應用於對抗訓練、魯棒導航模型設計以及具身智能安全評測等方向,為構建更加安全、可靠的開放世界導航系統提供技術支撐。05作者與機構李晨陽:香港科技大學(廣州)研究助理,現新加坡國立大學研究助理;主要研究方向為人工智能安全,致力於構建可信賴且可解釋的物理人工智能和生成式人工智能。李凱歌:中山大學網絡空間安全學院研究員/博士後;主要研究方向為計算機視覺、多模態大模型、人工智能內容安全。江澤宇:香港科技大學(廣州)博士生;主要研究方向為高效的空間物理智能體,專注於將通用空間智能注入現實開放環境的具身應用場景。

陳昶昊(通訊作者):香港科技大學(廣州)智能交通學域與人工智能學域助理教授、博士生導師,兼任香港科技大學跨學科學部助理教授;從事具身智能感知、導航與交互研究,組建 PEAK-Lab 課題組並擔任獨立 PI。上車,帶你看遍全球 AI 頂會精華可獨家暢覽:專家演講PPT大會報告全文熱門論文解讀學術新星訪談掃描上方二維碼或點擊「閱讀原文」關注專區。

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛
全天候科技生成式AI

企業AI最後一公里:三路人馬在此交鋒

鄭敏芳 發表於 2026年08月24日 03:09 摘要:尋找自己的位置 2026年世界機器人大會現場,談到這一輪突然走紅的FDE(前線部署工程師),明略科技CEO吳明輝先把時間往回撥了十多年。“12年前我們就在非常認真地研究。”當華爾街見聞·問及FDE與傳統軟件部署有什麼區別時,吳明輝說,兩者都會進入客戶現場,但今天的FDE需要做得更深:一邊把Agent接進真實業務,一邊把現場形成的能力繼續沉澱回後臺。

剛剛