多跳空間推理仍難

2026年9月9日 00:00
站內 AI 整理稿

空間理解能力長期以來被視為視覺語言模型通往實體世界應用的重要關鍵,無論是自主機器人導航、無人機避障,還是協助使用者在真實環境中完成操作指令,都仰賴系統準確掌握物件與物件之間的相對位置與空間邏輯。然而,一項最新發布的評測結果卻顯示,當前最先進的視覺語言模型即便在一般視覺問答上表現亮眼,只要涉及多跳空間推理,也就是需要將多個空間關係逐步串聯、組合推演的情境,錯誤率就會急遽攀升,凸顯出此類模型在組合式空間理解上的結構性缺口。這項名為 MultihopSpatial 的全新基準測試,是由研究團隊專門設計來嚴格檢視視覺語言模型的多步空間推演能力。

與過去僅要求模型判斷單一空間關係的測驗不同,MultihopSpatial 刻意將任務難度推向由一到三跳組合而成的空間關係鏈。舉例而言,模型可能必須先判斷某一物件在另一物件的左側,接著推演出該參考物件與第三件物品之間的相對方位,再進一步結合視角變化,理解在換了一個觀察角度之後,原本的左右前後關係是否發生翻轉或保留。這種層層堆疊的組合式任務,意在逼使模型不只是完成表層的物件識別,而是真正建立對空間佈局的動態心理表徵。研究團隊對總計三十七個當前位居領先地位的視覺語言模型展開系統性評測,這些模型涵蓋了學術界與業界近年主力發布的各種架構與參數規模。

值得注意的是,本次評測引入了比過去更加嚴格的評估指標,不再只滿足於模型在回答中給出正確的空間關係名稱或方位判斷。新標準要求模型在給出答案的同時,必須在圖像內以視覺座標精確標示出所指涉的物件位置。換句話說,模型必須在理解的過程中,同時獲取與空間推理結果相對應的視覺錨點,若只是碰巧根據語感命中答案、卻無法圈選出相關的物件區域,仍會被視為推論失敗。此一標準大幅壓縮了模型靠隨機猜測或機率分布搶分的空間。令人警醒的是,最終結果顯示即便是綜合能力最突出的前沿模型,在面對三跳以內的空間組合推理時,表現仍舊遠遜於人類受試者,也遠遜於這些模型自身在一般視覺問答項目上的防護水平。

研究團隊歸納指出,當空間推理只需要一步、僅涉及單一物件的方位選擇時,多數模型還能維持堪用的正確率;然而一旦推理深度擴展至二跳、三跳,需要同時召喚並推理多個物件與多個相對方位時,幾乎所有測試模型都出現急劇的性能下降。這種表現上的斷崖式落差顯示,模型可能僅在語意層面上隱約掌握了空間詞彙,但缺乏一套連貫的空間運算機制,也未內建一套可隨取隨用的心智地圖。研究團隊進一步指出,這項缺陷並不僅是純學術領域的理論難題,也將直接阻塞視覺語言模型在機器人與動作模型發展上的落地進程。

實際世界中的每一項空間任務幾乎都屬於組合式問題:當機器人被要求「把桌上的紅色杯子拿到椅子右側的櫃子內」,系統必須在場景中同時鎖定杯子、桌面、椅子與櫃子,並透過多段式關係建構來判斷最優動作路徑。任何一個環節的空間推估出錯,都會連鎖反應導致後續動作失敗;而目前主流模型在此類多跳問題上的瓶頸,正是這種連鎖失誤的主要來源。此外,引入不同視角的變化測試更讓此難題難上加難。真實世界中,視線、鏡頭角度或機器人的身位都會改變物件的相對方位描述,而模型能否在視角變換後仍然保持一致的空間理解,成為檢驗其推理彈性的重要指標。

這份評測的資料顯示,多數模型在視角轉換後,特別容易在相對空間關係的推理出現直接對應錯誤,這種限制也讓眼前這些模型能在「以語言為核心」的視覺任務中偶爾含糊過關,卻無法支撐起更需精確空間協調的實地運作。該團隊期望,這項基準測試的推出能提供視覺語言模型研究社群一項更貼近實際應用需求的試煉場。透過將空間推理拆解、組合、加入視角與定位標示等多重要求,MultihopSpatial 希望業界不再以單調的一般問答準確率作為模型能力的開花結果,而是真正挑戰模型在純視覺與語言資訊交互過程中可被信任的空間自主推理能力。

唯有在這種複雜組合式空間理解上獲得更穩健的表現,視覺語言模型才能從靜態的辨識與描述工具,進一步演進為具備自主空間決策能力、適宜真實世界部署的助手。

Related

相關文章

消息稱 Anthropic 低調建立生物實驗室,借 AI 推進藥學研究

作者:清源 責編:清源 評論: 9 月 18 日消息,路透社今天(18 日)晚間援引知情人士消息稱,Anthropic 在舊金山灣區低調建立了一座溼實驗室,把 AI 業務進一步延伸到需要實際動手操作的生物學研究和藥物科學領域。知情人士透露,在公眾對 AI 風險愈發擔憂之際,Anthropic 開始在溼實驗室進行實體實驗。Anthropic 此前提出,希望藉助 AI 推動罕見病治療方法的發展,公司的生物學研究也從“計算機模擬”和計算機評估進一步走向真實實驗。注:溼實驗室是一個科學概念,與“幹實驗室”相對。相比干實驗室,溼實驗室在實驗中需要用到較多的化學試劑。相比之下,幹實驗室則注重通過各種儀器進行計算,以歸納出實驗材料的物理模型。Anthropic 生命科學負責人埃裡克 · 考德勒-艾布拉姆斯證實了溼實驗室的存在。“我們認為,生物學研究最終還是要接受真實實驗室工作的檢驗,而且未來一段時間都會如此。我們現在確實在做這些工作。整體模式和大多數生物科技公司類似,一部分在自己的設施裡完成,另一部分則與外部合作伙伴共同開展。”Anthropic 發言人又進一步補充,這座實驗室並非專門用於藥物發現,並拒絕進一步說明具體用途。知情人士稱,建立溼實驗室只是 Anthropic 邁向更大目標的一小步。Anthropic 希望攻克其認為製藥行業忽視的疾病,公司也希望在員工和公眾失去對 AI 價值的信心之前拿出成果,因為 AI 可能導致崗位消失,甚至威脅人類生命。不過,任何藥物研發項目都無法保證成功,大多數候選藥物最終都無法通過臨床安全性和有效性試驗。這項工作對 Anthropic CEO 達裡奧 · 阿莫迪還有一層個人意義。

6 小時前

AGI最難一戰,竟在醫院!中國AI登上Science,醫生不怕失業還催著上線

。 2016年,Hinton老爺子就預言:“人們現在就應該停止培養放射科醫生。”他甚至認為,五年內,AI就會在醫療影像識別上超過放射科醫生。 老爺子一生謹慎,但歷史和他開了個玩笑。十年過去了,人們離AGI已經越來越近,但在醫療場景裡,即使圖像識別這樣的AI新手村任務,依然是hard模式。 如果從IBM的Watson算起,在醫療上遭遇滑鐵盧的AI專家數不勝數。

10 小時前

AGI最難一戰,竟在醫院,中國AI登上Science,醫生不怕失業還催著上線

我没办法凭这条标题写出符合要求的完整新闻稿,原因很直接: 现有"可用资料"其实只有一行标题,正文是空的。后面的内容全是的侧边栏推荐和网站导航(Anthropic华人、Manus估值、腾讯投资药企等),跟这条新闻没有关系。 如果硬写 900–1600 字,我就得自己编造这些关键事实: 是哪个团队、哪家医院、哪篇 Science 论文 论文的具体方法和结果数据 医生"催着上线"的具体场景和原话 这些一旦写出来就是假新闻,我不做这个。

12 小時前

AI製藥獨角獸Anew單飛,字節推了一把“最燒錢的慢生意”

Reuters:Anew Labs完成首輪外部融資2.9億美元、投後估值15億美元,HSG、IDG Capital、GL Ventures、五源資本等機構入股,字節跳動融資後持股56%。2. IQVIA 2026年分析:經確認有AI參與的新興生物科技項目I期、II期臨床成功率比較,及樣本有限的說明。3. 《Nature Reviews Drug Discovery》2026年8月Perspective:AI方法與基準測試大量出現,臨床相關性影響證據仍然有限。4. Deloitte全球大型生物製藥公司晚期研發管線年度研究:2025年平均藥物開發成本約26.7億美元,計算含研發失敗成本。

13 小時前