何夕2077生成式AI

VistaHop難倒視覺模型

2026年7月31日 00:00

重點摘要

标题:VistaHop难倒视觉模型:顶尖多模态大模型Pass@1仅26.33% 多模态大模型(MLLM)近年来在视觉理解领域取得了惊人进展,从识别常见物体到回答复杂的视觉问题,能力不断提升。然而,当任务要求模型像侦探一样在一张图像中反复搜索、放大细节、跨区域串联线索时,它们是否依然强大?最新发布的基准测试VistaHop给出的答案并不乐观:即便是目前表现最好的模型,在第一次尝试中的正确率也仅有26.33%。

站內 AI 整理稿

标题:VistaHop难倒视觉模型:顶尖多模态大模型Pass@1仅26.33%

多模态大模型(MLLM)近年来在视觉理解领域取得了惊人进展,从识别常见物体到回答复杂的视觉问题,能力不断提升。然而,当任务要求模型像侦探一样在一张图像中反复搜索、放大细节、跨区域串联线索时,它们是否依然强大?最新发布的基准测试VistaHop给出的答案并不乐观:即便是目前表现最好的模型,在第一次尝试中的正确率也仅有26.33%。这项研究由Hang He、Chuhuai Yue、Chengqi Dong等9位研究者共同完成,论文《VistaHop: Benchmarking Long-Horizon Visual DeepSearch》已提交至arXiv平台(编号arXiv:2606.

03273)。研究团队指出,真实世界中的视觉任务往往不是“看一眼就能回答”的简单问答,而是需要多步骤、长周期的搜索与推理过程。他们将其定义为“Visual DeepSearch”,即视觉深度搜索。什么是视觉深度搜索?简单来说,就是让多模态大模型面对一个复杂的视觉查询时,需要反复检查图像的不同区域,将每一次观察到的信息作为推理依据,再结合分散的线索逐步逼近正确答案。例如,在一张混乱的桌面照片中找到特定物品之间的隐藏关联,或者在卫星图中识别出某种设施的蛛丝马迹,都需要模型不断“放大、比对、回溯”,而不是只依赖一次全局扫描。现有的视觉基准测试能满足这种需求吗?

论文认为,目前主流基准主要评估单步视觉理解能力,比如给一张图、提一个问题,模型只需看一眼就能作答。这类任务难度有限、搜索步数短,通常只需要一次图像检查,无法反映模型在长期视觉搜索中的真实表现。换句话说,一个模型在“看图问答”上得分很高,并不代表它能胜任“视觉侦探”级别的工作。为了弥补这一空白,研究团队推出了VistaHop基准。该基准共包含600张图像、25个视觉搜索场景以及600个视觉深度搜索任务。它专门设计用来考验三种关键能力:重复图像检查、视觉锚点定位,以及跨不同视觉区域的长程证据遍历。这三项能力分别对应了真实视觉搜索中最常见的难点。

所谓“重复图像检查”,是指模型必须多次回看同一图像的不同位置,而不是只看一次就给出答案;“视觉锚点定位”要求模型能够将模糊的查询描述与图像中具体的位置或物体对应起来,就像在照片中找到“角落里那个红色的小物件”一样;“长程证据遍历”则要求模型在多个相互分离的区域之间建立联系,像拼图一样把散落的证据组合成完整答案。为了公平且统一地评估这些能力,研究团队还设计了一个名为VistaArena的评估框架。该框架支持基于工具的交互方式,包括视觉检索、图像检查和证据推理。模型可以像使用工具一样调用放大、搜索、标记等功能,在多个步骤中积累信息。

这一设计比传统的一次性问答更贴近真实应用场景,模拟了人类在图像中主动寻找线索的过程。实验环节的结果令人警醒。研究团队对当前多种先进多模态大模型进行了测试,采用Pass@1指标,即模型在第一次尝试中给出正确答案的比例。结果显示,表现最佳的模型SenseNova-MARS-32B也仅达到26.33%的准确率。这意味着,即便是目前最强大的现有系统,在VistaHop的绝大多数任务上仍然宣告失败。这个成绩充分说明,当前多模态大模型在复杂视觉搜索和长程推理方面存在显著短板。它们或许擅长识别常见物体、回答常识性问题,但要在信息密度极高的图像中持续追踪线索、排除干扰,并整合来自不同区域的信息,仍远远不够。

研究团队认为,这种差距揭示了现有模型在“智能化视觉探究”方面尚未跨越的鸿沟。VistaHop的意义不仅在于“难倒模型”,更在于提醒整个行业:评估方式需要升级。如果仅仅依赖简单的视觉问答来衡量模型能力,很容易高估其真实智能水平。只有建立像VistaHop这样高难度、多步骤的基准任务,才能暴露出模型的真正弱点,并为下一阶段的技术发展提供明确的方向指引。论文还特别强调了未来需要重点研究“智能体方法”。所谓智能体方法,就是让模型像自主智能体一样,主动规划观察步骤、选择值得关注的图像区域、管理自身的注意力和记忆,而不是被动地接受一次图像输入。

VistaHop为这类方法提供了标准化的测试平台,有助于比较不同策略在长期视觉搜索中的表现。随着VistaHop的正式发布,视觉深度搜索有望成为多模态大模型研究的重要方向。研究团队表示,未来计划继续扩展场景和任务类型,使基准覆盖更多真实世界的复杂视觉问题。对于人工智能而言,能够像人一样“多看几眼、多想几步”,或许是通往下一代智能视觉系统的必经之路。而VistaHop,正是衡量这一进步的标尺。

Related

相關文章

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了

2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。

3 小時前