IT之家生成式AI

AI 倉庫調用漏洞 HalluSquatting 披露,攻擊“龍蝦”成功率約 80-100%

2026年7月10日 11:38
AI 倉庫調用漏洞 HalluSquatting 披露,攻擊“龍蝦”成功率約 80-100%

重點摘要

**AI 仓库调用漏洞 HalluSquatting 披露:利用模型幻觉劫持工具链,“龙虾”系统最高八成中招** 一项由以色列特拉维夫大学、以色列理工学院与财务软件公司 Intuit 联合发布的最新研究揭示,一种被称为 HalluSquatting 的新型人工智能安全漏洞正在对智能体(Agent)系统构成严重威胁。该漏洞的核心在于放大 AI 模型在调用外部工具或代码仓库时普遍存在的“幻觉”倾向,使其将本不存在的恶意地址当作真实仓库进行下载和执行。

站內 AI 整理稿

**AI 仓库调用漏洞 HalluSquatting 披露:利用模型幻觉劫持工具链,“龙虾”系统最高八成中招**

一项由以色列特拉维夫大学、以色列理工学院与财务软件公司 Intuit 联合发布的最新研究揭示,一种被称为 HalluSquatting 的新型人工智能安全漏洞正在对智能体(Agent)系统构成严重威胁。该漏洞的核心在于放大 AI 模型在调用外部工具或代码仓库时普遍存在的“幻觉”倾向,使其将本不存在的恶意地址当作真实仓库进行下载和执行。研究人员的量化测试显示,这一攻击模式对特定的 AI 代理框架——尤其是被社区称作“龙虾”的 OpenClaw 及其衍生系统——成功率已逼近 80% 至 100%,而 Cursor、Gemini CLI 与 GitHub Copilot 等工具也未能幸免,攻击成功率达 20% 至 35%。 ### “幻觉”从语言蔓延至行动

所谓 AI 幻觉,是指模型生成看似合逻辑但实际错误或毫无根据的输出。它通常源于训练数据不足、模型对上下文的不当外推或概率输出的偏差。HalluSquatting 正是利用这一弱点,将幻觉从“说话”环节延伸到“行动”环节。当智能体收到诸如“运行 windowstelemetryoff 脚本”或“安装某个新发布的 npm 包”这样的指令时,模型可能无法在已知的权威仓库中找到对应项目,于是自行“捏造”一个仓库地址——包括包含错别字的相似名称、重复组织名的不合理路径,或冒充官方的恶意账户地址。若攻击者早已在公开平台上注册了这些幻想出的名称并植入恶意代码,AI 代理就极有可能精确落入陷阱。 ### 攻击流程:从指令到完全失守

研究团队在论文中详细重现了一次典型攻击。假设一个合法的脚本仓库名为 OriginalOwner/WindowsTelemetryOff,而该仓库在模型训练集中未被收录或权重较低。当用户通过自然语言要求智能体执行关闭遥测功能的任务时,AI 可能首先尝试搜索,但由于其内置知识陈旧或搜索方式存在盲区,最终反而生成了诸如 SuperHacker/WindowsTelemetryOff 或 WindowsTelemetryOff/WindowsTelemetryOff 等虚构地址。如果攻击者已提前在这些地址上部署了包含反向 shell、密码窃取器或加密货币挖矿机的恶意代码,AI 代理会主动克隆该仓库并执行其中的脚本,在用户毫不知情的情况下将控制权交予攻击者。 ### 量化数据:时间与流行度是关键漏洞窗口

研究人员对不同时间发布的 GitHub 项目进行了针对性测试,结果揭示出清晰的时间效应:针对 2025 年发布的新仓库名称,模型的平均“幻觉率”高达 92.4%;而对于 2019 年或更早发布、常见于训练语料中的成熟项目,地址错误率骤降至仅 0.9%。这表明模型的知识固化在训练时点之后的新项目上存在巨大盲区,而攻击者恰恰可以利用该窗口期抢注名称。研究还发现,某些针对热门智能体技能(Skill)的文件名被刻意设计后,幻觉触发率可达到 100%,即模型每次都输出虚假地址。研究人员将这种可扩展、无目标、通过对抗性提示词(Promptware)触发的攻击方法总结为“规模化的无目标提示软件攻击”,并指出其具有通用性和迁移性——针对一个模型构造的诱饵仓库,往往也能成功欺骗其他模型。 ### 成功率分化:为何“龙虾”如此脆弱

在应用层的渗透测试中,不同产品的抵抗能力出现明显梯度。Cursor、Gemini CLI 和 GitHub Copilot 的攻击成功率为 20% 至 35%,虽然仍未摆脱风险,但尚有一定概率的纠错或防护机制。而 OpenClaw(即“龙虾”)及其一系列变体(如小米 mClaw、荣耀 YOYO Claw 等)则暴露出极高的脆弱性,攻击成功率普遍超过 80%,部分场景接近 100%。

研究人员分析,这种差距可能源于两类系统的设计哲学差异:部分 IDE 插件或 CLI 工具在克隆仓库前会进行二次确认或沙盒隔离,而 Robo 等智能体在设计上追求高度自主的“执行链条”,对自然语言转换而来的仓库名称更倾向于“先信赖再执行”,且其技能集市中存在大量用户贡献的非官方模块,攻击者更容易通过合理命名的仓库混入其中。### 危害远超代码执行

一旦智能体中招,恶意代码将在用户本地环境中获得与代理相同的权限。这不仅可以实现反向 shell、系统后门、敏感数据与密码批量窃取,还可以通过 AI 代理的持续运行能力进一步横向移动到其他系统,或安装持久化木马、利用计算资源挖矿,甚至通过 LLM 接口调用链构建更复杂的多阶段攻击。更值得警惕的是,HalluSquatting 不依赖传统的钓鱼链接或挂马网页,所有恶意行为都由用户自己的 AI 代理主动发起,传统监控手段极易失效。 ### 防御困境与行业警示

针对该漏洞,研究团队提出了一些初步缓解措施:在工具调用中加入正版仓库的白名单、引入基于区块链的仓库名认证、要求模型在发现未知名称时主动拒绝执行而非自我补全,并在智能体能使用前对技能仓库进行强制签名校验。然而,这些方案与当前智能体系统追求“流畅自主体验”的优化方向存在矛盾。过度验证将牺牲效率与自然交互感,而信任模型主观判断又会持续暴露风险。研究人员因此认为,HalluSquatting 本质上不是一个修补补丁就能解决的漏洞,它暴露了当前 AI 系统在知识边界与决策自信心之间缺乏必要审查机制的系统性缺陷。

随着 2025—2026 年 AI 智能体从开发辅助全面走向日常计算、工作流自动化和设备控制,类似的攻击面可能被成倍放大。OpenClaw 社区的开发者与 Anthropic、Microsoft 等模型提供商或许需要重新评估智能体的执行默认行为:在自主决策的每一步,应当加入“验证”而非“生成”环节。本次研究已以论文《Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting》形式公开,技术细节与测试数据正在引起安全社区广泛讨论。

可以预见,关于 AI 工具调用幻觉的博弈,将成为下一阶段大模型安全攻防的核心战场。

Related

相關文章

MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

33 分鐘前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

3 小時前

可靈AI核心技術骨幹王鑫濤被曝離職

快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

3 小時前