何夕2077生成式AI

AgentRedBench發佈

2026年7月21日 00:00

重點摘要

# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型 **消息来源:何夕2077** 随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。

站內 AI 整理稿

# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型

**消息来源:何夕2077**

随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。攻击者利用 LLM Agent 在读取外部服务返回内容时无法区分用户指令与外部数据的特点,巧妙将恶意指令嵌入看似正常的响应中,从而劫持模型行为。现有针对此类攻击的基准评测存在明显短板:多数基准仅覆盖少数几个集成服务,且在不同运行之间重复相同的攻击载荷,缺乏动态变化和现实多样性。

同时,开源守卫模型大多基于聊天数据训练,对工具调用场景下的服务响应内容缺乏针对性检测能力,难以有效抵御实际攻击。针对这一空白,来自学术界的研究团队 Hiskias Dingeto 与 William Leeney 正式发布了 **AgentRedBench**——一个由 LLM 动态驱动的红队安全评测框架,专门用于评估和防御 SaaS 集成场景下的间接提示注入攻击。该成果的论文已提交至 arXiv,并获得社区广泛关注。AgentRedBench 构建了涵盖 **215 个细粒度、未明确授权场景**的评测集,覆盖 **24 种企业级 SaaS 集成**以及 **5 类攻击类型**。

不同于静态数据集,其场景由 LLM 动态生成并持续迭代,确保测试语料不易混入模型训练数据,从而长期保持攻击成功率(ASR)作为核心指标的有效性。研究团队在 Anthropic、OpenAI 和 Google 三大系列共 **8 个前沿模型**上进行了全面测评,结果显示,在无任何防御的情况下,攻击成功率介于 **32% 到 81%** 之间,充分说明当前主流 LLM Agent 在该威胁下的脆弱性。仅发现问题远非终点,AgentRedBench 项目同时提供了全新的防护方案——**AgentRedGuard**。这一专用防御模型能够以极低的误报率有效拦截间接注入攻击。

实验数据显示,在 Haiku、GPT-5.4-mini 和 Gemini-3-flash 三个目标模型家族上,AgentRedGuard 可将在线攻击成功率降低 **75 到 77 个百分点**,并且在实际良性流量上的误报率保持为 **0.0%**,在合成良性语料上仅为 **0.2%**。这一表现全面超越了现有的开源基线模型,包括 Llama Guard、PromptGuard 2 和 ProtectAI,在检测率和误报率两个维度均取得显著优势。更值得关注的是,AgentRedGuard 的防御能力并非仅限于训练时见过的攻击或集成类型。

研究团队设计了严格的跨集成与跨攻击者留存评测——将两个独立的攻击者家族完全从训练集中剔除,模型在这些未见场景下的防护效果依然稳健,证实了其良好的泛化能力与实用价值。在发布形式上,团队将代码库、集成 Schema 以及 AgentRedGuard 模型权重全部开源。为确保基准测评的长期可信性,标准评测场景集通过维护者介导的渠道进行管理,并采用不可变版本控制,从而避免场景泄漏到未来模型的训练语料中,保证了 ASR 等核心指标在时间维度上的可对比性。AgentRedBench 的提出为 LLM Agent 安全研究提供了亟需的标准化评测平台与防护基线。

它不仅首次系统化覆盖了多企业级 SaaS 集成下的间接提示注入威胁,而且通过动态红队生成机制使基准具备持续进化能力。与此同时,效果领先的 AgentRedGuard 为开发者提供了一种兼具高性能与低误报的开箱即用防护选择。随着 LLM Agent 在企业自动化、个人助理、客户服务等领域的快速落地,集成环节的安全问题愈发突出。AgentRedBench 的发布标志着业界对这一威胁的认识从理论走向了实操评估与主动防御阶段,也为未来更具鲁棒性的 Agent 安全设计指明了方向。

论文以《AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations》为题,已发表于 arXiv(编号 2606.02240),并于 2026 年 7 月更新至第三版。研究者同时提供了完整 PDF、HTML 预览及 BibTeX 引用信息,方便社区引用与复现。在 LLM 安全攻防博弈日益激烈的今天,AgentRedBench 的出现为工具型 Agent 筑起了一道新的防线,也为广大开发者、安全研究员和平台运营者提供了一个值得信赖的评测沙盘。

未来,随着集成生态的扩展和攻击手法的演进,这一框架预计将持续更新,成为 AI 代理安全领域的重要基础设施。

Related

相關文章

MarkTechPost AI生成式AI

使用 NVIDIA NeMo Retriever、託管 NIM、LanceDB、重新排序與基於事實生成建立多模態 RAG 管線

在本教學中,我們將使用 NVIDIA NeMo Retriever 建立一個先進的多模態檢索增強生成管線。首先設定 Python 3.12 環境、安裝必要套件,並在無需 GPU 或外部 API 金鑰的情況下進行離線 PDF 文字提取。接著,我們透過託管的 NVIDIA NIM 端點來偵測頁面元素、提取表格、圖表與資訊圖形、產生稠密向量嵌入,並將處理後的內容儲存至 LanceDB。最後,我們實作了稠密檢索、視覺語言重新排序、後設資料過濾搜尋、附行內引用的基於事實回應生成,以及輕量級的 recall-at-k 評估,以驗證跨多模態文件內容的檢索品質。

39 分鐘前
MarkTechPost AI生成式AI

NVIDIA AI 推出 NOOA:將 AI 代理轉化為單一 Python 類別的物件導向框架

NVIDIA 實驗室開源了 NOOA(NVIDIA 物件導向代理),這是一個與模型無關的 Python 框架,用於建構 AI 代理。傳統的代理開發分散在提示模板、工具架構、回呼程式碼和工作流程圖中,而 NOOA 將所有這些整合到一個 Python 類別中:方法代表模型可採取的動作,欄位代表代理狀態,文件字串作為提示,型別註解則是執行時期強制執行的合約。主體為「...」的方法由 LLM 驅動的迴圈在執行時期完成,而具有正常主體的方法則保持確定性的 Python 程式碼。開發者與模型因此共享同一介面,使代理行為能像一般軟體一樣進行測試、追蹤、重構和版本控制。NVIDIA 報告在 SWE-bench Verified 上達到 82.2%,在 CyberGym L1 上達到 86.8%,平均 RHAE 為 85.1%。

1 小時前

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌

六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

2 小時前
鈦媒體生成式AI

DeepSeek重啟融資,三年市值對齊騰訊?

DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

4 小時前