AgentRedBench發佈
重點摘要
# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型 **消息来源:何夕2077** 随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。
# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型
**消息来源:何夕2077**
随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。攻击者利用 LLM Agent 在读取外部服务返回内容时无法区分用户指令与外部数据的特点,巧妙将恶意指令嵌入看似正常的响应中,从而劫持模型行为。 现有针对此类攻击的基准评测存在明显短板:多数基准仅覆盖少数几个集成服务,且在不同运行之间重复相同的攻击载荷,缺乏动态变化和现实多样性。同时,开源守卫模型大多基于聊天数据训练,对工具调用场景下的服务响应内容缺乏针对性检测能力,难以有效抵御实际攻击。 针对这一空白,来自学术界的研究团队 Hiskias Dingeto 与 William Leeney 正式发布了 **AgentRedBench**——一个由 LLM 动态驱动的红队安全评测框架,专门用于评估和防御 SaaS 集成场景下的间接提示注入攻击。该成果的论文已提交至 arXiv,并获得社区广泛关注。 AgentRedBench 构建了涵盖 **215 个细粒度、未明确授权场景**的评测集,覆盖 **24 种企业级 SaaS 集成**以及 **5 类攻击类型**。不同于静态数据集,其场景由 LLM 动态生成并持续迭代,确保测试语料不易混入模型训练数据,从而长期保持攻击成功率(ASR)作为核心指标的有效性。研究团队在 Anthropic、OpenAI 和 Google 三大系列共 **8 个前沿模型**上进行了全面测评,结果显示,在无任何防御的情况下,攻击成功率介于 **32% 到 81%** 之间,充分说明当前主流 LLM Agent 在该威胁下的脆弱性。 仅发现问题远非终点,AgentRedBench 项目同时提供了全新的防护方案——**AgentRedGuard**。这一专用防御模型能够以极低的误报率有效拦截间接注入攻击。实验数据显示,在 Haiku、GPT-5.4-mini 和 Gemini-3-flash 三个目标模型家族上,AgentRedGuard 可将在线攻击成功率降低 **75 到 77 个百分点**,并且在实际良性流量上的误报率保持为 **0.0%**,在合成良性语料上仅为 **0.2%**。这一表现全面超越了现有的开源基线模型,包括 Llama Guard、PromptGuard 2 和 ProtectAI,在检测率和误报率两个维度均取得显著优势。 更值得关注的是,AgentRedGuard 的防御能力并非仅限于训练时见过的攻击或集成类型。研究团队设计了严格的跨集成与跨攻击者留存评测——将两个独立的攻击者家族完全从训练集中剔除,模型在这些未见场景下的防护效果依然稳健,证实了其良好的泛化能力与实用价值。 在发布形式上,团队将代码库、集成 Schema 以及 AgentRedGuard 模型权重全部开源。为确保基准测评的长期可信性,标准评测场景集通过维护者介导的渠道进行管理,并采用不可变版本控制,从而避免场景泄漏到未来模型的训练语料中,保证了 ASR 等核心指标在时间维度上的可对比性。 AgentRedBench 的提出为 LLM Agent 安全研究提供了亟需的标准化评测平台与防护基线。它不仅首次系统化覆盖了多企业级 SaaS 集成下的间接提示注入威胁,而且通过动态红队生成机制使基准具备持续进化能力。与此同时,效果领先的 AgentRedGuard 为开发者提供了一种兼具高性能与低误报的开箱即用防护选择。 随着 LLM Agent 在企业自动化、个人助理、客户服务等领域的快速落地,集成环节的安全问题愈发突出。AgentRedBench 的发布标志着业界对这一威胁的认识从理论走向了实操评估与主动防御阶段,也为未来更具鲁棒性的 Agent 安全设计指明了方向。 论文以《AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations》为题,已发表于 arXiv(编号 2606.02240),并于 2026 年 7 月更新至第三版。研究者同时提供了完整 PDF、HTML 预览及 BibTeX 引用信息,方便社区引用与复现。 在 LLM 安全攻防博弈日益激烈的今天,AgentRedBench 的出现为工具型 Agent 筑起了一道新的防线,也为广大开发者、安全研究员和平台运营者提供了一个值得信赖的评测沙盘。未来,随着集成生态的扩展和攻击手法的演进,这一框架预计将持续更新,成为 AI 代理安全领域的重要基础设施。
Related
相關文章

預售破萬單,市值蒸發超200億:情感機器人遭遇“監管與量產”雙重淬火
預售破萬單,市值蒸發超200億:情感機器人遭遇“監管與量產”雙重淬火AGI-Signal2026.07.21 18:40 · 來自山西全文3691字00:00 / 10:23U1那些“像人”的能力,恰恰暴露了全行業的安全黑洞,也讓早已落定的監管利劍精準劈向了這條賽道。一場閉門會,把情感機器人的三大命門攤在了桌面上。

在下一個模型發佈之前
賬號設置我的關注我的收藏申請的報道退出登錄登錄搜索36氪Auto數字時氪未來消費智能湧現未來城市啟動Power on36氪出海36氪研究院潮生TIDE36氪企服點評36氪財經職場bonus36碳後浪研究所暗湧Waves硬氪氪睿研究院媒體品牌企業號企服點評36Kr研究院36Kr創新諮詢企業服務核心服務城市之窗政府服務創投發佈LP源計劃VClubVClub投資機。

WAIC重磅成果|上海儀電智算牽頭成立“智算系統架構聯盟”併發布《超節點系統架構規範》
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

WAIC重磅成果|智愛賽思全面升級併發布科研專屬Token Plan
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.

中國銀行將推長城 BOC-AI 信用卡,每月消費達標有機會領取智譜、MiniMax 等 Token 權益
首頁 > 智能時代>人工智能 中國銀行將推長城 BOC-AI 信用卡,每月消費達標有機會領取智譜、MiniMax 等 Token 權益 2026/7/21 17:28:06 來源:IT之家 作者:潞源 責編:潞源 評論: IT之家 7 月 21 日消息,中國銀行上週(7 月 17 日)宣佈,長城 BOC-AI 信用卡即將上線。

WAIC重磅成果|儀電智算雲在國家人工智能應用中試基地建設中展現全棧服務能力
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.