AgentRedBench發佈
重點摘要
# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型 **消息来源:何夕2077** 随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。
# AgentRedBench 发布:首个针对 LLM Agent SaaS 集成的动态红队基准与防御模型
**消息来源:何夕2077**
随着大语言模型(LLM)从对话助手向工具使用型 Agent 快速演进,通过函数调用接入 Gmail、Salesforce、Jira 等第三方 SaaS 服务已成为常态。然而,这一架构也打开了全新的攻击面——间接提示注入(Indirect Prompt Injection)正成为生产环境中真实且严重的威胁。攻击者利用 LLM Agent 在读取外部服务返回内容时无法区分用户指令与外部数据的特点,巧妙将恶意指令嵌入看似正常的响应中,从而劫持模型行为。现有针对此类攻击的基准评测存在明显短板:多数基准仅覆盖少数几个集成服务,且在不同运行之间重复相同的攻击载荷,缺乏动态变化和现实多样性。
同时,开源守卫模型大多基于聊天数据训练,对工具调用场景下的服务响应内容缺乏针对性检测能力,难以有效抵御实际攻击。针对这一空白,来自学术界的研究团队 Hiskias Dingeto 与 William Leeney 正式发布了 **AgentRedBench**——一个由 LLM 动态驱动的红队安全评测框架,专门用于评估和防御 SaaS 集成场景下的间接提示注入攻击。该成果的论文已提交至 arXiv,并获得社区广泛关注。AgentRedBench 构建了涵盖 **215 个细粒度、未明确授权场景**的评测集,覆盖 **24 种企业级 SaaS 集成**以及 **5 类攻击类型**。
不同于静态数据集,其场景由 LLM 动态生成并持续迭代,确保测试语料不易混入模型训练数据,从而长期保持攻击成功率(ASR)作为核心指标的有效性。研究团队在 Anthropic、OpenAI 和 Google 三大系列共 **8 个前沿模型**上进行了全面测评,结果显示,在无任何防御的情况下,攻击成功率介于 **32% 到 81%** 之间,充分说明当前主流 LLM Agent 在该威胁下的脆弱性。仅发现问题远非终点,AgentRedBench 项目同时提供了全新的防护方案——**AgentRedGuard**。这一专用防御模型能够以极低的误报率有效拦截间接注入攻击。
实验数据显示,在 Haiku、GPT-5.4-mini 和 Gemini-3-flash 三个目标模型家族上,AgentRedGuard 可将在线攻击成功率降低 **75 到 77 个百分点**,并且在实际良性流量上的误报率保持为 **0.0%**,在合成良性语料上仅为 **0.2%**。这一表现全面超越了现有的开源基线模型,包括 Llama Guard、PromptGuard 2 和 ProtectAI,在检测率和误报率两个维度均取得显著优势。更值得关注的是,AgentRedGuard 的防御能力并非仅限于训练时见过的攻击或集成类型。
研究团队设计了严格的跨集成与跨攻击者留存评测——将两个独立的攻击者家族完全从训练集中剔除,模型在这些未见场景下的防护效果依然稳健,证实了其良好的泛化能力与实用价值。在发布形式上,团队将代码库、集成 Schema 以及 AgentRedGuard 模型权重全部开源。为确保基准测评的长期可信性,标准评测场景集通过维护者介导的渠道进行管理,并采用不可变版本控制,从而避免场景泄漏到未来模型的训练语料中,保证了 ASR 等核心指标在时间维度上的可对比性。AgentRedBench 的提出为 LLM Agent 安全研究提供了亟需的标准化评测平台与防护基线。
它不仅首次系统化覆盖了多企业级 SaaS 集成下的间接提示注入威胁,而且通过动态红队生成机制使基准具备持续进化能力。与此同时,效果领先的 AgentRedGuard 为开发者提供了一种兼具高性能与低误报的开箱即用防护选择。随着 LLM Agent 在企业自动化、个人助理、客户服务等领域的快速落地,集成环节的安全问题愈发突出。AgentRedBench 的发布标志着业界对这一威胁的认识从理论走向了实操评估与主动防御阶段,也为未来更具鲁棒性的 Agent 安全设计指明了方向。
论文以《AgentRedBench: Dynamic Redteaming and Integration-Aware Defense for LLM Agents over SaaS Integrations》为题,已发表于 arXiv(编号 2606.02240),并于 2026 年 7 月更新至第三版。研究者同时提供了完整 PDF、HTML 预览及 BibTeX 引用信息,方便社区引用与复现。在 LLM 安全攻防博弈日益激烈的今天,AgentRedBench 的出现为工具型 Agent 筑起了一道新的防线,也为广大开发者、安全研究员和平台运营者提供了一个值得信赖的评测沙盘。
未来,随着集成生态的扩展和攻击手法的演进,这一框架预计将持续更新,成为 AI 代理安全领域的重要基础设施。
Related
相關文章

曝字節訓10億參數大模型,或超Mythos 5,張一鳴、梁汝波先後發聲
字節跳動正在訓練一個參數量高達10萬億的AI模型,規模可能超越Anthropic的Mythos 5。創辦人張一鳴在內部會議中強調編程的關鍵地位,並反對模型蒸餾,認為這只能複製而非超越對手。字節跳動在AI領域持續加大投入,同時在產品端與訓練端採取雙線進攻策略。

AI 需求擠爆雲計算,消息稱 AWS 要求工程師關閉閒置服務器減少資源浪費
因AI需求導致算力緊缺,亞馬遜AWS要求工程師關閉閒置的EC2實例,以減少資源浪費。數據顯示約65%的EC2實例在30天內平均CPU利用率低於20%,AWS因此升級計算優化器自動標記低使用率虛擬機。此外,AWS過去一年新增3.8吉瓦電力容量,仍難以應對GPU雲端實例的龐大需求。

六巨頭定AI插件新標準,撞臉Claude,Anthropic沒上桌
六大科技巨頭(AWS、Anysphere、GitHub、微軟、OpenAI、Vercel)聯合發布AI智能體插件統一開放規範Agent Plugins 1.0.0,旨在統一插件打包格式,減少開發者重複勞動。該規範的結構與Anthropic的Claude Code插件系統高度相似,但Anthropic並未參與制定,而是繼續經營自己的封閉生態。

DeepSeek重啟融資,三年市值對齊騰訊?
DeepSeek重啟第二輪融資,以5000億元人民幣估值尋求籌集80億美元,但網傳一份由小型醫藥私募發起的專項基金募資材料引發網友質疑,後經DeepSeek員工證實部分數據屬實。該公司近期宣布API大幅漲價,可能打破其以低價換規模的估值邏輯,面臨客戶流失風險。市場關注其能否從「價格屠夫」轉型為價值提供商,以及三年內市值能否對齊騰訊等巨頭。

可靈AI核心技術骨幹王鑫濤被曝離職
快手可靈AI核心技術骨幹王鑫濤被曝離職,去向未知,快手官方與本人均未回應。王鑫濤是圖像與視頻生成領域知名開源項目主要作者,被視為可靈從0到1的關鍵推手。其離職發生在可靈完成獨立融資、估值180億美元的關鍵階段,可能影響研發進度與競爭優勢。

AI短劇、漫劇、戀綜、電影、藝人都有了,AI觀眾也不遠了
2026年AI影視內容全面爆發,從短劇、長劇到電影、綜藝,AI製作的作品大量湧現,衛視也開始播出AI短劇。AI演員如方桃子迅速走紅,商業變現能力驚人,廣告報價甚至超過許多真人網紅。AI短劇市場規模已突破220億元,用戶超過6億,但同時也引發了對真人演員就業和內容品質的擔憂。