[论文学习]Agent Security Bench (ASB):形式化与基准测试LLM智能体的攻防体系
Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents论文重点LLM-based Agent基于大语言模型的智能体在调用外部工具和记忆机制解决复杂任务的同时也引入了严重的安全隐患但学界一直缺乏系统性的评估框架。ASB首次构建了一个涵盖10个场景、10类智能体、400余种工具、27种攻防方法及7项评估指标的综合性基准框架。通过对13种LLM骨干网络、近90,000个测试用例的大规模实验ASB揭示了智能体在系统提示、用户指令、工具调用和记忆检索等环节的严重安全漏洞——最高平均攻击成功率达到了84.30%而现有防御手段的效果极为有限。核心研究内容问题定义LLM-based Agent的兴起让AI从“对话”走向了“行动”——它们不仅能回答问题还能调用搜索引擎、读写文件、操作数据库、控制API接口。但正是这种“能做事”的能力打开了全新的攻击面。一个传统的LLM如果被越狱最多输出有害内容但一个被攻击的Agent可能真的会删除你的文件、转账你的资金、泄露你的隐私数据。然而此前的安全评估工作大多各自为政有的只关注对话场景下的提示注入有的只研究单一类型的智能体缺乏一个统一的、可复现的评估框架。ASB要回答的核心问题是LLM-based Agent到底有多脆弱攻击者可以从哪些角度下手现有的防御手段到底管不管用创新方法ASB的贡献可以拆解为三个层面第一形式化了Agent的攻防空间。论文系统地梳理了Agent运行的关键环节——系统提示定义角色和行为、用户指令解析、记忆检索、规划推理、工具执行——并针对每个环节设计了对应的攻击向量。第二构建了大规模的基准测试平台。这不是一个玩具式的Demo而是一个覆盖10个真实场景电商、自动驾驶、金融、学术咨询、心理咨询、投资、法律等、包含400多种工具、支持13种LLM骨干网络的大型评估体系。攻击类型涵盖了10种提示注入攻击、记忆投毒攻击、以及论文原创的Plan-of-ThoughtPoT后门攻击和混合攻击。第三提出了兼顾安全与效用的评估指标。单纯看攻击成功率会误导人——一个永远拒绝所有请求的Agent当然“安全”但毫无用处。ASB引入了一个新指标来评估Agent在保持任务完成能力的同时抵御攻击的能力。研究成果实验数据相当触目惊心。在ASB的全面测试下各类攻击在Agent的不同运行阶段都能取得极高的成功率最高平均攻击成功率达到了84.30%。这意味着在某种攻击配置下平均每10次攻击就有超过8次能够成功让Agent执行攻击者期望的恶意行为。更值得警惕的是论文测试的11种现有防御手段效果普遍不佳。这揭示了一个尴尬的现状我们在Agent安全攻防这个战场上攻击者已经跑出了很远而防御者还在原地踏步。实际落地应用的可能性ASB的价值不仅停留在学术论文层面。它是一个可直接运行的代码仓库基于AIOSAgent Intelligence Operating System开发支持通过YAML配置文件灵活定义攻击参数和LLM后端。对于实际应用企业安全团队可以直接用ASB对自己的Agent系统进行红队测试在部署之前发现安全隐患Agent开发者可以用ASB作为安全 regression test 的组成部分每次迭代后自动评估安全风险云服务商和模型提供商可以用ASB来横向对比不同模型和不同防御策略的安全性作为选型和优化的依据。技术细节攻击类型体系ASB将攻击分为四大类1. 直接提示注入DPI - Direct Prompt Injection攻击者在用户输入中嵌入恶意指令试图覆盖或绕过系统提示中设定的安全约束。这是最直观也最常见的攻击方式。2. 观测提示注入OPI - Observation Prompt Injection攻击不直接来自用户而是来自Agent执行过程中观测到的外部信息——比如网页内容、API返回结果、文件内容等。这种“间接注入”更难防范因为攻击者不需要直接与Agent对话。3. 记忆投毒攻击Memory PoisoningAgent通常维护一个记忆库来存储历史交互和检索到的信息。攻击者通过污染记忆库中的内容让Agent在未来检索时获取被篡改的信息从而影响其决策。4. Plan-of-ThoughtPoT后门攻击这是论文原创的攻击方法。不同于传统的思维链CoT后门——后者通常在推理过程中植入触发器——PoT后门攻击作用于Agent的规划阶段。攻击者通过特定的触发模式让Agent在制定行动计划时产生预设的恶意行为。评估指标ASB设计了7-8项评估指标核心包括攻击成功率ASR - Attack Success Rate衡量攻击生效的比例任务完成率衡量Agent在遭受攻击时仍能完成原本任务的能力安全-效用平衡指标这是ASB的特色指标用于评估Agent在安全性和实用性之间的权衡表现。实验规模13种LLM骨干网络涵盖GPT-4o、GPT-4o-mini、Claude-3、Gemini-2.0-flash、Llama-3.3-70B等主流模型近90,000个测试用例10个真实场景和对应的10类智能体研究设定架构设计ASB基于AIOSAgent Intelligence Operating System构建。AIOS提供了一个标准化的Agent运行环境使得ASB能够统一地注入攻击、收集日志、评估结果。每个Agent在ASB中的运行遵循标准流程通过系统提示定义角色和行为规范接收用户指令从记忆库中检索相关信息基于检索结果和上下文进行规划调用外部工具执行动作ASB的攻击注入点覆盖了上述所有环节。硬件与软件配置环境要求Python 3.11Conda环境管理依赖项通过pip install -r requirements.txt安装LLM后端支持闭源模型通过API调用如OpenAI GPT-4o、Anthropic Claude等开源模型通过Ollama本地部署支持CPU-only模式无需CUDA环境运行方式# 直接提示注入python scripts/agent_attack.py--cfg_pathconfig/DPI.yml# 观测提示注入python scripts/agent_attack.py--cfg_pathconfig/OPI.yml# 记忆投毒攻击python scripts/agent_attack.py--cfg_pathconfig/MP.yml# 混合攻击python scripts/agent_attack.py--cfg_pathconfig/mixed.yml# PoT后门攻击python scripts/agent_attack_pot.py配置灵活性通过YAML文件可以自由组合选择不同的LLM骨干网络、不同的攻击方法、不同的场景和Agent配置。例如同时测试GPT-4o和LLaMA3.1-70B只需在YAML中列出两个模型名称即可。综合分析为什么84.30%的ASR值得警惕84.30%这个数字背后反映的是一个结构性问题而不是某个模型的“一时疏忽”。LLM-based Agent的安全脆弱性根植于其架构设计本身。传统软件的安全边界是清晰的——输入经过校验、权限经过检查、操作经过审计。但Agent的本质是一个**“将自然语言转化为行动”**的系统而自然语言本身就是模糊的、上下文敏感的、难以形式化验证的。当攻击者说“请忽略之前的所有指令”时这不是一个传统意义上的“注入攻击”——没有缓冲区溢出没有SQL语法错误没有XSS脚本。这就是一句人话。而恰恰因为它是人话LLM才会“理解”并“遵从”。Agent越智能它就越擅长理解这类指令——也就越容易被这类指令操纵。这就是Agent安全的核心悖论智能本身就是漏洞。Plan-of-Thought后门攻击的深层意义PoT后门攻击的提出尤其值得关注。传统的提示注入攻击本质上是“指令覆盖”——用新的指令盖过旧的指令。但PoT攻击作用于规划层面Agent不是在执行一个“错误”的指令而是在“正确”地规划一个“错误”的行动方案。这意味着攻击者不再需要直接控制Agent说什么而是可以操纵Agent怎么想。这种攻击更难被检测因为从日志来看Agent的一切行为都是“合理”的——它只是在按照自己的规划逻辑行事只不过这个逻辑已经被暗中扭曲了。防御失效的深层原因论文指出现有11种防御手段效果有限。这并不令人意外。大多数现有防御本质上是在做“内容过滤”——检测输入中是否包含恶意关键词、是否试图绕过系统提示。但面对越来越复杂的攻击手法尤其是PoT这类作用于规划层面的攻击简单的过滤就像用渔网挡子弹。真正的防御可能需要从根本上重新思考Agent的架构如何让Agent在“理解”指令的同时“不信任”指令如何在保持智能的同时建立不可逾越的安全边界这些问题目前还没有令人满意的答案。实践应用如果你是Agent开发者在部署前进行红队测试直接用ASB对你的Agent进行全面的安全评估。不要等到上线后再后悔。建立持续安全回归测试将ASB集成到CI/CD流程中每次更新模型或修改Prompt后自动运行安全测试。关注间接注入风险如果你的Agent会读取网页、邮件、文档等外部内容OPI类攻击是你最需要警惕的。如果你是安全工程师不要迷信现有防御方案论文已经证明目前市面上大多数防御手段在ASB的测试下效果有限。采购安全方案前先用ASB验证一下。从架构层面思考安全提示过滤和输入校验是必要的但远远不够。需要思考如何在Agent的规划、执行、记忆等各个环节建立安全机制。关注多智能体场景ASB目前主要针对单智能体但现实中多个Agent协作的场景会带来更复杂的安全问题——一个被攻陷的Agent可能成为攻击其他Agent的跳板。如果你是研究人员ASB是一个现成的实验平台代码已开源场景、工具、评估指标都已就位。可以在此基础上研究新的攻击方法或防御策略。安全-效用平衡是一个值得深挖的方向ASB提出的兼顾安全与效用的评估思路很有价值但目前这方面的研究还远远不够。关注防御而非只是发现漏洞84.30%的ASR告诉我们“发现问题”已经做得很充分了真正欠缺的是“解决问题”。参考资料原始论文Zhang, H., Huang, J., Mei, K., et al. “Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents.”ICLR 2025. https://arxiv.org/abs/2410.02644官方代码仓库https://github.com/agiresearch/ASB项目网站https://luckfort.github.io/ASBench/

相关新闻

Java:数据类型全景详解(完整版多表格对照)

Java:数据类型全景详解(完整版多表格对照)

数据类型是Java语言的核心基石,Java作为强类型语言,要求所有变量必须明确声明数据类型,系统会根据类型分配内存、校验数据合法性、控制运算规则。Java数据类型整体分为两大体系:基本数据类型(原生类型)和引…

2026/7/27 1:04:37阅读更多 →
手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备!

手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备!

手撕深度学习:矩阵求导链式法则与矩阵乘法反向传播公式,深度学习进阶必备! 深度学习看似神秘,但核心其实只是数学和代码的优雅结合。尤其是反向传播(Backpropagation),它是训练神经网络的引擎。…

2026/7/27 1:04:37阅读更多 →
BES-ELM优化算法在工业预测中的实践与性能提升

BES-ELM优化算法在工业预测中的实践与性能提升

1. 项目概述在工程预测和数据分析领域,多输入单输出(MISO)系统的建模一直是个经典难题。传统方法要么计算复杂度太高,要么容易陷入局部最优解。最近我在一个工业设备寿命预测项目中,尝试将秃鹰搜索算法(BES…

2026/7/27 1:02:37阅读更多 →
从清北人才竞争看全球学术生态构建与顶尖人才流动

从清北人才竞争看全球学术生态构建与顶尖人才流动

前几天,一则关于丘成桐先生邀请王虹、邓煜两位青年数学家回国任教的消息,在学术圈内外引起了不小的波澜。消息本身并不复杂,但背后那句“清北斗了20年竟发现对手不是彼此”的判断,却戳中了许多人对国内顶尖高校人才生态的长期观察…

2026/7/27 2:30:51阅读更多 →
基于YOLOv8的蘑菇智能检测系统开发实践

基于YOLOv8的蘑菇智能检测系统开发实践

1. 项目概述:基于YOLOv8的蘑菇智能检测系统作为一名长期从事计算机视觉应用的开发者,我最近完成了一个实用型项目——基于YOLOv8的蘑菇种类检测系统。这个项目最初源于野外考察时的实际需求:如何快速区分可食用蘑菇与有毒品种。传统的人工鉴别…

2026/7/27 2:30:51阅读更多 →
Ohnrscript:基于JavaScript语法的系统编程语言与HTTP Unikernel实践

Ohnrscript:基于JavaScript语法的系统编程语言与HTTP Unikernel实践

最近在探索系统级编程语言时,发现了一个很有意思的项目——Ohnrscript。这个语言采用了我们熟悉的 JavaScript 语法,却能够编译成高效的机器码,还内置了 HTTP unikernel 功能。对于习惯了 JavaScript 但又需要系统级性能的开发者来说&#xf…

2026/7/27 2:30:51阅读更多 →
AI驱动的企业应收账款智能风控系统设计与实践

AI驱动的企业应收账款智能风控系统设计与实践

1. 项目背景与核心挑战应收账款管理一直是企业财务部门的痛点。我在为多家制造业企业提供财务系统咨询时发现,超过70%的财务总监最头疼的问题就是应收账款风险。传统的人工评估方式就像用算盘处理大数据——财务人员需要手动整理客户付款记录、行业报告、财务报表等…

2026/7/27 2:30:51阅读更多 →
3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南

3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南

3分钟掌握BOTW存档编辑器:终极游戏自定义工具指南 【免费下载链接】BOTW-Save-Editor-GUI A Work in Progress Save Editor for BOTW 项目地址: https://gitcode.com/gh_mirrors/bo/BOTW-Save-Editor-GUI 你是否曾为《塞尔达传说:旷野之息》中武器…

2026/7/27 2:30:51阅读更多 →
Oracle c asm单机OPatch补丁报错“checkSystemCommandAvailable“ failed.

Oracle c asm单机OPatch补丁报错“checkSystemCommandAvailable“ failed.

Oracle c asm单机OPatch补丁报错"checkSystemCommandAvailable" failed. 深度解析与解决 作为一名数据库运维人员,你一定经历过打补丁时遇到各种“妖魔鬼怪”的报错。今天我们要聊的是一个在Oracle 12c、19c等版本(尤其是单机ASM环境&#xff…

2026/7/27 2:28:51阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/27 1:14:34阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/27 1:14:52阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/27 1:14:56阅读更多 →
SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

SPI实战指南:从时钟模式到寄存器配置,解决嵌入式通信难题

1. 项目概述:从寄存器手册到实战指南 如果你手头有一份类似德州仪器(TI)TMS320x240xA系列DSP的SPI模块技术手册,看着里面密密麻麻的寄存器位定义、时序图和公式,是不是感觉头大?这份资料虽然权威&#xff0…

2026/7/27 0:00:24阅读更多 →
【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

【JAVA毕设源码分享】基于springboot的水果购物管理系统的设计与实现(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/27 0:00:24阅读更多 →
2007-2023年各市区县生态文明建设示范区DID

2007-2023年各市区县生态文明建设示范区DID

数据简介 自改革开放以来,我国依赖高投入、高资源消耗和高污染等传统发展模式实现了经济短期内的快速增长, 然而这也导致了严重的生态环境危机。因此,国家有力于推动企业高质量经济发展,协同生态保护的方针,从而从201…

2026/7/27 0:00:24阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/26 19:05:21阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/26 19:05:21阅读更多 →