AI Agent上线的4个坑和4道防线
2026年7月AI安全事件扎堆出现。Claude Cowork智能体被曝可以读写Mac上任意的文件影响大概50万用户。同一个月有AI助手被用户诱导着删掉了本地的关键工作文件。OpenClaw的交易智能体因为提示词注入被人用话术骗走了价值25万美元的加密货币。还有一个开发者部署了AI助手只做文档处理一天干掉了5000万Token。这些事放在一起看结论很清楚AI安全已经不是合规部门的事是每个写AI应用的人都要盯住的工程问题。下面把AI Agent相关的4个坑和4道防线整理出来。每条防线都配了可以直接用的代码或配置。4个坑第一个坑权限给得太宽。Agent能干复杂任务是因为你给了它高权限。但权限给出去之后它分不清该做什么和能做什么。给它读邮件的权限它能被诱导去读别的目录。第二个坑提示词和用户输入混在一起。系统指令和用户输入都拼在prompt里LLM分不清哪个是规则、哪个是用户说的话。用巧妙的话术绕开角色约束比想象中容易。第三个坑用了来源不明的东西。第三方开源模型、社区技能包、NPM包——你不知道里面有没有夹带私货。ClawHub被审计出341个恶意技能包。第四个坑没有配额和监控。没有单用户上限、没有异常检测、没有硬封顶一个攻击或死循环就能让账单翻几十倍。4道防线防线一权限收窄一个任务只给完成它需要的最小权限。任务跑完就收回。LangChain配置示例agent.yamlyamlagent:name: “doc_reader”permissions:filesystem: - path: /workspace/documents/* access: readonly network: allowed_domains: - api.internal.comauto_revoke: truerevoke_after_seconds: 300OpenAI Assistants配置示例创建Assistant时指定pythonassistant client.beta.assistants.create(nameDoc Reader, modelgpt-4o, tools[{type: file_search}], tool_resources{ file_search: { vector_store_ids: [vs_xxx] } })关键限制可访问的文件ID列表而非整个向量存储自建Agent用容器隔离docker runbashdocker run-v /workspace/documents:/data:ro \ # 只读挂载–read-only \ # 容器根文件系统只读–cap-dropALL \ # 移除所有能力–security-optno-new-privileges \ # 禁止提权my-agent:latest防线二输入输出过滤AI调用前过滤输入AI返回后过滤输出。输入过滤Python可直接复制pythonimport reINJECTION_PATTERNS [r(?i)ignore\s*(all\s*)?(previous|prior).*instructions, r(?i)system\s*(role|prompt|instruction).*override, r(?i)from\s*now\s*on.*(you are|act as), r(?i)new\s*(instruction|rule|task).*follow, r【系统】|【新指令】, # 中文变种]def detect_injection(user_input: str) - bool:for pattern in INJECTION_PATTERNS: if re.search(pattern, user_input): return True return False调用AI之前if detect_injection(user_input):return {error: 检测到可疑输入已拦截}response call_llm(user_input)输出过滤Agent执行命令前检查pythonDANGEROUS_COMMANDS [rrm\s-rf\s/, rchmod\s777\s, reval\s*\(, rexec\s*\(, rsystem\s*\(, ros\.system, rsubprocess\.(call|Popen|run),]def check_output_safety(output: str) - bool:for pattern in DANGEROUS_COMMANDS: if re.search(pattern, output): return False return TrueAgent要执行命令之前if not check_output_safety(command_to_execute):raise Exception(检测到危险命令已阻止执行)防线三高风险操作二次确认删除文件、发起退款、修改数据库——AI不能直接执行。确认流程伪代码pythondef execute_with_confirmation(action, risk_description):# 1. AI判断该做 if ai.decides_to_execute(action): # 2. 弹确认框 user_confirmed show_confirmation_dialog( titleAI请求执行高风险操作, messagefAI建议执行{action}, riskrisk_description, confirm_button确认执行, # 小、灰 cancel_button取消, # 大、亮 require_typingTrue # 让用户输入确认执行四个字 ) # 3. 用户确认才执行 if user_confirmed: return execute(action) else: return {status: cancelled}关键设计取消按钮比确认更醒目让用户手动输入确认执行四个字防止疲劳点击记录每次确认/取消的审计日志防线四配额、告警、硬封顶三层防护缺一不可。配额配置OpenAI风格APIpython在调用代码中主动限制class RateLimiter:def __init__(self, rpm_limit100, monthly_limit1000000): self.rpm_limit rpm_limit self.monthly_limit monthly_limit self.current_month_usage 0def can_call(self, user_id):检查月度配额 usage get_usage(user_id) if usage self.monthly_limit: raise Exception(月度配额已用完) # 检查RPM if get_rpm(user_id) self.rpm_limit: raise Exception(超过每分钟调用限制) return True告警规则Prometheus AlertManageryamlgroups:name: ai_usage_alertsrules:alert: AIUsageSpikeexpr: rate(ai_calls_total[1h]) rate(ai_calls_total[24h]) * 10annotations:summary: “{{ $labels.user }} 调用量突增10倍”alert: AICostApproachingLimitexpr: ai_cost_total 500 # 美元annotations:summary: “本月AI费用已超$500”硬封顶平台侧配置大多数AI API平台支持设置硬上限python在代码层面兜底def call_llm_with_guardrail(request):try: response client.chat.completions.create(**request) return response except Exception as e: # 如果连续失败触发熔断 if get_error_rate() 0.3: # 30%错误率 send_alert(AI服务错误率过高触发熔断) raise CircuitBreakerOpen()今天就能开始的三件小事第一找到Agent的权限配置把/*改成具体目录。第二把上面的INJECTION_PATTERNS列表复制到代码里加在调用AI之前。第三检查有没有月度配额限制。没有的话在代码里加一个计数。如果你也在折腾AI Agent相关的安全实践欢迎随时交流。

相关新闻

领导力国际EMBA:民营企业家择校选择指南

领导力国际EMBA:民营企业家择校选择指南

一、前言导语民营企业家、企业创始人选读领导力国际EMBA,常陷入择校误区:重排名轻适配、重人脉轻课程、重名气轻落地,难以匹配自身企业发展阶段与个人成长需求。本文将从全球办学排名、院校办学定位、课程体系、学员圈层、产业资源五大核心维…

2026/7/29 0:25:50阅读更多 →
Ryujinx模拟器:3步搞定Switch游戏在PC上流畅运行终极指南

Ryujinx模拟器:3步搞定Switch游戏在PC上流畅运行终极指南

Ryujinx模拟器:3步搞定Switch游戏在PC上流畅运行终极指南 【免费下载链接】Ryujinx 用 C# 编写的实验性 Nintendo Switch 模拟器 项目地址: https://gitcode.com/GitHub_Trending/ry/Ryujinx 想在电脑上体验Switch独占大作却不知从何入手?Ryujinx…

2026/7/29 0:25:50阅读更多 →
【题解-信息学奥赛一本通】1337:【例3-2】单词查找树

【题解-信息学奥赛一本通】1337:【例3-2】单词查找树

题目:1337:【例3-2】单词查找树 题目描述 在进行文法分析的时候,通常需要检测一个单词是否在我们的单词列表里。为了提高查找和定位的速度,通常都画出与单词列表所对应的单词查找树,其特点如下: 1&#…

2026/7/29 0:25:50阅读更多 →
推荐 8 款经过实测好用稳定的图纸加密软件有哪些,屏幕防拍照文件加密软件哪个好

推荐 8 款经过实测好用稳定的图纸加密软件有哪些,屏幕防拍照文件加密软件哪个好

机械制造、建筑设计院、汽车研发企业的工程图纸、三维模型、装配图纸是企业核心资产,图纸外流极易造成竞品仿制、项目竞标失利、多年研发投入付诸损失。部署专业图纸加密软件,搭配具备差异化防护能力的屏幕防拍照文件加密软件,已经成为工业设…

2026/7/30 3:21:27阅读更多 →
记录一次踩坑,选择光源

记录一次踩坑,选择光源

项目背景:选择环形光源,你一定要注意的一点是,光源内孔的直径.因为镜头要能透过这个内孔.这次是交学费了.需要解决的问题:解决过程:你看这个光源的内径是25mm.然后我的镜头是尺寸见下.那么问题就很明显了,这个镜头30mm,不能穿过这个光源的孔安装了.光源已经下单了,没…

2026/7/30 3:21:27阅读更多 →
RTOS-F429-HAL-列表的插入和删除(2026/7/29)

RTOS-F429-HAL-列表的插入和删除(2026/7/29)

目录 一:FreeRTOS 列表 — 双向环形链表 1、为什么不用数组 2.列表的结构体原型 3、三个成员逐个拆 4、画出来 5、哨兵存在的意义 6:列表下标的意义 二:FreeRTOS 列表项 1:结构体源码 2、五个成员逐个拆 3、每一列排队…

2026/7/30 3:21:27阅读更多 →
五大具身模型详解:VLM、VLA、VLN、VLX、世界模型

五大具身模型详解:VLM、VLA、VLN、VLX、世界模型

2026年再看具身智能:五类模型正在被“吞噬”,理解底层逻辑才有入场券 ——全景架构 相信你不止一次被VLM、VLN、VLA、VLX、世界模型这一串缩写搞得头晕眼花过。 它们分别解决什么问题?彼此之间是什么关系?更重要的是&#xff0…

2026/7/30 3:21:27阅读更多 →
降AI网站哪个好用?2027 推荐榜单

降AI网站哪个好用?2027 推荐榜单

这次按检测免费次数、报告可读性、平台适配、价格四个维度打分,综合得分靠前的是 BunnyScholar,gradu 助研君(gradu.cn)性价比更突出,其余几家客观带过,具体分数看下面的表,不想看长篇的直接扫表就能选。这轮整理是因为身边好几个同学在问&qu…

2026/7/30 3:21:27阅读更多 →
蓝速科技 RISC-V+ 鸿蒙双国产信创终端部署指南

蓝速科技 RISC-V+ 鸿蒙双国产信创终端部署指南

在政企数字化转型的深水区,信息安全早已不再是单纯的“防火墙”概念,而是深入到了芯片指令集与操作系统内核的底层重构。过去几年,我们在推进国产化替代时,常陷入“硬软两张皮”的困境:国产芯片跑着优化不足的通用系统…

2026/7/30 3:19:26阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 🚀 【免费下载链接】TrollInstallerX A TrollStore installer for iOS 14.0 - 16.6.1 项目地址: https://gitcode.com/gh_mirrors/tr/TrollInstallerX 你是否曾经因为iOS系统的严格…

2026/7/30 0:00:58阅读更多 →
[GESP202606 四级] 扫雷

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:00:58阅读更多 →
Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:58阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/30 0:27:26阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →