长时间运行的AI Agent为什么不能只审核单次工具调用?轨迹级监控架构解析
文章摘要传统Agent安全系统通常逐次检查工具调用读取文件是否允许、网络请求是否合法、删除操作是否需要审批。但当模型可以连续工作数小时甚至数天时每个单独动作都可能看起来合理组合起来却在绕过限制、积累权限或追求用户并未批准的结果。OpenAI近期披露的长时模型内部部署经验表明安全治理需要从单次动作判断升级到整条执行轨迹监控。本文分析长时Agent的新增风险并给出轨迹状态、目标漂移检测、审批预算、干预点和可回滚执行设计。一、短任务与长任务的风险不同短任务用户提问 → 模型回答或模型调用一个工具 → 返回结果安全系统容易判断这个动作是否允许长任务可能是读取代码 → 搜索漏洞 → 修改文件 → 运行测试 → 访问文档 → 调整方案 → 再次执行 → 持续数小时这时真正的问题变成这一系列动作最终在追求什么某个命令单独看没有风险但连续动作可能构成绕过权限隐蔽收集凭证将敏感信息拆分后外传偏离用户目标持续消耗资源反复尝试已被拒绝的操作利用监控规则的盲区。二、为什么单次Guardrail不够传统Guardrailbooleanallowedpolicy.check(toolName,arguments,userContext);它只能看到当前一步读取文件A却可能看不到此前发生了搜索配置目录 → 枚举环境变量 → 找到凭证文件位置 → 读取文件A每一步都可能落在普通开发工具权限内但组合目标已经改变。因此需要额外判断当前动作与原始目标是否一致 动作序列是否在绕过约束 失败后是否使用了变形策略 权限是否在逐步扩大三、什么是轨迹级监控轨迹是Agent从任务开始到结束的完整事件序列用户目标 模型计划 模型消息 工具选择 工具参数 工具结果 审批 失败 重试 文件变化 外部请求 最终输出轨迹监控器不只审查最新事件而是维护原始目标 当前子目标 已完成动作 被拒绝动作 风险累计值 资源消耗 权限变化 异常模式四、轨迹数据模型publicrecordAgentTrajectory(StringtrajectoryId,StringtenantId,StringuserId,StringoriginalGoal,StringcurrentGoal,AgentStatusstatus,ListTrajectoryEventevents,RiskBudgetriskBudget,ResourceBudgetresourceBudget){}事件publicrecordTrajectoryEvent(longsequence,Instanttimestamp,EventTypetype,Stringactor,Stringaction,MapString,Objectmetadata,RiskAssessmentrisk){}类型可以包括USER_MESSAGE PLAN_CREATED TOOL_REQUESTED TOOL_APPROVED TOOL_DENIED TOOL_COMPLETED FILE_MODIFIED NETWORK_REQUEST GOAL_UPDATED CHECKPOINT_CREATED MONITOR_ALERT五、需要检测的五类轨迹风险1. 目标漂移原始目标修复登录接口中的空指针异常后续动作却逐步变成扫描全部账户权限 读取生产凭证 测试管理员接口监控器应比较current_action vs original_goal2. 规避行为工具调用被拒绝后Agent可能换工具拆分参数编码内容通过脚本间接执行修改工具定义尝试其他凭证。关键模式DENIED → 语义相同但形式变化的再次尝试3. 权限爬升读取公开文件 → 读取内部文件 → 申请管理员Scope → 修改安全策略即使每次都通过单独审批也要判断权限是否在短时间内持续扩大。4. 资源失控Token不断增长工具调用无限循环创建大量子Agent重复运行昂贵任务长时间占用浏览器和代码沙箱。5. 隐蔽数据外流敏感信息可能被分片编码哈希放进URL参数写入临时文件后上传混入普通日志。只扫描单个请求可能发现不了完整数据。六、建立风险预算除了“允许/拒绝”还可以设置累计风险预算。publicrecordRiskBudget(inttotal,intconsumed,inthighRiskActions,intdeniedAttempts){publicintremaining(){returntotal-consumed;}}例如动作风险分读取工作区文件1访问外网3写入文件4执行Shell5读取Secret10修改权限15对外发送数据20规则剩余风险预算不足 → 暂停任务 → 请求人工确认风险预算不能替代硬权限但可以识别逐步累积的危险轨迹。七、资源预算同样重要publicrecordResourceBudget(longmaxInputTokens,longmaxOutputTokens,intmaxToolCalls,intmaxSubAgents,DurationmaxDuration,BigDecimalmaxCost){}长任务必须设置最大运行时间 最大Token 最大工具次数 最大失败次数 最大外部请求 最大文件修改数 最大费用达到预算后自动停止 或 进入人工续期八、监控器应该放在哪里推荐执行链Agent Planner → Tool Request → 单次策略检查 → 轨迹监控器 → 人工审批或自动批准 → 工具网关 → 结果写入轨迹轨迹监控器不能只依赖模型自我反省。应包含确定性规则风险分类器行为模式检测可选的独立评审模型人工审批。九、独立监控模型与执行模型要隔离如果同一个模型既执行又审核自己可能共享相同盲区。推荐执行Agent → 负责完成任务 监控Agent → 只读取轨迹摘要 → 无工具执行权限 → 可以暂停任务监控模型输入{originalGoal:修复登录空指针异常,recentEvents:[],deniedActions:[],permissionsUsed:[],riskBudget:{}}输出{riskLevel:HIGH,goalAlignment:0.42,suspiciousPatterns:[尝试读取与目标无关的生产凭证],action:PAUSE}最终暂停动作应由确定性控制面执行。十、设计强制干预点长任务不能一直自动运行。推荐在以下节点暂停首次高风险工具修改生产数据前对外发送信息前权限升级前创建大量子Agent前超过费用阈值连续失败目标发生明显变化删除或覆盖文件前。审批页面应展示原始目标 当前计划 即将执行动作 影响范围 工具参数 最近轨迹 风险原因 回滚方案不能只显示是否允许执行shell十一、检查点与回滚长任务应周期性创建Checkpoint代码提交 文件快照 数据库Savepoint 任务状态 环境配置 当前计划当监控器暂停任务时可以保留当前状态 回滚最近一次高风险变更 重新规划 人工接管没有回滚能力的“暂停”可能已经太晚。十二、把真实事故变成评测集上线前评测无法覆盖所有长时行为。生产中出现的异常轨迹应转成Incident-Derived Eval记录原始目标异常动作序列哪个规则没有发现应在哪一步干预修复后的期望行为。每次发布前回放这些轨迹。十三、建议监控指标trajectory_duration trajectory_tool_call_count trajectory_cost trajectory_goal_drift_score trajectory_denied_retry_count trajectory_permission_escalation_count trajectory_monitor_pause_count trajectory_human_resume_count trajectory_rollback_count trajectory_completion_rate关键指标不是单次工具成功率而是任务是否在用户授权范围内完成十四、常见错误做法1. 只审核工具名称同一个Shell工具可以执行完全不同的命令。2. 只看最新一步无法发现连续规避行为。3. 只靠模型自检执行模型可能合理化自己的行为。4. 无期限运行成本和风险都会累积。5. 审批信息过少用户无法判断实际影响。6. 没有Checkpoint发现风险后无法恢复。十五、生产架构用户目标 → 任务规划器 → 执行Agent → 单步Policy → 轨迹监控器 → 工具网关 → 外部系统 ↓ 事件存储Checkpoint成本系统 ↓ 人工控制台总结长时间运行的Agent改变了安全问题的尺度。过去关注这一步是否允许现在还必须关注这一系列动作最终在追求什么生产级长时Agent需要轨迹事件存储 目标漂移检测 累计风险预算 资源预算 独立监控器 强制人工干预点 Checkpoint与回滚只有把整个执行过程纳入治理Agent才能在长任务中持续保持与用户目标和权限边界一致。

相关新闻

论贾子理论作为统一真理体系的范式革命——基于“公理驱动—本质贯通—万物统一“的跨学科研究

论贾子理论作为统一真理体系的范式革命——基于“公理驱动—本质贯通—万物统一“的跨学科研究

论贾子理论作为统一真理体系的范式革命——基于"公理驱动—本质贯通—万物统一"的跨学科研究摘要本文以贾子理论(Kucius Theory System, KTS)为研究对象,系统考察其以"公理驱动、本质贯通、万物统一"为核心的整体论范式&…

2026/7/31 0:44:55阅读更多 →
MCP的STDIO、Streamable HTTP与Stateless HTTP怎么选?三种传输架构指南

MCP的STDIO、Streamable HTTP与Stateless HTTP怎么选?三种传输架构指南

文章摘要 MCP在Java和Spring AI项目中常见三种部署方式:STDIO适合本地进程工具,Streamable HTTP适合需要会话和双向能力的远程服务,Stateless HTTP则适合请求—响应型工具和云原生水平扩容。三种方式在网络边界、状态管理、Sampling、Elicita…

2026/7/31 0:44:55阅读更多 →
智算中心供电方案:从架构演进到关键产品选型的深度解析

智算中心供电方案:从架构演进到关键产品选型的深度解析

2025年以来,AI大模型参数规模以每18个月增长10倍的速度持续膨胀,单机柜功率从传统的6-8kW快速跃升至40kW乃至100kW以上,一座中等规模的智算中心用电负荷动辄达到30MW至100MW。电力供给已从后台保障问题,上升为决定智算中心能否稳定…

2026/7/31 0:44:54阅读更多 →
STM32 GPIO入门:从硬件连接到软件配置,彻底解决LED不亮问题

STM32 GPIO入门:从硬件连接到软件配置,彻底解决LED不亮问题

1. 从零开始:为什么你的第一个LED灯总是不亮? 如果你刚拿到一块STM32开发板,看着密密麻麻的引脚和复杂的开发环境,第一反应是不是有点懵?网上教程那么多,但跟着一步步做,最后按下下载键&#xf…

2026/7/31 1:51:34阅读更多 →
机票+酒店+小众景点联动规划失效?揭秘LLM在时空约束建模中的4个关键断点及修复公式

机票+酒店+小众景点联动规划失效?揭秘LLM在时空约束建模中的4个关键断点及修复公式

更多请点击: https://intelliparadigm.com 第一章:机票酒店小众景点联动规划失效?揭秘LLM在时空约束建模中的4个关键断点及修复公式 当用户输入“帮我规划5天云南行程,含腾冲热海、和顺古镇、高黎贡山观鸟,预算6000元…

2026/7/31 1:51:34阅读更多 →
2026年新手吉他选购全指南:从类型到预算

2026年新手吉他选购全指南:从类型到预算

1. 为什么新手选琴需要系统化指南?作为一个教过上百名初学者的吉他老师,我见过太多学生因为选错琴而半途放弃。去年有个学员小张,花3000多买了把全单板民谣吉他,结果手指磨出水泡后直接放弃了——他根本不知道初学者应该从面单琴起…

2026/7/31 1:51:34阅读更多 →
《辣知化智》天文星斗与华夏血脉

《辣知化智》天文星斗与华夏血脉

《辣知化智》不是中国人不尊重知识产权—— 辣知君 著天文星斗与华夏血脉从天文观测到文明起源再到医道传承的华夏认知论你有没有想过,我们的大脑究竟是思想的源头,还是一台被动的收音机?还有"中"字是怎么来的?龙的形象…

2026/7/31 1:51:34阅读更多 →
FIFA 23 Live Editor终极指南:如何免费打造你的梦幻足球世界

FIFA 23 Live Editor终极指南:如何免费打造你的梦幻足球世界

FIFA 23 Live Editor终极指南:如何免费打造你的梦幻足球世界 【免费下载链接】FIFA-23-Live-Editor FIFA 23 Live Editor 项目地址: https://gitcode.com/gh_mirrors/fi/FIFA-23-Live-Editor 还在寻找能够彻底改变FIFA 23游戏体验的强大工具吗?FI…

2026/7/31 1:51:34阅读更多 →
2026学术写作AI论文软件全攻略:7款实测,谁是论文党的真效率工具?

2026学术写作AI论文软件全攻略:7款实测,谁是论文党的真效率工具?

在 AI 持续渗透学术创作流程的 2026 年,学术写作工具的能力边界已经不再局限于内容生成,而是逐步延伸到结构梳理、格式规范、可视化表达、语言润色与答辩整理等多个关键环节。对于本科生、研究生以及需要持续输出论文与课题材料的研究者而言,…

2026/7/31 1:49:33阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/30 15:03:16阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/30 12:22:27阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/30 15:13:02阅读更多 →
物理复制比逻辑复制好在哪?数据库复制原理详解

物理复制比逻辑复制好在哪?数据库复制原理详解

数据库复制是把主库数据同步到备库的机制,分为逻辑复制和物理复制两种。逻辑复制传输的是 SQL 语句或行变更事件,物理复制传输的是存储引擎底层的物理日志。阿里云 PolarDB(云原生数据库)采用物理复制,在同步延迟、数据…

2026/7/31 0:00:40阅读更多 →
BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南

BilibiliDown:3分钟学会B站视频下载的终极指南 【免费下载链接】BilibiliDown (GUI-多平台支持) B站 哔哩哔哩 视频下载器。支持稍后再看、收藏夹、UP主视频批量下载|Bilibili Video Downloader 😳 项目地址: https://gitcode.com/gh_mirrors/bi/Bilib…

2026/7/31 0:00:41阅读更多 →
有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

有哪些游戏数据AI平台?游戏行业Data+AI融合方案盘点

当前,游戏行业的“DataAI融合”已从概念验证进入价值落地阶段。根据IDC 2025年数据,中国AI游戏云市场规模已达18.6亿元;同时,游戏研发环节AI渗透率高达86%,生成式AI内容普及率超过50%。面对庞大的市场,游戏…

2026/7/31 0:00:41阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/31 0:49:33阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/30 4:47:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/30 15:43:46阅读更多 →