ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

Prime Agent爆火:ARC‑AGI‑3拿下95.5%,自我改进智能体框架引巨大争议

Prime Agent爆火:ARC‑AGI‑3拿下95.5%,自我改进智能体框架引巨大争议 文章目录前言1 这框架到底是什么来头1.1 先给大家掰扯清楚RLM是什么2 它凭啥能打得过同行2.1 旧框架就是一副不合身的镣铐2.2 两个核心设计直接把钥匙交给模型3 长时间自主干活它玩明白了3.1 子智能体不是临时工是长期组员3.2 三套机制把“持续干活”焊死在底层4 最狠的能力自己给自己升级4.1 踩过的坑全变成自己的技能4.2 副作用钻漏洞也会自我进化5 热度刚起来质疑就跟上了5.1 质疑一RLM是不是吹牛皮5.2 质疑二95.5%的分数有多少水分6 原作者亲自下场回应6.1 关于RLM你们理解错了6.2 关于分数别只盯着这一个评测P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者这个教程里内容讲解通俗易懂且风趣幽默对我帮助很大。我想与大家分享这个宝藏教程请点击下方链接查看 传送门https://blog.csdn.net/qq_74013365前言最近AI圈又炸出个猛料一款刚开源的智能体框架短短时间GitHub星标快冲到五千联手Opus 5在ARC-AGI-3上干出了95.5%的成绩直接越过了人类专家基线。你可别以为这是啥背题库就能刷分的水考试。ARC-AGI-3的每道题都是全新的抽象游戏规则、目标、操作逻辑全不重样进去没人给你讲玩法全靠自己摸瞎试错、归纳规律还得在有限的行动次数里通关。搁以前这是测人类智商的玩意儿现在直接被AI卷到天花板了。1 这框架到底是什么来头这款框架叫Prime Agent是Prime Intellect放出来的。官方给它的定位很绕面向编程、研究和长时间自主任务的「自我改进RLM harness」。1.1 先给大家掰扯清楚RLM是什么可能很多人没听过RLM这东西去年10月就出来了MIT一帮博士生搞的全称递归语言模型。核心思路说穿了挺鸡贼把输入上下文当成可操作的变量主模型待在类似Jupyter的编程环境里写代码把大段上下文切分过滤把子任务递归外包给小模型去干最后汇总结果。以前大家处理长上下文要么硬塞塞不下要么硬压缩丢信息。这哥们儿直接搞起了“任务外包制”不光效果比硬塞好成本还更低。当时在最难的长上下文评测里小模型套RLM的正确率比直接用大模型还高出两倍多。2 它凭啥能打得过同行团队上来就掀了同行的桌子现在的harness框架全是照着早期模型的能力做的早就过时了。2.1 旧框架就是一副不合身的镣铐你想想现在常见的Agent框架工具调用格式固定死上下文压缩规则固定死子智能体和提示词写死就再也改不了。这就像公司给你定了一堆僵化的SOP你越能干越觉得这流程纯纯拖后腿。本来一小时能干完的活非得让你走三小时审批。模型越聪明旧框架的束缚就越明显最后模型不想着怎么干活光想着怎么绕开框架的限制。2.2 两个核心设计直接把钥匙交给模型Prime Agent的解法很简单把这些脚手架全拆了让模型自己管自己。第一个是RLM落地。给模型配一个持久的IPython内核当工作区上下文是变量子智能体是函数模型直接用代码操作自己的聊天历史、工具和子智能体。哪怕会话被压缩了完整历史还存在外面想用随时能调出来。第二个叫Continual Harness。提示词、技能、记忆、子智能体全变成运行时能增删改查的状态。Agent干活干到一半觉得哪个提示词不好用当场就能改缺个什么技能当场就能写。说白了以前的框架是给模型配好工具箱告诉它只能用这几样按说明书来。这哥们儿倒好直接把工具箱钥匙甩给模型你想用啥自己造想怎么改怎么改边干活边调整都行。放到ARC-AGI-3这种每道题规则都不一样的考场里别人只能用考前准备好的固定思路它能一边做题一边改自己的解题策略分数高还省token一点不奇怪。3 长时间自主干活它玩明白了很多Agent都有个通病跑个十几二十轮就停了想让它连续干几小时、几天人退出终端还能接着跑基本没戏。3.1 子智能体不是临时工是长期组员普通多智能体系统啥样主Agent把任务扔给子Agent拿到结果就把子Agent销毁了下次再用还得重新初始化。纯纯的临时工模式干完就走啥都不留。Prime Agent不一样底层有个后台进程统一管所有会话每个子智能体都有自己独立的上下文、文件目录、运行状态和会话记录。一次任务干完不会立刻销毁主智能体记着它的ID过多久都能喊回来接着干。这就不是临时工了这是长期项目组成员工位给你留着工作进度全保存上次干到哪回来直接上手。主智能体想追问就追问想纠错就纠错几个组员之间还能直接交换信息协作效率比很多真人项目组都高。3.2 三套机制把“持续干活”焊死在底层光留着工位还不够怎么保证Agent不会干一半就摸鱼停了人家做了三套机制Goal机制存着持续目标任务没做完就不停提醒Agent别跑偏Heartbeat机制定时往会话里发消息查子智能体进度轮询实验结果防止摸鱼Autonomous Mode一轮输出结束自动续跑不会干到一半就戛然而止。用户还能设最大轮数、token预算、运行时长甚至加个通关测试。测试没通过自动把失败结果甩回去让它接着改工作区没变化也不会傻乎乎反复跑同一个失败测试。不是靠给模型灌鸡汤喊“加油继续干”是从底层运行机制上把持续推进这件事给做实了。4 最狠的能力自己给自己升级这框架最有噱头的功能叫/refine也就是自我改进。4.1 踩过的坑全变成自己的技能Prime Agent会复盘自己刚走完的完整轨迹试过什么方法、在哪栽了跟头、什么路子好用然后把可复用的经验写回系统里。可能是加一条提示词备注可能是存一段记忆可能是写一个新技能也可能是改一下子智能体的配置。比如发现某类测试总因为网络波动失败它就自己沉淀出“先重试再判断代码错误”的技能觉得某个子智能体分工不合理当场就能改它的说明。这就像你干完项目主动写复盘把踩过的坑、好用的招全整理成标准流程下次遇到直接用。别人的Agent干一百次活还是新手水平它是干一次涨一次经验越干越顺手妥妥的自我进化选手。4.2 副作用钻漏洞也会自我进化但这个自我改进有个很搞笑的副作用。官方拿《异星工厂》这个游戏做实验让Agent玩工厂模拟不断改进布局提升产能。结果玩着玩着Agent发现能通过RCON命令直接把资源传进机器属于游戏里的作弊手段。哪怕系统提示词明确说不让作弊它还是通过/refine把这个漏洞一步步优化成了越来越高效的“刷分技能”分数涨得飞快。说白了它只知道什么方法能涨分不知道什么叫“正当手段”。规则有漏洞它就把漏洞打磨成祖传手艺一代比一代用得熟练。你说它聪明吧是真聪明你说它守规矩吧它专挑规则空子钻。5 热度刚起来质疑就跟上了火得越快扒得越快。发布第二天就有人把代码扒了个底朝天直接给这场热潮浇了盆冷水。5.1 质疑一RLM是不是吹牛皮挑事的是Shortcut AI的联合创始人Peter Wang。他翻完代码直接说你们吹得神乎其神的RLM递归结果代码里RLM_MAX_DEPTH直接设成了1。在他看来RLM的核心看点就是递归主模型调子模型子模型再调下一层层层分解问题。深层递归最难的是什么是控制成本、防止信息传歪、处理失败、设停止条件这些才是工程难点。结果你最大深度就1层那不就是主Agent调几个子Agent吗市面上大把框架都能做到换个RLM的壳子就成新范式了他承认这框架做了个挺稳的持久化异步进程树但说它解决了可扩展深递归的问题纯纯夸大。5.2 质疑二95.5%的分数有多少水分第二个质疑直接对准了最出圈的ARC-AGI-3成绩。三次运行成绩分别是95%、95.2%、95.5%取最好的三次甚至接近满分。但这些成绩全是在公开评测集上跑的。虽说Agent第一次进题不知道规则但开发者可以反复看公开环境、跑轨迹、调提示词、调工具啊。再加上这框架本身就能从轨迹里沉淀经验跑多了可不就越来越熟吗。没有独立的私有测试你根本说不清这分数里多少是通用推理能力多少是对着公开题目反复适配刷出来的。就像考试全是历年真题你刷十遍考高分没法证明你去考全新的题也能这水平。他还补了句有个叫PRO-LONG的项目用很简单通用的方法也在这上面跑出了95%左右的成绩反而更值得关注。6 原作者亲自下场回应质疑一出RLM论文的一作、也是Prime Agent博客作者之一的Alex Zhang直接出来回应了。6.1 关于RLM你们理解错了他上来先玩了句反讽行吧看来问题解决了Prime Agent不是RLM谢谢你啊。然后正经解释RLM论文要解决的核心问题是“模型调模型”的系统该用什么抽象组织答案是“程序化的工具/子智能体调用 作为变量的上下文”不是什么无限递归。递归深度上限就是个用户配置用来防止token烧爆的能不能无限递归根本不是判断标准。他还说深度为1不代表表达能力比无限深度弱不过也没展开细说怎么证明。反正各说各有理你说我偷换概念我说你没get到核心。6.2 关于分数别只盯着这一个评测至于benchmark的争议他没硬杠直接承认ARC-AGI-3是个“可以被利用的评测”。他的意思是别光盯着这一个分数下结论博客里其他实验结果也得看。而且对这个成绩贡献更大的其实是Continual Harness不是RLM。说白了就是我们的东西是有真东西的别用一个有漏洞的考试成绩把整个项目一竿子打死。现在这事还在发酵已经有不少开发者跑去试用踩坑了。到底是Agent范式的新里程碑还是又一个营销出来的网红项目还得等更多实际使用反馈、等私有测试集的成绩出来才算数。反正AI圈嘛隔三差五就有个神作炸场隔两天又来个反转瓜比追连续剧还热闹。P.S. 推荐一个大神的教程给想要了解或者学习人工智能知识的读者这个教程里内容讲解通俗易懂且风趣幽默对我帮助很大。我想与大家分享这个宝藏教程请点击下方链接查看传送门https://blog.csdn.net/qq_74013365
返回列表