智能体蜂群实验:新框架性能提升,不同模型组合成本差异巨大!
Cursor产品导航Cursor提供多种功能与服务包括产品智能体、云端、移动端、自动化、CLI、应用市场、代码审查、企业、定价、资源更新日志、Blog、文档、社区、帮助、工作坊、论坛、招聘等板块还有登录、联系销售和下载等入口。智能体蜂群实验背景与目标今年早些时候开展一系列实验测试扩展智能体协作实现目标的极限假设这能解锁任务规模和复杂度新层级。旗舰项目从零开始构建Web浏览器取得概念验证成功但距成熟软件还有差距。后续目标是理解智能体蜂群以便进行工程化设计为此重新挑战依据SQLite文档用Rust从零构建的任务。实验初步结果让新旧蜂群在相同任务、模型和时间预算下运行衡量通过预留SQL测试套件比例。新蜂群在每种模型配置下表现更优如使用Grok 4.5时四小时内达80%通过率旧蜂群两小时前失控暂停。还调整不同模型工作分配不同组合产出质量相近但成本差异大。树与叶子大型任务描述呈树状结构智能体群围绕此结构组织有规划器智能体和worker智能体两种角色。规划器由最强模型驱动负责拆分目标worker由速度快、成本低的模型驱动负责执行。这种设计优于僵化编排系统能泛化到多样任务还用于内部发现修复漏洞、提升测试覆盖率和生成训练数据等。树如何影响记忆单个智能体承担完整任务时易偏离目标要么失去全局把握要么局部工作变差。而智能体蜂群中规划器和worker分工明确上下文使用更高效其可扩展性或源于上下文效率而非并行性这种结构类似企业层级组织原理。智能体的版本控制系统Git和Cargo等工具的并发控制方式不适用于数百个并发智能体的工作量。今年早些时候浏览器智能体群提交峰值约每小时1000次新系统达每秒约1000次。为此从零构建新的版本控制系统它还能暴露冲突并实现协调机制。每秒1,000次提交下的失效模式人类工程团队的协作机制在智能体群提交速率下会出现失效模式脑裂设计通过提示让规划器自己做决策并避免子树重复决策解决规划器之间的冲突让智能体记录决策在共享文档通过引用传递解决结果合并冲突由中立第三方智能体介入解决超大文件让worker智能体标记外部智能体拆分僵化允许引入破坏性变更并传导更新相关工作。审查视角多智能体系统需审查机制自我纠正错误。试验多种审查视角单一视角无法发现所有问题低相关视角叠加可提高可靠性投入审查的算力回报高。让智能体塑造环境借鉴迹象引导机制让智能体沉淀知识。开展Field Guide实验由智能体自主管理文件夹并注入信息其收益在非完全智能体掌控的代码库中可能更大训练模型为后继者写作值得研究。SQLite实验让新版本智能体群用Rust实现SQLite手册内容不提供源代码等信息以sqllogictest为评分标准。人工审查确保系统均衡构建智能体会自行选择策略整体趋势比具体时刻分数更重要。不同模型组合下的结果测试四种模型配置新框架在每种组合中都优于旧版。Fable 5混合方案首小时通过约三分之二测试集四小时新版运行结果在73% - 85%之间旧版在11% - 77%之间旧版Grok 4.5运行两小时左右暂停所有新版配置最终通过整个测试集。未来希望运行完整N×N矩阵此次重点是不同框架版本对比。深入剖析这些运行对比Grok 4.5在旧框架和新框架下的提交速率、合并冲突数、热点文件大小和Rust crate数量等指标发现旧框架存在无效忙碌、冲突多、文件膨胀和脑裂等问题最终新蜂群代码行数更少且得分更高。模型经济性不同模型组合产出质量相当但成本差异大worker承担大部分token但规划器token成本更高。大型任务中前沿规划器收敛不确定性后低成本模型执行可节省成本。如GPT - 5.5仅worker成本就达9373而Opus 4.8规划、Composer 2.5执行的worker集群成本仅411。Fable 5规划器虽单token价格高但使用token少但其worker消耗token多总成本更高。把规格说明当作提示AI发展提升工程师工作抽象层级智能体蜂群使工作基本单位变为规格说明。要让其可行蜂群需遵循规格说明稀缺的是对意图的准确描述。智能体蜂群类似编译器但每一步是概率性的本文旨在缩小差距。此次solo Opus 4.8 run生成的代码库已公开邀请读者查看并反馈。相关文章包括2026年6月11日用Auto - review管控智能体自主性、2026年6月2日构建云端智能体的经验、2026年5月6日用autoinstall自举Composer等文章信息。产品与资源等信息产品包括智能体、团队版、企业、定价、代码审查等资源有下载、更新日志、文档等公司有招聘、Blog、社区等法律涉及服务条款、隐私政策等还有连接X、LinkedIn、YouTube等渠道。

相关新闻

“阅后即焚”的PrivateBin与乌龙事件

“阅后即焚”的PrivateBin与乌龙事件

网管小贾 / sysadm.cc最近新上任的薛总,虽是一介女流,却是雷厉风行,言谈举止一丝不苟,颇有高端职场女性的风范。 听有人说,她可是董事长亲自指派来这当总经理的,嗯,怎么说我也应该巴结好啊&…

2026/7/22 23:22:23阅读更多 →
知网/万方/PubMed三库查重结果竟相差41.2%?揭秘AI搜索底层语义锚点偏移机制(含TensorFlow调试日志)

知网/万方/PubMed三库查重结果竟相差41.2%?揭秘AI搜索底层语义锚点偏移机制(含TensorFlow调试日志)

更多请点击: https://codechina.net 第一章:知网/万方/PubMed三库查重结果差异的实证现象与问题提出 在科研写作与学术出版实践中,同一文献在知网、万方与PubMed三大数据库中呈现显著不同的重复率数值,已成为普遍且亟待解析的技术…

2026/7/22 23:22:23阅读更多 →
如何5分钟掌握biliTickerBuy:B站会员购智能抢票终极指南

如何5分钟掌握biliTickerBuy:B站会员购智能抢票终极指南

如何5分钟掌握biliTickerBuy:B站会员购智能抢票终极指南 【免费下载链接】biliTickerBuy b站会员购购票辅助工具 项目地址: https://gitcode.com/GitHub_Trending/bi/biliTickerBuy 你是否曾经在B站会员购抢票时,面对心仪的商品却总是慢人一步&am…

2026/7/22 23:22:23阅读更多 →
深入解析MCU I/O引脚复用与Flash SECDED ECC机制:原理、配置与安全实践

深入解析MCU I/O引脚复用与Flash SECDED ECC机制:原理、配置与安全实践

1. 项目概述与核心价值在嵌入式微控制器(MCU)的世界里,尤其是面对汽车电子、工业控制这类对可靠性和资源利用率要求极高的领域,有两项底层技术是每一位资深工程师都必须吃透的:I/O引脚复用(Pin Multiplexin…

2026/7/23 0:26:35阅读更多 →
【Bug已解决】Support NexusQuant KV cache compression for memory reduction 解决方案

【Bug已解决】Support NexusQuant KV cache compression for memory reduction 解决方案

【Bug已解决】Support NexusQuant KV cache compression for memory reduction 解决方案 一、现象长什么样 在 DeepSpeed 做长上下文推理/训练时,KV cache(注意力键值缓存)是显存大户:序列越长、batch 越大,KV cache 占…

2026/7/23 0:24:35阅读更多 →
【Bug已解决】[REQUEST] Add Trackio as a New Backend for Experiment Monitoring 解决方案

【Bug已解决】[REQUEST] Add Trackio as a New Backend for Experiment Monitoring 解决方案

【Bug已解决】[REQUEST] Add Trackio as a New Backend for Experiment Monitoring 解决方案 一、现象长什么样 这是一个功能请求(feature request):用户希望 DeepSpeed 的实验监控(experiment monitoring)支持一个新的…

2026/7/23 0:24:35阅读更多 →
栈的应用(表达式求值)

栈的应用(表达式求值)

文章目录三种表达式的形式中缀表达式 转 后缀表达式手算方法机算中缀表达式 转 前缀表达式手算方法机算总结算数表达式由三部分组成:操作数、运算符、界限符(界限符是必不可少的,反映了计算的先后顺序)三种表达式的形式 首先要分…

2026/7/23 0:24:35阅读更多 →
开源大模型生态盘点:从Llama到Qwen的选型指南

开源大模型生态盘点:从Llama到Qwen的选型指南

打开 Hugging Face 的模型榜单,前排几乎每周都在换。Llama、Qwen、DeepSeek、Mistral、GLM……对想在自己的项目里跑一个开源模型的开发者来说,问题早已不是"有没有得选",而是"选错了要多花多少冤枉钱"。这篇文章按实际落…

2026/7/23 0:24:35阅读更多 →
AI媒体生产:从机器写作到智能编审流程

AI媒体生产:从机器写作到智能编审流程

媒体行业用机器写稿比大多数人想象得早。财经快讯里"某公司今日发布财报,营收同比增长 X%"这类句子,十年前就是模板生成的。变化发生在最近两三年:大模型让机器从"填数字"进化到"写整篇",同时把编审…

2026/7/23 0:24:35阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/22 0:53:59阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/22 0:53:59阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/22 0:53:59阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →