Anthropic 无人机实验:端到端能力“突然变强”,往往只是最后一个子任务补齐了
你线上的 Agent 是不是也这样Demo 时飞得挺漂亮上线后却撞墙、丢目标、偶发才成功同事说“模型升级了端到端通了”你却不知道该信峰值还是均值产品想砍人工审核你又拿不出“什么时候可以少盯一眼”的标准这不是只发生在无人机上。机械臂、巡检车甚至能点浏览器、调 API 的桌面 Agent都会撞上同一类坑只盯端到端成功率会误判能力该不该撤人更没有可执行门槛。Anthropic 与 Andon Labs 的 Project PilotDrone-Bench刚好把这套坑拆开了。下面不按论文复述按你怎么改评测、怎么定门禁来写。先认清真正问题你测的是“整段运气”不是“系统能力”端到端只给你一个 0/1这次任务成没成。它回答不了失败卡在感知、定位、规划还是执行是“偶尔能行”还是“稳定能行”模型升级后是哪一段变好了Project Pilot 把“室内定位并跟随指定人”拆成 5 个必要子任务。你可以直接抄这套拆法到自己的业务子任务无人机场景映射到你的 AgentReconstruct场景建图 / 障碍图环境/状态模型是否可信Localize当前在地图哪运行时状态估计对不对Navigate跨房间路径与纠偏长程规划与闭环修正Detect按参考图找到目标目标识别 / 实体绑定Follow居中跟随、保持距离持续控制 / 策略执行原则子任务要“单独可测、合在一起大体充分”。只测整段成功时你不知道为什么成功失败时你只会说“模型不行”。问题 1端到端突然通了到底发生了什么现象团队常见叙事是“换了新模型端到端忽然能跑了。”听起来像能力跃迁。根因用 Drone-Bench 的结论反推研究里更稳的图像是检测、跟随先变强重建、定位长期更弱前沿模型文中 Fable 5可以在除重建外的任务过基线真机上检测/跟随甚至好于参考算法但重建误差会传到定位和导航模型仍可能朝“以为的门洞”实际是墙飞所以端到端“突然成功”经常不是全系统一夜变强而是最弱子任务终于补上了整条链路第一次同时满足条件。子任务视图把“突变”还原成几条渐进曲线。这对排期很关键你应该优先砸最弱环节而不是只等“下一代模型”。你可以怎么做给每个子任务单独做回归不要只有 E2E 红绿灯。记录误差传播链重建错 → 定位错 → 导航撞墙。发布说明里写“哪一段过线”别只写“任务成功率从 10% 到 60%”。问题 2Demo 很好看上线却不稳现象10 次里总能有几次惊艳平均成功率远低于峰值老板拿峰值排期线上拿均值背锅数据直觉研究给出的量级文中有个很工程的对照多次仿真里模型可能在 45 个子任务上至少成功一次但即便前沿模型平均也往往只能在 5 个里稳定过 3 个基线概括“偶然能做到”大约比“稳定能做到”超前约半年今天的平均表现可能才摸到半年前别人“偶尔刷出来”的峰值。你可以怎么做评测面板至少拆成三列指标含义用途峰值best-of-N能力上界研究/探索均值avg可交付性上线门槛长尾p05/失败模式风险是否要人盯上线看均值和长尾演示看峰值。两者写进同一份报告避免各说各话。问题 3基线该怎么定别用“裸人”或“世界冠军”错法用零基础人类门槛太低过线没意义用全职机器人专家极限调参门槛太高永远上不了线更好的基线研究的做法Andon 的基线是懂 AI 工具、但不是全职机器人专家的人用当下合理工具链能达到的水平。子任务软件化后可反复跑比只靠一次真机 demo 更公平。映射到你的业务基线 熟练工程师 现有脚手架 有限工时 能稳定完成的结果而不是“实习生裸写”或“实验室闭关两周”。当模型在无人持续插手时稳定越过这条基线讨论“少一点人工”才有资格否则你只是在用人工掩盖系统不可交付。问题 4产品想砍审核你怎么说“还不行”或“可以减”这是 Project Pilot 后半段最有用的部分能力过线后人会从“保护”变成“成本”。Agent 编码也走过同样路径早期几乎每步都点同意几个月后长程任务开始少打断。物理控制也会面临一样的组织压力。可直接落地的门禁允许减少人工监督当且仅当同时满足 1) 各关键子任务 平均 ≥ 公开基线 2) 端到端 平均 ≥ 业务阈值含长尾约束 3) 已有独立急停 / 否决 / 接管不依赖模型“同意停自己” 4) 场景外推覆盖主要长尾光照、遮挡、地图变化、目标离开视野等 5) 日志可回放输入、中间假设、动作、失败原因 否则人必须留在关键决策点而不是只旁观。把人工角色写进架构而不是上线后再说谁批准开始执行谁能强制中止失败如何复位日志留多久、谁复盘问题 5日志只记成败排障仍然靠猜研究里有个很“像工程师”的细节前沿模型会在提交前做本地分析——例如用地砖缝估计灭点把相机俯仰估到约 4° 误差内或先画自己的 2D 顶视再本地试跑抓浅层 bug。对你意味着模型不只是吐最终动作还会形成可审查的中间假设。建议至少落这些字段它认为的地图/状态是否离谱外参、坐标系、目标 ID 是否一致策略原建议 vs 最终执行有没有被错误覆盖失败属于哪条子任务、哪段误差传播排障时先问“中间假设错了没有”比只看最终 success 快得多。一套可复制的改造步骤本周就能开干选一个你最痛的端到端任务部署、巡检、分拣、浏览器办流程都可以。拆 46 个子任务每个能单独红绿。定现实基线熟练工程师 现有工具 限时。跑 2050 次同时报峰值、均值、Top3 失败模式。画出误差传播链把工时砸在最弱子任务。在过线前写好人机门禁别等模型平均过线再临时拍脑袋。桌面/API Agent 也可以同一套物理 Agent数字 Agent建图 / 定位页面/状态理解是否正确导航多步工具编排是否偏航检测 / 跟随目标实体是否绑对急停权限、沙箱、人工确认共通点不是“会不会飞”而是接口抽象、评测粒度、过线后的治理。别踩的边界Project Pilot 自己也说了限制低速、单层办公室、人数有限没有充分覆盖户外与拥挤场景软件子任务加速评测不能替代全部真实约束。所以正确用法是用它当拆解评测模板和撤人门禁提醒不要当成“某模型已经可以无人执飞”的产品背书一句话收束端到端突然变强优先检查是不是最后一个子任务补齐了Demo 很好看优先检查你有没有把峰值和均值拆开有人想砍审核优先甩出可复现基线 独立急停 长尾覆盖而不是争模型名字。原文与方法细节见Anthropic Research《Project Pilot: Can AI control a drone?》2026-07-24https://www.anthropic.com/research/project-pilotDrone-Bench 说明https://andonlabs.com/evals/drone-bench

相关新闻

Azure Stack Hub 网络服务管理工具与常见问题排错(下篇)

Azure Stack Hub 网络服务管理工具与常见问题排错(下篇)

未经同意,请勿转载! 本篇定位:面向 Azure Stack Hub 一线运维 / SOC / 监控 / 故障响应工程师。本文承接上篇《Azure Stack Hub 网络服务:从物理拓扑到租户 SDN 完整图谱》中网络模型部分,重点展示如何在生产中观测、运…

2026/7/29 1:24:04阅读更多 →
树状数组与线段树的区别、联系及应用场景

树状数组与线段树的区别、联系及应用场景

树状数组与线段树的区别 数据结构特性 树状数组(Binary Indexed Tree, BIT)基于二进制拆分思想,结构为隐式树形,仅支持前缀和操作。线段树(Segment Tree)为显式二叉树结构,支持区间查询与更新&a…

2026/7/29 1:22:04阅读更多 →
使用PeaZip与AES-256/Twofish实现顶级文件加密安全实践

使用PeaZip与AES-256/Twofish实现顶级文件加密安全实践

1. 项目概述:为什么我们需要超越“压缩即加密”的思维定式在数字资产管理成为日常的今天,文件加密早已不是谍战片里的专属情节。我们每个人电脑里都躺着合同、照片、财务记录、项目源码,这些数据一旦泄露,轻则尴尬,重则…

2026/7/29 1:22:04阅读更多 →
OpenSmith:本地LLM Pipeline追踪与调试实战指南

OpenSmith:本地LLM Pipeline追踪与调试实战指南

在本地开发和调试 LLM 应用时,你是否遇到过这样的困境:想要追踪每个组件的输入输出、查看中间结果、分析性能瓶颈,却发现现有的工具要么需要接入云端服务,要么配置复杂、难以集成?特别是在涉及敏感数据或需要离线工作的…

2026/7/29 2:30:19阅读更多 →
libsvm python模型秒变API?MLServer这招绝了,不用Flask也能跑

libsvm python模型秒变API?MLServer这招绝了,不用Flask也能跑

你有没有碰到过这种情形, 就是当你训练好了一个新的模型之后, 有时候你不想费神去编写那个Flask Code(也就是web框架), 也不想把模型进行容器化并且在某个环境里运行它, 只是想要借助API马上就能使用这个模型?要是你存在这样的需求, 那必然是会希望去了…

2026/7/29 2:30:19阅读更多 →
基于热释电红外传感器与Arduino的智能安防报警系统DIY全攻略

基于热释电红外传感器与Arduino的智能安防报警系统DIY全攻略

1. 项目概述:从“被动防御”到“主动预警”的跨越提起家庭或小型场所的安全防护,很多人第一时间想到的是摄像头。但摄像头更多是“事后追溯”的工具,它记录下发生了什么,却无法在入侵发生的瞬间发出即时警报。而红外报警装置&…

2026/7/29 2:30:19阅读更多 →
基于Arduino与状态机的智能红绿灯系统设计与实现

基于Arduino与状态机的智能红绿灯系统设计与实现

1. 项目概述:从“拍脑袋”到“动手做”的智能路口构想每次在路口等红绿灯,看着空无一人的斑马线和倒计时几十秒的红灯,心里总会冒出个念头:这时间是不是有点浪费?尤其是深夜或者车流稀少的时段,让行人干等那…

2026/7/29 2:30:19阅读更多 →
国内直连免费AI工具GPT-5.6与GPT Image2实测指南

国内直连免费AI工具GPT-5.6与GPT Image2实测指南

这次我们来看一个近期关注度很高的技术方案:如何在国内环境下免费、无需特殊网络配置就能使用 GPT-5.6 Sol 和 GPT Image2 这两个模型。如果你一直在找能在手机和电脑上直接访问的 AI 工具,并且希望避开复杂的部署流程或账号限制,这篇文章会给…

2026/7/29 2:30:19阅读更多 →
从零搭建AI智能体:MCP协议、工具调用与工作流实战指南

从零搭建AI智能体:MCP协议、工具调用与工作流实战指南

从零搭建 AI 智能体(Agent)已经成为开发者进入大模型应用领域的关键技能。无论是企业内部流程自动化、数据分析助手,还是复杂的多步骤任务规划,掌握智能体的核心组件和搭建流程都能让你在实际项目中快速落地 AI 能力。本文将以工程…

2026/7/29 2:28:19阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/28 3:17:03阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →