通用机器人迎来“珠峰级”考试:人类登顶满分,最强AI还在山脚
具身智能时代通用机器人策略距离“登顶”还有多远现有基准仍难以回答这个问题。不少基准依赖简单、短程或技能范围狭窄的任务仿真评估效率高、易扩展但难以反映真实物理部署能力真实世界评估更接近实际部署却成本高、耗时长也更难复现。针对这一问题来自香港大学、加州大学伯克利分校、清华大学、北京大学等联合研究团队提出了面向仿真与真实世界的统一评估基准 RoboDojo覆盖多样、长时程、精度要求高、依赖记忆和开放式的操作场景。论文链接https://arxiv.org/abs/2607.04434实验结果显示现有通用机器人操作策略还远谈不上可靠即便是当前 SOTA 模型也难以稳定完成 RoboDojo 中的复杂任务在真实世界部署中成功率仅 12.8%远低于人类遥操作的满分表现。基于这些结果研究团队建立了公开排行榜系统分析了当前策略在仿真与真实世界中的局限并提出了未来通用操作策略的关键方向。图RoboDojo 概览。RoboDojo统一的机器人评估基准整体来看RoboDojo 以五类核心操作能力定义仿真基准并由仿真评估平台、真实世界评估平台和XPolicyLab 共同完成任务构建、策略训练、部署与评估。图RoboDojo 任务概览。仿真基准覆盖五类核心操作能力泛化、记忆、长程执行、精细控制与开放指令理解并通过 42 个任务系统诊断策略在不同操作能力上的短板。泛化任务测试策略对未见背景、光照、目标和杂物的适应能力记忆任务考察历史信息利用长程任务评估策略完成多步骤操作序列的能力精细控制任务聚焦窄孔插入等高精度接触操作开放任务测试策略能否将已学技能迁移到未见语言指令和新目标。从系统构成来看RoboDojo 由仿真评估平台、真实世界评估平台和 XPolicyLab 三部分构成具体如下仿真平台负责任务构建、资产生成、并行评估和数据采集。任务和场景通过配置文件定义不同物体被构建为数字孪生资产评估时平台可并行运行多个场景以提升效率采集数据时简单任务可自动生成轨迹复杂任务则通过 VR 遥操作获取高质量示范。图RoboDojo 中的技能多样性。真实世界评估强调可复现性通过统一硬件、工作空间、光照、场景重置和评估协议减少真实机器人实验中的偶然因素RoboDojo-RealEval 则借助触摸屏界面和布局叠加机制规范任务重置与执行流程。图真实世界任务亮点。XPolicyLab统一策略开发、训练、评估与部署流程并通过标准化数据转换、训练模板、部署流程和 observation-action 接口降低策略接入成本。此外RoboDojo 还设立了仿真与真实世界双榜单仿真榜单围绕五类能力反复评估并以资深 VR 遥操作员为人类参考真实世界榜单基于 RoboDojo-RealEval在 3 种机器人本体、18 个任务上评估 10 个代表性策略统一重置、部署与评分协议。图RoboDojo-RealEval 系统概览。RoboDojo 的评测结果如何研究团队发现现有通用机器人操作策略整体仍不可靠即便是当前领先模型也与人类专家存在显著差距且仿真中的优势未必能延续到真实部署中。不过RoboDojo 本身具备较好的评估效率和可复现性。具体结果如下1.仿真结果目前领先策略仍远低于人类水平目前领先模型包括 Hy-Embodied-0.5-VLA、Spatial Forcing、π0.5、X-VLA 等但最佳策略平均成功率仅 8.80%、平均分 13.07远低于人类专家的 76.03% 和 80.42 分说明现有策略距离稳定完成任务仍有巨大差距。图 RoboDojo 仿真基准排行榜。不同模型能力发展不均衡Spatial Forcing 更擅长泛化X-VLA 在精细操作上领先π0.5 在开放任务上相对更强Hy-Embodied-0.5-VLA 则在长程执行、记忆和总体表现上最好但这些优势多局限于单一维度难以覆盖完整任务集。即使在表现较好的泛化和长程维度最佳成功率也不足 15%精细控制、记忆和开放指令理解仍是短板。泛化方面场景随机化会显著削弱策略表现Hy-Embodied-0.5-VLA 在标准场景下领先但随机化后下降 92.9%Spatial Forcing 在随机场景下相对更稳但绝对表现仍很低。当前策略对视觉和空间分布变化高度敏感可靠泛化仍需要更稳定的控制、闭环校正和失败恢复能力。图标准与随机化视觉设置下的策略性能。长程执行方面动作先验、具身预训练和空间 grounding 带来的提升仍然有限。Hy- Embodied-0.5-VLA、π0.5 和 Spatial Forcing 成功率接近 15%说明模型能推进部分多步任务但最佳成功率仍不足 15%且分数高于成功率模型常能推进前期步骤但难以稳定完成最终目标技能组合、阶段决策和错误恢复能力仍不足。精细控制方面X-VLA 表现最好成功率 12.00%、分数 18.32但仍远未达到可靠水平。Hy-Embodied-0.5-VLA 虽总体最佳却在该维度落后于 X-VLA 和 Spatial Forcing说明整体表现不能直接转化为局部精细控制三维定位、平滑动作预测和闭环接触控制仍是短板。记忆方面当前策略仍难以有效利用历史信息完成后续操作。Hy-Embodied-0.5-VLA 表现最好具身预训练和动作先验有助于利用历史信息但 EventVLA 的显式记忆设计和 X-WAM 的隐式时间记忆都未能带来稳定成功表明记忆能力仍难以转化为可靠控制。开放语义操作方面当前策略仍难以应对开放指令和新目标。即使表现最好的 π0.5成功率也仅 1.67%、分数 1.98。强视觉-语言骨干虽能提升感知和语言理解但尚不能稳定对齐开放指令、视觉 affordance 与可执行动作语义目标到机器人行为的转化仍是关键短板。2.真实世界结果真实世界部署方面当前通用机器人操作策略仍不可靠。最佳策略 π0.5 在 18 个真实任务上的成功率仅 12.8%、分数 22.9远低于人类遥操作的满分表现。分数普遍高于成功率说明模型常能完成部分步骤却难以完成完整任务。图 RoboDojo 真实世界基准排行榜。仿真性能与真实可部署性并不完全一致。π0.5 在仿真和真实评估中均表现较强但真实排名并不完全遵循仿真结果InternVLA-A1、GalaxeaVLA 在真实测试中优于预期部分仿真领先模型在真实机器人上优势缩小。仿真更适合能力诊断真实评估则用于检验策略对感知噪声、校准误差、执行延迟和接触不稳定等物理因素的适应性。真实世界评估暴露了成功率之外的执行与安全风险。真实部署中会出现动作抖动、无效重复、接触不稳定甚至安全关键行为DM0 等模型还需要人工监控或干预。这说明真实评估不能只看任务是否完成还要检验策略在物理机器人上的控制稳定性和失败恢复能力。3.评估效率与稳定性RoboDojo 具备较好的评估效率和稳定性。异构并行仿真提升了大规模测试吞吐量真实世界评估中π0.5 完成 180 次试验仅耗时 202 分钟平均每个任务10 次试验约 11.2 分钟体现了标准化重置、统一接口和本地部署带来的效率提升。图每个任务的真实世界评估时间。重复评估结果显示仿真与真实世界的最大成功率标准差分别仅 1.1 和 1.3 个百分点榜单结果较稳定、可复现。图多次重复运行中各任务真实世界评估的完整稳定性。不足和未来发展研究团队指出尽管 RoboDojo 已覆盖仿真与真实世界评估但当前机器人操作策略在泛化、长程执行、精细操作、记忆和开放任务理解上仍有明显短板真实世界结果也表明现有模型在复杂物理部署中仍不够稳定。研究团队表示他们将在未来持续更新 RoboDojo 的策略、任务和评估结果并扩展到更广泛的场景、机器人本体和感知模态包括灵巧手操作、类人全身操作、触觉操作和移动操作等方向。图RoboDojo 的未来扩展。同时他们也将为 RoboDojo 在不同方向引入多个机器人本体提升基准的可访问性增强跨硬件平台比较的公平性最终发展为面向具身操作的通用评估平台。原文链接通用机器人迎来“珠峰级”考试人类登顶满分最强AI还在山脚-36氪

相关新闻

嵌入式与Linux基础

嵌入式与Linux基础

嵌入式与Linux基础 一、什么是嵌入式? 简单来说是以计算机为基础,软硬件可裁剪的专用型计算机系统。 咱们平时用的电脑、笔记本,属于全能打工人:能打游戏、刷视频、写代码、追剧,啥活都能干,系统庞大&#…

2026/7/24 23:05:05阅读更多 →
Helm 部署 K8s 集群完整笔记

Helm 部署 K8s 集群完整笔记

Helm 部署 K8s 集群完整笔记一、整体架构图plain┌─────────────────────────────────────────────────────────────────┐ │ 用户层 │ │ ┌…

2026/7/24 23:05:05阅读更多 →
templates/ 是 Helm Chart 的核心引擎室

templates/ 是 Helm Chart 的核心引擎室

templates/ 是 Helm Chart 的核心引擎室。你可以把它理解为:一个"智能 YAML 工厂" —— 你写一次模板,Helm 根据 values.yaml 里的配置,自动"生产"出适合不同环境的 Kubernetes YAML。与你学过的 k8s/ 对比Tablek8s/ 文件…

2026/7/24 23:05:05阅读更多 →
终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕

终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕

终极虚拟显示器解决方案:Parsec VDD让你的Windows电脑随心扩展屏幕 【免费下载链接】parsec-vdd ✨ Perfect virtual display for game streaming 项目地址: https://gitcode.com/gh_mirrors/pa/parsec-vdd 你是否曾经遇到过这样的困扰:想用笔记本…

2026/7/25 0:25:20阅读更多 →
终极免费方案:如何零成本获取Steam创意工坊的动态壁纸?

终极免费方案:如何零成本获取Steam创意工坊的动态壁纸?

终极免费方案:如何零成本获取Steam创意工坊的动态壁纸? 【免费下载链接】Wallpaper_Engine 一个便捷的创意工坊下载器 项目地址: https://gitcode.com/gh_mirrors/wa/Wallpaper_Engine 你是否曾经在Steam创意工坊看到令人惊艳的动态壁纸&#xff…

2026/7/25 0:25:20阅读更多 →
电脑端高效查询手游攻略与开服资讯,一站式职场人导航站点搞定

电脑端高效查询手游攻略与开服资讯,一站式职场人导航站点搞定

不管是日常休闲玩手游,还是长期关注游戏版本动态,大多数人都会有一个共识:电脑端查阅游戏资料的体验远优于手机。 大屏视野、内容排版完整、攻略细节清晰,无论是副本通关技巧、阵容搭配思路,还是新版本活动规则解读&a…

2026/7/25 0:25:20阅读更多 →
【高速缓存】RedisVL 在 Redis 上使用 SQL 查询数据实践指南

【高速缓存】RedisVL 在 Redis 上使用 SQL 查询数据实践指南

Redis 本身并不原生支持 SQL,但通过 RedisVL 提供的 SQLQuery 类,你可以编写类似 SQL 的查询语句,并自动翻译为 Redis 能够执行的底层命令。这不仅降低了学习曲线,还能让你快速利用 Redis 的高级功能(向量检索、地理空…

2026/7/25 0:25:20阅读更多 →
【高速缓存】RedisVL为文本生成嵌入向量实践指南

【高速缓存】RedisVL为文本生成嵌入向量实践指南

在现代语义搜索和 RAG 应用中,文本嵌入(Embedding) 是核心基础——它将自然语言转换成高维数值向量,使得计算机能够“理解”语义相似性。RedisVL 提供了一套统一的向量化器接口,让你可以使用多种主流嵌入服务&#xff…

2026/7/25 0:25:20阅读更多 →
短剧翻译预算不多怎么办?实测低预算下的性价比方案

短剧翻译预算不多怎么办?实测低预算下的性价比方案

先说结论:预算有限不代表只能选低质量方案,AI译制路线本身就是压缩成本的解法,关键是要搞清楚"低预算"和"低质量"不是同一件事。本文从真实成本结构出发,给出低预算团队的具体落地打法。一、低预算团队的真实…

2026/7/25 0:23:20阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 0:58:53阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 0:58:53阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/24 0:58:53阅读更多 →
突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:01:16阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:01:16阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:01:16阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/24 23:01:03阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/24 19:00:40阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/24 19:00:40阅读更多 →