面壁智能将密度定律带入具身智能
作者 | 金旺栏目 | 机器人新纪元在WAIC 2026上具身智能无疑成了最拥挤的赛道。我们在现场听到越来越多具身智能团队开始谈论量产、订单和场景落地面壁智能正是在这时发布了具身智能模型系列MiniCPM-Robot试图让已经进入到手机、汽车、消费硬件的端侧模型进一步走进物理世界。不过面壁智能联合创始人、首席科学家刘知远在接受媒体采访时告诉我们“目前具身智能发展还处于非常早期阶段甚至连ChatGPT时刻还远未到来。”面壁智能学术合伙人、多模态智能首席科学家姚远也指出“目前针对一个固定任务采集上千条数据再训练一个专家模型做出一段表现不错的视频并不困难真正困难的是机器人换一个房间、换一台本体、换一种物体之后能不能继续完成任务。”这也就成了MiniCPM-Robot最值得关注的地方。当面壁智能终于进入具身智能领域后他们首先打造了一个1.5B端侧通用VLA模型并将密度定律带到了具身智能领域。01 密度定律进入具身过去几年里大模型行业相信的是Scaling Law参数、数据和算力持续扩大模型能力随之不断提升。然而面壁智能却发现了另一个现象并在2024年提出了密度定律。所谓密度定律是指模型智能密度会随时间呈指数级增强达到相同智能水平所需要的参数量约每3.5个月缩小一半。刘知远将这一定律类比为“模型制程”的持续进步——“如果摩尔定律提高的是芯片电路密度密度定律提高的就是单位参数所能承载的智能。”这套逻辑支撑了MiniCPM过去几年的发展新一代语言模型MiniCPM5-1B只有约10亿参数可以运行在手机和浏览器MiniCPM-V 4.6则以约1.3B参数继续压缩端侧多模态模型的体积和计算成本。如今面壁智能继续将这条曲线延伸到了具身智能领域。在WAIC 2026期间面壁智能正式对外发布了具身智能模型系列MiniCPM-Robot其中的操作模型的参数约为1.5B。按照姚远的说法“这套模型没有为某一个场景单独设计一套参数而是尝试用一个模型控制不同本体覆盖多种任务和环境在相关评测中它已经可以与过去3-4B、甚至规模更大的专用模型取得相当效果部分指标甚至更好。”不过参数小只是其一具身模型还需要持续处理摄像头输入。传统多模态和具身方案处理一帧图像通常要消耗约256个视觉TokenMiniCPM-RobotManip将其压缩到了64个。如果具身机器人同时接收3-4路摄像头画面即便每路视频每秒只保留一帧一分钟也会积累数百帧图像形成几万甚至十万级Token视觉Token压缩不下来机器人的记忆就无从谈起。因此MiniCPM-RobotManip进一步支持1分钟原生视频上下文通过视觉压缩、流式上下文管理和专门的后训练让历史观测直接进入到模型中机器人由此也就不再只看当前画面还能够利用此前发生的信息作出判断。至于这样的设计有怎样更直观的作用姚远举了两个简单的例子“如果任务要求机器人按照牌子上的数字按几次按钮缺少记忆的模型在按下按钮时其实不知道自己已经按了几次制作三明治也是一样它需要理解任务进行到了哪一步而不是每看到一帧画面就重新作出一次孤立的反应。”与此同时面壁智能还推出了追踪导航模型通过纯视觉和纯本地部署在不增加额外传感器、不提前建图的情况下进行目标追踪在电梯、地下停车场等弱网或断网环境中这一模型仍然可以稳定运行。不难发现泛化、效率、记忆构成了MiniCPM-Robot的三个关键词而它们最终指向的是同一个目标在有限的端侧算力中装进尽可能完整的具身智能。值得注意的是此前面壁智能提出的密度定律主要在语言模型和多模态模型上得到了验证而在进入具身智能领域之后情况变得更复杂。语言模型处理的是数字世界中的Token具身模型还要面对传感器误差、本体差异、控制延迟和真实环境的随机性这样的小模型能否继续保持能力跨本体数据能不能放进同一套参数而不互相干扰仍然需要在更多真机部署中进行验证。不过面壁要验证的不只是模型能不能继续变小还要证明更小的模型是否可以在物理世界中承担更复杂的任务。02 面壁智能为何选择“先通用后专用”在具身智能领域Demo几乎成了衡量技术进度的唯一窗口。普通人手中没有一台可以随时测试的人形机器人只能通过企业发布的视频判断模型能力一台机器人能做三明治、叠衣服或者打乒乓球很容易被理解为具身智能已经取得了实质性突破。但Demo背后却隐藏了数据成本。为了让机器人完成一个固定任务具身智能团队可以提前在同一个场景采集数百甚至上千条数据再对模型进行专门微调只要环境变化不大机器人就可以获得不错的展示效果。不过姚远认为这类结果不能代表具身基础模型的真实进度。他指出“当前不少模型依然缺少基础性、泛化性和通用性场景一旦出现没有见过的物体或者任务步骤发生改变原本流畅的动作就可能失效。”更现实的问题是那些随机性极低、重复度极高的任务传统机械臂和自动化设备已经完成得很好具身智能如果长期停留在固定工位只是用更复杂的模型重新完成一次成熟自动化方案其技术意义和商业收益都需要重新计算。刘知远将这种路线概括为“先专用后通用”它延续的是上一代专用人工智能的思路。2010-2018年上一批人工智能创业团队在做人脸识别时收集了大量人脸数据做自动驾驶也收集了大量驾驶数据然而模型可以把一项任务做得很好却无法把能力迁移到其他领域。今天一些具身智能团队仍在重复这条路径一个任务对应一套数据、一次微调和一个模型。对于这一模式刘知远引用了一个产业界形象的比喻指出“如果你的目标是登上月球却一直通过爬树来训练自己无论树爬得多高多好也到不了月球。”在他看来通用具身智能应该“先通用后专用”。他指出“一个人在学习开车之前就已经通过十几年生活形成了对物理世界的常识他可能没有学习过牛顿定律却知道水泥柱不能撞、地面上的塑料袋通常不需要紧急避让在这些通用认知的基础上人只需要较短的时间就能学会驾驶。”他认为“模型也应该先成为一个足够聪明的‘大学生’再成为司机、程序员、家务机器人或者工厂中的机器人。”实际上过去这几年大语言模型的技术发展走的真是这样一条路。今天Claude的编程模型已经足够出色到用户愿意为之付费但它并非只是靠代码数据堆出来的它首先继承了基础大语言模型的语言、知识和推理能力随后才成长为一个“专业程序员”。具身智能要获得更高的专业能力上限同样需要一个通用基座。这也是为什么面壁智能没有把某一个场景的深度优化作为MiniCPM-Robot的首要目标。按照姚远的说法团队现阶段更关注基础数据、训练方法和工程链路希望让一套参数支持更多任务、场景和本体“真实场景的数据闭环仍然重要但它需要建立在通用基础能力之上。”而面壁智能选择先通用后专用实际上是相信大语言模型已经走过的通用化路径也能够在具身智能领域再次发生。03 具身智能的ChatGPT时刻还远未到来面壁选择在此时进入具身智能并不意味着这个行业已经成熟。恰恰相反刘知远给出的判断是“具身智能的技术路线仍未收敛基础模型、数据体系和商业模式都处在探索阶段。”2018年前后预训练模型领域同时存在BERT、GPT和T5等多条技术路线当时GPT甚至不是最被看好的方向直到GPT-3和ChatGPT相继出现行业才逐渐向生成式架构收敛。如今的具身智能同样存在VLA、世界模型、强化学习等多种技术路线虽然今年很火的世界模型补充了具身智能对未来状态进行预测的重要能力但未来具身基础模型最终以什么形态出现仍然没有明确答案。姚远指出“当下具身智能的关注度远高于2018年的大语言模型路线收敛可能会更快但这仍需要一定的时间。”与此同时数据是另一个尚未解决的问题。大语言模型可以直接利用互联网文本具身智能却没有同等规模、天然存在的动作数据互联网视频数据量巨大却缺少精确动作和关节信息仿真数据容易扩大规模但与真实世界存在一定差距真机数据精度高、任务也更贴合却昂贵而又稀缺。越容易获得的数据数据量越大但精度和场景贴合度越低越接近机器人真实任务的数据成本越高、数量越少这也就成了当下具身数据的现状。此外具身基础模型还需要同时使用文本、图文、视频、人类动作、仿真和真机数据需要回答不同来源的数据怎样进入一套模型、是否相互干扰以及模型如何从观测中形成对物理世界的常识。姚远指出“数据层面的Scaling Law依然成立更多有效数据仍然会带来能力提升但参数规模的Scaling Law尚未形成共识具身模型还要满足实时推理要求不可能简单复制语言模型不断扩大参数的路径。”正是由于这诸多问题的存在刘知远指出“现在大家都还没有找到具身智能的ChatGPT时刻。”ChatGPT之所以成为大语言模型的分水岭不是因为它完成了一次成功演示而是因为任何用户打开网页都可以立即测试它并在不同任务中感受到它的通用能力。具身智能暂时缺少这样的产品和评判方式普通人无法随时测试一台机器人企业发布的Demo也很难完整呈现成功率、数据量和环境约束。这正是具身智能距离ChatGPT时刻最远的地方。就面壁智能而言MiniCPM-Robot是面壁智能进入具身智能的第一步也让面壁智能离AGI又近了一步。接下来我们更期待面壁智能的密度定律能够加速具身智能领域的智能涌现。

相关新闻

Python age-calculator 包:功能详解、安装使用与实战案例

Python age-calculator 包:功能详解、安装使用与实战案例

1. 引言在 Python 生态中,age-calculator 是一个轻量级但功能实用的第三方库,专门用于计算年龄、日期差以及处理与年龄相关的常见逻辑。无论是开发用户注册系统、健康管理应用,还是处理生日提醒功能,这个包都能帮助开发者快速完成…

2026/7/21 8:17:10阅读更多 →
从高血压诊疗入手,北京安贞医院让医疗大模型走出聊天框

从高血压诊疗入手,北京安贞医院让医疗大模型走出聊天框

作者:金旺医疗AI,一直是大模型最受关注、最难落地的行业之一。一边是迅速增加的医疗问答、报告生成、影像识别和辅助诊断产品,另一边,真正走进医院诊室、影响医生决策的大模型仍然不多。其中的原因并不复杂,普通大模型…

2026/7/21 8:17:10阅读更多 →
Python age-detection-local 包:功能详解、安装使用与实战案例

Python age-detection-local 包:功能详解、安装使用与实战案例

1. 引言在计算机视觉领域,年龄检测是一项经典且实用的任务。Python 的 age-detection-local 包为开发者提供了一套轻量级、本地化的年龄估计解决方案,无需依赖云端 API,即可在本地设备上快速完成人脸年龄预测。本文将详细介绍该包的功能特性、…

2026/7/21 8:17:10阅读更多 →
完播率卡在38.7%?AI生成视频的3秒钩子失效真相,及4步动态帧级重校准法

完播率卡在38.7%?AI生成视频的3秒钩子失效真相,及4步动态帧级重校准法

更多请点击: https://codechina.net 第一章:完播率卡在38.7%?AI生成视频的3秒钩子失效真相,及4步动态帧级重校准法 当AI视频生成工具批量产出“高信息密度开头”后,完播率却稳定卡在38.7%——这不是算法退化&#xff…

2026/7/21 17:01:59阅读更多 →
Tack项目深度解析:从零开始理解AWS上的Kubernetes基础设施即代码

Tack项目深度解析:从零开始理解AWS上的Kubernetes基础设施即代码

Tack项目深度解析:从零开始理解AWS上的Kubernetes基础设施即代码 【免费下载链接】tack Terraform module for creating Kubernetes cluster running on Container Linux by CoreOS in an AWS VPC 项目地址: https://gitcode.com/gh_mirrors/ta/tack Tack是一…

2026/7/21 17:01:59阅读更多 →
CD19:从B细胞关键共受体到肿瘤免疫治疗典范靶点

CD19:从B细胞关键共受体到肿瘤免疫治疗典范靶点

简述: 本文立足于免疫系统的基本架构,系统阐述CD19作为B淋巴细胞谱系特异性标志物的分子特征、其作为B细胞受体(BCR)信号通路共受体的精细调控机制,以及在B细胞恶性肿瘤免疫治疗中作为核心靶点的临床转化路径&#xff…

2026/7/21 17:01:59阅读更多 →
内存泄漏系列专题分析之三十二:高通相机CamX ION/dmabuf内存管理机制CmdBuffer

内存泄漏系列专题分析之三十二:高通相机CamX ION/dmabuf内存管理机制CmdBuffer

【关注我,后续持续新增专题博文,谢谢!!!】 上一篇我们讲了: 这一篇我们开始讲: 内存泄漏系列专题分析之三十二:高通相机CamX ION/dmabuf内存管理机制CmdBuffer 目录 一、背景 二、:CmdBufferManager管理单元 2.1:CmdBufferManager初始化 2.2:CmdBufferMa…

2026/7/21 17:01:59阅读更多 →
内存泄漏系列专题分析之十四:高通相机CamX ION/dmabuf内存管理机制ImageBuffer之GrallocBuffer原理

内存泄漏系列专题分析之十四:高通相机CamX ION/dmabuf内存管理机制ImageBuffer之GrallocBuffer原理

【关注我,后续持续新增专题博文,谢谢!!!】 上一篇我们讲了:内存泄漏系列专题分析之十二:高通相机CamX ION/dmabuf内存管理机制ImageBuffer之CSLBuffer原理 这一篇我们开始讲: 内存泄漏系列专题分析之十四:高通相机CamX ION/dmabuf内存管理机制ImageBuffer之G…

2026/7/21 17:01:59阅读更多 →
音乐格式转换终极指南:3步解锁你的加密音频文件

音乐格式转换终极指南:3步解锁你的加密音频文件

音乐格式转换终极指南:3步解锁你的加密音频文件 【免费下载链接】unlock-music 在浏览器中解锁加密的音乐文件。原仓库: 1. https://github.com/unlock-music/unlock-music ;2. https://git.unlock-music.dev/um/web 项目地址: https://git…

2026/7/21 16:59:58阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 0:51:49阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 0:51:49阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 0:51:49阅读更多 →
Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

📌教程适配:OpenClaw v2.7.9 | 兼容 Windows10/11、macOS 双系统 📖前言 当下各类本地 AI 工具层出不穷,多数产品仅能完成文字问答交互,很难直接操控电脑执行实际操作。OpenClaw,业内常称小龙虾 AI&#…

2026/7/21 0:01:46阅读更多 →
Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

聊《一次Codex项目复盘,问题最后出在流程而不是模型》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做&…

2026/7/21 0:01:46阅读更多 →
手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

大家好,还是我。前几期带大家做了心情日记本和可视化大屏,后台有朋友留言:“能不能教点好玩的?我想做游戏,但一行代码都不会。”行,这期就安排。今天的目标:从零做一个五子棋游戏。 带AI对战、三…

2026/7/21 0:03:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/20 22:51:39阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/20 18:51:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/20 18:51:18阅读更多 →