物理AI+飞捷科思CTO杨鼎康|新一代物理世界模型Fysiverse,正在打破WM边界
世界模型太火了在WAIC2026人工智能大会上在具身智能展馆中世界模型代替VLA登上了舞台。6月AI教母李飞飞world Lab团队发文将世界模型分为三大类渲染器以像素的形式输出观测专供人眼欣赏主打一个长得像模拟器输出几何、物理和动力学状态人类和程序都能拿去算、去交互主打一个算得准规划器输入观测和目标直接告诉机器人“下一步该咋办”主打一个能指挥。以前这三类各干各的渲染器是动作进去画面出来规划器反过来是画面进去动作出来。但李飞飞预言这三条路的边界正在消失视频模型开始接受动作指令三维模型开始输出碰撞网格规划器也开始在脑子里推演未来。在WAIC2026的物理智能论坛上飞捷科思这家由英伟达物理引擎奠基人张立华教授回国创立的物理AI时代Infra的公司发布了他们的新一代物理世界模型Fysiverse。这套东西恰好把李飞飞的预言搬到了现实里它既是渲染器也是模拟器更是规划器。抛开晦涩的技术概念从飞捷科思CTO杨鼎康博士的演讲中抽丝剥茧来看清楚Fysiverse世界模型到底是怎么回事以及对具身机器人来说到底意味着什么01世界模型火爆的另一面不同路线仍然存在问题飞捷科思CTO杨鼎康博士一开篇就提到从物理AI完整闭环来看一个智能系统要进入真实世界不能只有感知也不能只有大模型推理。机器人需要从摄像头、传感器和任务指令中识别对象、空间、材料和关系将它们转化成可计算的世界状态随后通过世界模型和物理引擎预演动作可能产生的结果再完成规划、策略选择和风险控制最终在真机上执行并将反馈重新送回系统。世界模型位于这个闭环的中间连接“看懂世界”和“在世界中行动”。为什么世界模型如此重要因为真实世界不能无限试错。机器人抓取失败可能损坏物体工业产线上的错误动作可能造成碰撞、停机甚至安全事故。因此物理AI必须具备行动前的预演能力。给定当前状态、动作目标和物理约束系统需要提前推演下一刻的状态、轨迹和风险。只有形成感知、建模、推演、决策、执行、反馈的闭环AI才能从回答问题走向承担真实任务。Fysiverse要解决的正是这一闭环中最难也最缺失的世界推演环节。从杨博士的总结来看不同世界模型虽然技术路线各异但至少需要具备三个共同能力第一承载世界状态和历史记忆第二接受动作输入并反馈状态变化第三产生可用于训练和决策的未来结果。换句话说世界模型的核心并不是生成一段连续视频而是承载状态、接受动作、推演结果。从技术形态上来看现有世界模型主要有三条路线但也各有局限。视频世界模型擅长从像素中学习时空相关性视觉表现力强但是视觉生成不等于物理应用正确可能发生穿透隐式世界模型在浅空间中建模状态更适合学习和决策局限在于隐式表征难以直观验证很难解释它是否遵循物理规律三维世界模型恢复明确的空间结构能够观察和慢游但没有质量摩擦和接触关系不等于可交互、可仿真。对于物理AI来说关键不是结果看起来合理而是接触是否正确、受力是否一致、材料是否产生正确的响应应用结果能否被复现和验证。飞捷科思认为下一阶段并不是简单地选择提供一条路线而是需要把它们统一到可计算、可验证的物理状态上。如李飞飞所言未来统一世界模型可以根据不同需求进行三种投影面向人类输出像素和观测它是渲染器面对系统输出对象、几何和物理状态它是模拟器面向机器人输出动作和策略它是规划器。三者并不是割裂的产品而是同一世界状态在不同任务上的表达这里模拟器是结构型骨架因为只有掌握世界状态如何演化模型才能够既生成可信画面也为具身智能提供可靠的动作依据。当生成模型开始进入模拟领域也带来新的风险几何看起来正确并不代表具有正确的物理属性。因此面向物理AI的世界模型至少要满足四个要求:1. 显示承载对象、材料接触和约束;2. 能够接受机器人的动作任务、目标和环境条件;3. 下一个状态来自可计算的物理演化;4. 整个过程应该可回放、可复现、可评估。只有这样世界模型输出的结果才能真正用于训练决策和安全验证而不仅是用于展示。02范式拆解Fysiverse打破世界模型的边界物理世界模型Fysiverse从真实观测出发先重建可仿真的三维世界再利用参数和引擎来预演未来的状态最后把物理预演转化为生成过程中的强约束使结果同时具备视觉真实性和物理可信度整个体系包含三个部分。1. Real-to-Sim负责把二维观测转换成可仿真的三维场景;2. Sim-to-Sim负责在物理规律下演化状态;3. Sim-to-real阶段负责把可验证的物理过程转译为视频和观测。图飞捷科思物理世界模型Fysiverse1Real-to-Sim把二维观测变成可仿真场景Fysiverse可以接收文本、图像或全景观测。首先由Fysiverse-3D完成对象级分割、三维重建、几何和材质生成以及空间布局恢复。它要回答的是这个世界里有什么它们分别在哪里这里的重点不是生成一张看起来立体的图而是让每个对象保持独立身份。桌子、椅子、杯子、柜子不再黏在同一张画面里而是成为可以单独移动、替换和编辑的三维资产。系统还会根据提示词中的前后、左右、上下、支撑和遮挡关系将物体放到合理位置使场景能够进入后续的物理参数补全和仿真流程。除了文本生成Fysiverse-3D也支持从单张RGB图像恢复三维场景。图从全景图重建3D世界即使是一张随手拍摄的办公室、客厅照片甚至卡通风格图像系统也可以尝试拆解出独立对象并恢复成可编辑的三维布局。单张图片天然存在遮挡和尺度不确定性因此这里的目标并不是一步到位地还原绝对真实而是以更低的输入成本构建一个可继续修正、可进入仿真的场景基础。与英伟达以视频为主要输入的SimFoundry相比Fysiverse-3D强调从单张图像出发降低场景数据采集门槛。同时其相关管线已经开源并兼容现有生态希望将Real-to-Sim从一项展示能力变成研究者可以直接使用和验证的基础工具。2Sim to Sim给三维世界补上物理含义创建了几何世界之后还需要理解其中的物理含义要知道物体的密度、摩擦、硬度、弹性和形变趋势。OmniFysics是全模态物理理解构建的基础模型承担的就是这部分工作。这个概念比英伟达的cosmos要早了至少半年。在多个国际公开的物理AI感知评测基础上当前的3B版本在综合指标上领先同尺寸模型并在大部分指标上超过了更大size的模型。OmniFysics将分散在图像、文本、音频和物理任务中的知识转化成可以被仿真系统记录和调用的物理参数与约束。图具备物理属性的世界生成随后Fysics物理引擎负责进行动力学、碰撞和约束求解。这一步回答的是这个世界按照什么物理规律运行3Sim-to-Real把推演后的状态转成视频景有了几何、材料和约束系统便可以推演未来。真实世界不只有刚体同一个物体还必须处理软体、流体等不同的物质形态。Fysiverse-Video将材料类型与物理参数真正放进状态演化链路在同样的受力条件下因为硬度、密度和摩擦的不同会产生完全不同的形态、流动、堆积甚至是碰撞过程。多材质不是替换视觉纹理而是真正改变物体在物理运动过程中的演化规律使最终的视频继承了一个可检查、可验证的物理过程。Fysiverse-Video另一个关键能力是可控同一个初始场景、方向、初速度和弹性参数不同未来的结果就应当不同。图多参数可控直接把这些参数作为推演条件无论是向左、向右还是向后速度从低到高弹性从弱到强系统都会产生对应的轨迹碰撞和回弹结果可控性非常重要。因为机器人训练和工程评测需要系统性地改变条件构造可比较的实验而不是依赖一次不可重复的随机生成。因此Fysiverse的核心区别并不是把下一帧生成得更漂亮而是先计算下一时刻的世界状态再将其转换成画面。03物理世界模型Fysiverse对具身机器人落地意味着什么将Fysiverse放到具身操作中其价值就更加直接。它可以在不同机器人本体、不同场景和不同任务下进行大规模状态推演。图Fysiverse对具身落地的价值重点不是生成某一个固定机械臂的演示而是建立统一接口将机器人动作、对象状态和场景约束送入同一套世界推演链路。这样一来系统可以批量产生成功操作、失败操作、危险操作以及现实中难以采集的长尾交互数据。这些数据可以用于策略训练和风险评估。对于机器人来说真正有价值的结果不是视频看起来像机器人在工作而是机器人动作和对象状态之间存在可靠的因果关系。例如在刚体案例中一排柜子依次倒下系统需要正确处理碰撞顺序、接触传播、动量传递和物体不穿透。图推演减少99%物理幻觉在流体案例中水团在重力作用下坠落、破碎和飞溅水的体积、方向和表面变化需要保持前后连续而不是每一帧各自生成。在软体案例中泰迪熊弹起后落下系统不仅要保持整体轨迹还要处理局部形变、弹性恢复和能量耗散。这些案例想证明的是刚体、流体和软体都能够在同一套物理状态框架中被推演。Fysiverse的最终价值在于将真实世界转化成可复用的物理AI资产。第一类是可仿真的场景资产包括对象级三维模型、材料参数、空间布局和接触关系。第二类是受到动作和物理参数约束的状态与视频序列可以为机器人提供成功、失败和长尾交互数据。第三类是可重复的闭环评测任务。通过统一初始状态、动作脚本和物理条件不同机器人和策略模型可以在更接近的条件下训练和测试。图现实操作VS仿真训练对于机器人企业来说这至少可能带来三方面的价值。首先降低真实世界试错成本。机器人可以先在仿真环境中碰撞、滑落和失败再把筛选后的策略放到真机执行减少设备损耗和安全风险。其次补足长尾数据。现实数据采集往往集中在成功演示而碰撞、卡住、形变和失败动作成本更高也更危险。世界模型可以系统地改变条件批量构造这些稀缺样本。最后推动机器人评测走向可复现。今天很多机器人Demo的场景、物体和成功标准并不统一很难直接比较。可重复的世界模型任务有机会为机器人训练、策略验证、数字孪生和安全测试提供统一底座。结语下一代世界模型的竞争正在从画面质量走向世界状态与因果推演能力。飞捷科思的Fysiverse所代表的全新范式是让生成模型继续发挥视觉理解和表达优势同时通过显式物理模拟补足其在接触、受力、材料和因果建模上的短板。它不是简单地在渲染器、模拟器和规划器之间选择一条路线而是试图以模拟器为骨架将三者重新接起来。正如杨鼎康博士在结尾所说让世界模型从“看起来像真实世界”走向“能够服务真实世界”。

相关新闻

AI音乐生成技术解析:从Suno、Udio看创作革命

AI音乐生成技术解析:从Suno、Udio看创作革命

1. AI音乐生成技术概述Suno和Udio作为当前最前沿的AI音乐生成平台,正在彻底改变音乐创作的方式。这两个平台都采用了基于深度学习的生成式AI技术,能够根据用户输入的简单文本提示,自动生成包含旋律、和声、节奏乃至完整歌词的原创音乐作品。与…

2026/7/23 15:20:14阅读更多 →
文件上传总失败?秘塔AI类型过滤策略全拆解,从HTTP头解析到Magic Number校验,工程师必存的7步调试法

文件上传总失败?秘塔AI类型过滤策略全拆解,从HTTP头解析到Magic Number校验,工程师必存的7步调试法

更多请点击: https://codechina.net 第一章:文件上传失败的典型现象与归因定位 文件上传失败是Web应用中高频且影响用户体验的关键问题,其表象多样但根源往往集中于客户端、网络链路、服务端中间件及后端逻辑四个层面。准确识别现象特征并快…

2026/7/23 15:18:14阅读更多 →
基于 Spring Boot 的高校网络舆情管控平台设计与实现

基于 Spring Boot 的高校网络舆情管控平台设计与实现

目 录 摘 要 Abstract 1 绪 论 1.1 选题的背景和意义 1.1.1 选题的背景 1.1.2 选题的意义 1.2 国内外研究现状 1.2.1 国内研究现状 1.2.2 国内研究现状 1.2.3 研究评述 1.3 主要内容及组织结构 1.3.1 主要内容 1.3.2 组织结构 2 主要开发工具和技术简介 2…

2026/7/23 15:18:14阅读更多 →
从 Kimi K3 的长上下文与 Agent 架构,看 GEO 语义匹配如何重构 AI 收录权重

从 Kimi K3 的长上下文与 Agent 架构,看 GEO 语义匹配如何重构 AI 收录权重

2026年7月,月之暗面发布 Kimi K3,参数规模达2.8万亿,具备100万 token 上下文窗口与原生视觉理解,并支持长时间自主运行的 Agent 模式。从工程视角看,这类超长上下文 自主检索模型的普及,正在改变 AI 搜索引…

2026/7/23 16:44:38阅读更多 →
基于Hadoop+SparkML+Kafka的实时信用卡欺诈检测系统架构与实践

基于Hadoop+SparkML+Kafka的实时信用卡欺诈检测系统架构与实践

今天我们来深入分析一个基于HadoopSparkMLSparkStreamingKafka的信用卡交易欺诈风险大数据分析系统。这个系统结合了大数据领域最核心的技术栈,专门针对金融行业的实时风险检测需求,能够处理海量交易数据并快速识别可疑交易行为。 1. 核心能力速览 能力…

2026/7/23 16:44:38阅读更多 →
制造业智能库存管理:ERP系统如何破解库存积压与缺料难题

制造业智能库存管理:ERP系统如何破解库存积压与缺料难题

1. 库存管理难题的根源剖析"原材料库存积压又频繁缺料停工"这个看似矛盾的现象,在制造业工厂中却屡见不鲜。我走访过三十多家中小型制造企业,发现这个问题背后往往隐藏着三个致命伤:第一是信息孤岛问题。采购部门根据历史经验下单&…

2026/7/23 16:44:38阅读更多 →
HarmonyOS《柚兔学伴》项目实战19-云数据库——端云数据同步

HarmonyOS《柚兔学伴》项目实战19-云数据库——端云数据同步

第19篇:云数据库——端云数据同步 HarmonyOS 的云数据库(Cloud DB)提供了端云一致的数据存储方案,支持数据在本地和云端之间自动同步,实现跨设备数据共享。本篇以"柚兔学伴"项目为例,讲解如何使用…

2026/7/23 16:44:38阅读更多 →
前端工程师收藏!2026年大模型风口,你的进阶“逃生”指南

前端工程师收藏!2026年大模型风口,你的进阶“逃生”指南

随着大模型技术成熟,前端开发岗位面临挑战。本文为前端工程师提供转型AI Agent开发的必要性、可行性及完整路径,对比技术栈、分析核心优势,构建知识图谱,助你在大模型时代把握机遇,实现职业进阶。 前端已死&#xff0c…

2026/7/23 16:44:38阅读更多 →
切问学术使用方法全解析 新手快速上手操作指南

切问学术使用方法全解析 新手快速上手操作指南

很多时候,你和同门在效率与视野上的差距,并非源于智力或努力,而在于信息获取与处理的“工具差”。当别人还在用传统方式大海捞针时,有人已经用新工具建好了知识雷达。尤其在查找和消化国外文献这个核心环节,工具带来的…

2026/7/23 16:42:38阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/22 22:56:18阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/22 18:55:50阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/22 18:55:50阅读更多 →