商汤SenseNova-Vision:一个模型统一所有视觉任务,全面超越,代码已开源
基本信息论文标题Vision as Unified Multimodal Generation / 视觉即统一多模态生成作者团队商汤科技研究院 南洋理工大学 香港中文大学 北京大学 上海交通大学 浙江大学发表信息arXiv:2607.06560, 2026年7月代码链接https://github.com/OpenSenseNova/SenseNova-Vision研究背景你有没有想过一个问题为什么目标检测需要一个模型分割需要另一个深度估计还得换第三个计算机视觉领域长期处于一任务一模型的碎片化局面——DETR做检测SAM做分割MoGe做深度每个模型架构不同、数据格式不同、互不兼容。这不仅是研究者的烦恼更是产业落地的瓶颈。自动驾驶需要同时跑检测、深度估计和场景理解三四个模型机器人抓取需要检测分割深度联合推理。如果能把所有视觉任务放进一个模型像ChatGPT统一NLP那样会怎样商汤科技联合六所高校的最新工作SenseNova-Vision正是朝这个方向迈出的关键一步。创新点SenseNova-Vision的核心思路极其直接把所有视觉任务都转化为看图说话和看图生成。无论是输出文字坐标红酒杯在[100,200,300,400]还是生成一张深度图甚至是图文混合的指代分割结果都落在同一个多模态生成框架内。这相当于把ChatGPT文本进→文本出的思路搬到了视觉领域输入图像和自然语言指令输出可以是文字、图像或两者混合不需要任何任务专用的预测头。核心方法技术实现分两步每一步都很务实。第一步重新定义数据。研究团队构建了 SenseNova-Vision Corpus核心操作是把所有异构的CV标注统一转写成指令-回答对。COCO的检测框变成图中的猫在哪→猫在[坐标]“深度图的像素矩阵变成估计深度→输出深度图”分割掩码变成把红酒杯分出来→掩码图标签。第二步在统一语料上训练。从一个现成的预训练多模态模型出发不做任何架构改动不添加任何任务专用模块仅在这个翻译后的语料库上训练。模型自然学会了将不同视觉任务理解为不同的问答模式——文字问答、图像生成、图文混合三种模式共用一套参数。这个设计的巧妙之处在于架构零改动。统一不是靠魔改网络结构实现的而是靠重新定义输入输出空间。实验结果SenseNova-Vision在四大类视觉任务上对飙各领域最强专用模型任务类别具体指标本文结果最佳专用模型结构化感知检测 F1mIoU56.6Rex-Omni 52.9稠密几何深度 δ193.2MoGe-2 92.6分割GCG分割 mIoU69.2LISA 61.9多视图3D重建 F187.9VGGT 84.3一个没有任务专用头的统一模型在多个指标上反而超越了各领域最强的专用模型。深度估计的 δ1 达到93.2%意味着93.2%的像素深度误差在25%以内已接近实用精度。多视图3D重建的87.9 F1也大幅领先此前的SOTA。应用场景自动驾驶当前方案需要多个独立模型做检测、深度估计和场景理解。SenseNova-Vision一个模型覆盖全部感知需求显著降低系统复杂度和推理延迟。机器人操作机械臂抓取物体需要同时做检测、深度感知和分割。统一模型让感知链路从多模型串行变成单模型并行。AR/VR从单张图片重建3D结构、估计相机姿态、分割物体——这些是AR眼镜的核心能力SenseNova-Vision的多视图几何能力恰好对齐这个方向。局限与展望推理速度方面作为大模型目前还达不到轻量级专用模型的实时性但这是工程优化问题而非原理瓶颈。极端场景下的鲁棒性——强光照、严重遮挡等条件下——仍需进一步验证。此外当前模型仅处理静态图像尚未扩展到视频时序理解。但方向已经非常清晰。One Model for All Vision正在从口号变成工程现实统一多模态生成可能是视觉基础模型的最终形态。总结一句话SenseNova-Vision证明了一个统一多模态生成模型能同时胜任七大视觉任务且超越专用模型。覆盖检测、OCR、分割、深度、法线、3D重建、相机姿态架构零改动。模型和代码已全面开源。以上就是SenseNova-Vision论文的核心解读。如果觉得有帮助欢迎点赞、在看、转发三连支持你觉得一模型通吃所有视觉任务离产业落地还有多远欢迎在评论区聊聊。

相关新闻

视频大模型评估新方法:从被动问答到主动推理

视频大模型评估新方法:从被动问答到主动推理

1. 为什么我们需要重新思考视频大模型评估方式 去年在测试某个主流视频理解模型时,我发现一个有趣现象:当询问"视频里的人在做什么",模型能准确回答"跳舞";但当我问"为什么这个人会选择街舞而不是芭蕾&q…

2026/7/26 8:39:00阅读更多 →
初学C语言心得:从Hello World开始

初学C语言心得:从Hello World开始

前言这是我的第一篇CSDN博客,也是记录我学习C语言的开始。希望通过持续写博客,整理自己的学习过程,也方便以后的复习。一、为什么学习C语言C语言是一门经典的程序设计语言。虽然它诞生得比较早,但现在仍然被广泛应用于操作系统、嵌…

2026/7/26 8:37:00阅读更多 →
解决微信小程序开发者工具remote-debug启动错误

解决微信小程序开发者工具remote-debug启动错误

1. 问题现象与背景分析最近在macOS环境下使用微信开发者工具(版本2.01.2)进行小程序开发时,遇到了一个典型的渲染层错误:"remote-debug start error TypeError: Foundation.onLoad is not a function"。这个报错发生在启…

2026/7/26 8:37:00阅读更多 →
深入解析RF Core HAL:TI无线MCU底层通信机制与实战优化

深入解析RF Core HAL:TI无线MCU底层通信机制与实战优化

1. RF Core HAL:无线通信的底层基石在嵌入式无线开发领域,尤其是基于德州仪器(TI)CC26xx/CC13xx系列无线微控制器(MCU)的项目中,如果你想让设备“开口说话”——也就是进行无线通信,…

2026/7/26 14:18:10阅读更多 →
Unlock Music:浏览器端音乐文件解锁工具完全指南

Unlock Music:浏览器端音乐文件解锁工具完全指南

Unlock Music:浏览器端音乐文件解锁工具完全指南 【免费下载链接】unlock-music 在浏览器中解锁加密的音乐文件。原仓库: 1. https://github.com/unlock-music/unlock-music ;2. https://git.unlock-music.dev/um/web 项目地址: https://gi…

2026/7/26 14:18:10阅读更多 →
多模型编排技术解析与Perplexity架构实战

多模型编排技术解析与Perplexity架构实战

1. 多模型编排技术为何突然爆发? 最近半年,AI领域最让我兴奋的技术趋势莫过于多模型编排架构的快速崛起。这种技术彻底改变了传统单一模型的工作模式,让不同AI模型像交响乐团一样协同工作。Perplexity作为这个领域的先行者,其架构…

2026/7/26 14:18:10阅读更多 →
暗黑破坏神2存档编辑器:5分钟学会可视化修改游戏角色的完整指南

暗黑破坏神2存档编辑器:5分钟学会可视化修改游戏角色的完整指南

暗黑破坏神2存档编辑器:5分钟学会可视化修改游戏角色的完整指南 【免费下载链接】d2s-editor 项目地址: https://gitcode.com/gh_mirrors/d2/d2s-editor 还在为暗黑破坏神2复杂的存档修改而烦恼吗?d2s-editor为您提供了一套完整的可视化解决方案…

2026/7/26 14:18:10阅读更多 →
Claude智能体新功能详解:努力级别、Webhook与系统提示词配置

Claude智能体新功能详解:努力级别、Webhook与系统提示词配置

Claude 托管智能体最近迎来了一系列重要功能更新,这次新增的配置选项让智能体的行为控制更加精细。对于已经在使用或计划部署 Claude 智能体的开发者来说,这些新功能直接关系到智能体的响应质量、资源消耗和集成能力。 最值得关注的新增功能包括努力级别…

2026/7/26 14:18:10阅读更多 →
水下机器人仿真终极指南:用UUV Simulator零成本探索海洋奥秘

水下机器人仿真终极指南:用UUV Simulator零成本探索海洋奥秘

水下机器人仿真终极指南:用UUV Simulator零成本探索海洋奥秘 【免费下载链接】uuv_simulator Gazebo/ROS packages for underwater robotics simulation 项目地址: https://gitcode.com/gh_mirrors/uu/uuv_simulator 想要在虚拟海洋中测试水下机器人吗&#…

2026/7/26 14:16:10阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/26 0:01:28阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/26 0:01:28阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/26 0:01:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/25 23:03:25阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/25 19:03:04阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/25 19:03:04阅读更多 →