视频通用模型来了!何恺明等新作GenCeption:训练量仅1/500,精度持平SOTA!
「再证「生成即理解」」目录01 视觉领域长期无解的底层痛点02 把文生扩散改造成前馈通用感知器2.1 核心改造迭代扩散转为单步前馈推理2.2 统一表征稠密、稀疏任务共用一套3通道RGB输出空间2.3 可规模化合成数据训练管线03 性能、数据效率、涌现能力三重突破3.1 多任务统一SOTA单模型对标数十款专用专家模型3.2 碾压级数据效率仅竞品1/7~1/500训练量即可持平精度3.3 三大原生涌现能力04 工程落地价值与长远行业影响4.1 短期落地场景价值4.2 中长期行业变革意义4.3 待解决开放问题05 写在最后大语言模型依靠自预测预训练完成大一统但计算机视觉长期停留在“单一任务专用模型”的碎片化阶段做深度估计要用DepthAnything分割依赖SAM人体姿态、相机位姿、3D关键点又要单独训练专属网络。Google DeepMind联合MIT、牛津大学等机构在ECCV 2026发表的最新论文给出了一个颠覆性结论大规模文生视频扩散模型就是视觉领域等价于LLM“下一个Token预测”的通用预训练目标。在此基础上提出的GenCeption用一套统一主干统一损失依靠文本提示就能完成深度估计、表面法线预测、分割、相机位姿估计和3D关键点预测等数十类视频感知任务。训练数据量仅为现有SOTA模型的1/71/500还诞生了仿真到真实、跨类别零样本等多项涌现能力。01 视觉领域长期无解的底层痛点如今计算机视觉赛道分工极度割裂根源在于三类无法同时兼顾的历史预训练方案缺陷这也是GenCeption全部设计逻辑的出发点。1. 专用任务模型路线DepthAnything、SAM、Sapiens等模型各司其职主干、解码器、损失函数全部独立设计。新增一类感知任务就要完整重训一套网络研发成本极高模型之间无法复用时空、3D几何先验对动态视频时序一致性建模能力薄弱只能处理静态图像。图 | DepthAnything2. 传统自监督视觉预训练VideoMAE、V-JEPA以掩码重构、特征预测为目标缺少原生图文对齐能力无法用自然语言指令调度任务仅能提取视觉特征不内置4D时空、物体物理交互先验想要做深度、法线这类几何任务必须额外搭建下游专用头数据利用效率极低。图 | VideoMAE3. 图像扩散复用方案Marigold、Diception仅基于静态图像扩散处理连续视频时预测结果会剧烈时序抖动只能覆盖少量稠密视觉任务无法拓展3D关键点、相机位姿这类稀疏结构化输出通用性存在天然天花板。图 | Marigold三类方案全都无法同时满足通用视觉模型三大硬性要求内置4D时空物理先验、原生图文对齐、可规模化拓展全品类感知任务。而文生视频扩散模型的训练目标天然同时满足三点这是GenCeption的核心立论根基。02 把文生扩散改造成前馈通用感知器整套框架以开源文生视频模型WAN 2.1的DiT扩散Transformer为主干核心改造思路是抛弃扩散迭代采样将多步去噪流程转为单步前馈推理搭配统一表征方案、合成数据多任务微调流水线全程一套主干、一套损失搞定所有视觉任务。2.1 核心改造迭代扩散转为单步前馈推理图 | GenCeption完整架构流程图输入视频文本提示单步前馈输出稠密/稀疏视觉结果传统文生视频需要数十步迭代去噪速度慢不适合感知推理。GenCeption做了关键简化输入不再是噪声潜向量直接送入原始视频干净潜特征时序步长固定t0整流流模型终止状态仅单次前向传播输出预测。原文整流流DiT预测速度项v模型输出取-v即可对齐目标潜空间无需多轮迭代。这套改造完全保留预训练阶段学到的全部时空、几何、图文先验不改动主干网络权重结构只调整输入输出逻辑兼顾预训练权重复用与推理速度。图 | 范式变迁总览图左侧GenCeption完整技术路线右侧传统专用模型与统一通用模型架构对比1.3B小规模模型单段81帧480×832视频推理仅5.92秒14B大模型10秒完成完全满足视频实时感知需求。2.2 统一表征稠密、稀疏任务共用一套3通道RGB输出空间这是实现“无任务专属网络”最关键的设计所有视觉输出全部映射至0~1三通道像素空间仅靠文本提示如“输出深度”“输出3D关键点”切换任务不用更换解码器、损失。1. 稠密任务深度、表面法线、分割、射线图单通道信息深度图直接复制填充RGB三通道3维法线直接使用R/G/B分别对应XYZ三轴相机位姿这类高维射线数据设计“罗斯科分块射线图”图5旋转、平移分量分区域塞入同一帧RGB画面适配统一VAE解码器。图 | 罗斯科射线图将6维相机射线信息压缩至单张3通道图像2. 稀疏任务2D/3D人体关键点新增一组可学习序列Token追加至视频潜序列经过独立轻量MLP回归坐标。为匹配预训练时序位置编码采用位置插值适配视频长度仅新增极少量参数不会破坏主干预训练时空建模能力。所有任务统一使用单一L2损失不再为深度、分割、姿态分别设计定制损失函数。传统多任务训练需要反复调平衡权重GenCeption直接把任务差异转移到数据预处理阶段深度图采用对数归一化消除尺度歧义法线统一值域不同任务仅调整训练数据混合比例大幅降低多任务调参成本。2.3 可规模化合成数据训练管线图 | 深度、法线预测定性效果示例现实带标注高质量视频数据集稀缺尤其是同时包含深度、法线、分割、人体关键点、相机位姿多标签素材。GenCeption完全以合成虚拟视频作为主要训练数据仅指代分割补充少量真实数据集。数据生成流程采用800组人物3D资产200套CMU动作捕捉动画搭配多样HDRI场景、可变相机焦距生成7500段合成视频Blender批量渲染多模态真值深度、掩码、人体关节。训练前统一将RGB输入、多模态目标全部编码缓存为潜向量大幅加速训练速度。这套数据方案的核心优势无需大量人工标注、可无限扩充人物动作与场景同时带来极强仿真到真实世界迁移能力也是模型数据效率碾压竞品的关键。03 性能、数据效率、涌现能力三重突破实验不单纯罗列刷榜数字分层解读指标真实价值同时对比V-JEPA、VideoMAE等主流预训练基线明确GenCeption行业定位。3.1 多任务统一SOTA单模型对标数十款专用专家模型图 | 左多任务雷达图通用模型vs各领域专家模型右数据效率对比曲线左雷达图覆盖表面法线、深度、相机位姿、前景抠图、文本指代分割、3D人体六大主流视频感知任务。14B GenCeption通用模型在绝大多数基准上和DepthAnything3、SAM3、D4RT、Sapiens等专用模型持平甚至超越仅少数细分任务略低于单任务专家微调版本但差距极小。图 | 多任务定量对比节选14B通用模型在Hi4D法线mAE11.47KITTI深度AbsRel0.156EMDB人体MPJPE71.8对比专用模型没有明显短板。需要客观说明指标边界现有SOTA专用模型大多采用百万级真实标注视频训练GenCeption仅依靠少量合成数据达到同等精度纸面性能差距意义远不及数据效率优势。3.2 碾压级数据效率仅竞品1/7~1/500训练量即可持平精度图 | 数据效率曲线直观体现核心工程优势在深度估计统一测试基准上D4RT、VGGT-Ω需要百万级训练帧GenCeption仅需0.9M1.23M帧数据量缩减7500倍仍能实现相近AbsRel误差。图 | 预训练基线横向对比同等微调数据下基于文生视频WAN主干的GenCeption全面超过V-JEPA、VideoMAE最大版本模型。核心原因是视频扩散预训练强制模型学习真实世界4D时序因果、物体恒存、物理交互而掩码自监督仅学习局部视觉纹理缺少全局几何逻辑。图 | 迁移不同预训练层数的训练损失曲线从零随机初始化DiT训练损失几乎不下降随着迁移预训练层数增加收敛速度与最终精度同步提升完整预训练层损失最低证明视频生成预训练得到的世界先验是通用视觉的核心底座。3.3 三大原生涌现能力这是传统专用视觉模型完全不具备的特性也证明视频扩散模型学到了通用世界表征而非单一任务拟合特征。1. 仿真到真实零样本迁移模型全程仅用人形合成视频训练无需真实人物素材直接适配户外、室内各类真实视频深度、分割细节甚至优于渲染合成素材图6人物发丝、动物毛发精细预测。单物体训练支持多实例真实场景推理训练视频单帧仅包含单人但输入多人、多物体真实画面可精准区分不同目标完成分割、姿态预测图10a。图 | 泛化能力效果图多人物实例泛化2. OOD域外类别零样本泛化训练集只有人类输入猫、猩猩、河马、机器人等完全未训练物体依旧能精准输出深度、掩码、3D关键点图10b。图 | 泛化能力效果图跨类别零样本动物、人形机器人指代分割测试中训练未出现“火箭”输入提示词the rocket仍可精准分割目标。图 | 文本指代分割定性结果支持颜色、空间、运动、未知物体推理该特性意味着模型掌握物体通用几何结构而非记忆人类专属特征距离通用世界模型更近一步。04 工程落地价值与长远行业影响4.1 短期落地场景价值1. 多模态视频分析平台安防、影视后期、虚拟拍摄仅部署单套模型通过提示词切换深度、抠图、人体姿态、镜头位姿分析替代5~10款独立推理模型大幅降低显存与算力开销。2. 数字人、虚拟内容生产依靠合成数据训练无需大量真人拍摄标注一次性完成人体法线、关键点、前景分割大幅降低虚拟资产制作标注成本。3. 低成本机器人视觉感知室内机械臂、巡检机器人依靠少量仿真数据训练同时完成深度、物体分割、关键点检测无需分别训练感知网络降低机器人数据采集风险与成本。4.2 中长期行业变革意义长久以来计算机视觉和NLP存在巨大鸿沟NLP依靠生成式预训练实现大一统视觉却始终任务割裂。GenCeption直接证明文生视频生成是视觉领域等价于LLM下一词预测的通用预训练范式。未来视觉基础模型不再需要分别训练分割、深度、姿态专用底座一套文生视频预训练主干通过统一表征文本提示即可适配绝大多数感知任务彻底改变视觉模型研发流水线。同时涌现的跨类别、仿真转真实能力为通用机器人世界模型、具身智能提供全新训练路径。4.3 待解决开放问题平衡稠密像素输出与稀疏关键点两类任务的表征冲突缩小通用模型与单任务专家精度差距拓展流式长视频推理适配监控、自动驾驶长时序连续感知扩充合成数据物体、极端环境覆盖范围提升恶劣工况、非常规物体泛化能力轻量化蒸馏方案让通用视觉模型落地嵌入式边缘设备。05 写在最后GenCeption打破计算机视觉长期碎片化研发模式证实大规模文生视频扩散模型内置完整4D时空、几何、图文世界先验可作为通用视觉基础模型的预训练底座。通过将迭代扩散改造为单步前馈架构、统一多模态输出至RGB像素空间、合成数据多任务微调三大创新实现单主干通吃深度、法线、分割、3D人体、相机位姿等数十类视频感知任务数据效率远超传统自监督与专用模型路线同时诞生仿真到真实、跨类别零样本等涌现能力。尽管通用多任务训练存在小幅精度损失、轻量化落地受限等短板但该工作打通了“生成模型反向作为感知底座”全新技术路线为统一通用视觉大模型、具身智能世界模型提供极具参考的完整框架或将重塑后续视觉基础模型的研发思路。Ref论文标题Video Generation Models areGeneral-Purpose Vision Learners论文链接https://arxiv.org/abs/2607.09024项目链接https://genception.github.io/

相关新闻

threepp海洋渲染:FFT海浪与水面特效实现

threepp海洋渲染:FFT海浪与水面特效实现

threepp海洋渲染:FFT海浪与水面特效实现 【免费下载链接】threepp A cross-platform C20 3D library with the high-level API of three.js 项目地址: https://gitcode.com/gh_mirrors/th/threepp threepp是一个跨平台C20 3D库,提供与three.js相似…

2026/7/21 19:06:35阅读更多 →
为什么选择Electron Vite Monorepo?Vue 3 + TypeScript桌面开发新选择

为什么选择Electron Vite Monorepo?Vue 3 + TypeScript桌面开发新选择

为什么选择Electron Vite Monorepo?Vue 3 TypeScript桌面开发新选择 【免费下载链接】vite-vue3-admin Electron Turborepo monorepo with pnpm, Vue, Vite boilerplate 项目地址: https://gitcode.com/gh_mirrors/vi/vite-vue3-admin Electron Vite Monore…

2026/7/21 19:04:35阅读更多 →
eDBG MCP模式配置全攻略:连接Claude、Cursor等主流AI工具

eDBG MCP模式配置全攻略:连接Claude、Cursor等主流AI工具

eDBG MCP模式配置全攻略:连接Claude、Cursor等主流AI工具 【免费下载链接】eDBG eBPF-based lightweight debugger for Android with MCP support 项目地址: https://gitcode.com/gh_mirrors/edb/eDBG eDBG是一款基于eBPF的轻量级Android调试器,支…

2026/7/21 19:04:35阅读更多 →
KNN算法实战:从原理到Python实现与优化

KNN算法实战:从原理到Python实现与优化

1. KNN分类器入门:从零开始的机器学习实践 K最近邻(K-Nearest Neighbors,简称KNN)算法是我在数据科学教学中首推的入门算法,原因很简单——它完美诠释了"物以类聚"的直观思想。记得第一次用KNN完成鸢尾花分类…

2026/7/21 23:06:52阅读更多 →
XXL-JOB分布式任务调度核心原理与Spring Boot集成实践

XXL-JOB分布式任务调度核心原理与Spring Boot集成实践

1. 为什么选择XXL-JOB作为分布式任务调度方案在微服务架构成为主流的今天,单体应用中的Scheduled注解已经无法满足分布式环境下的任务调度需求。我曾经在一个电商促销系统中,因为使用简单的Spring定时任务导致多实例重复执行优惠券发放,最终不…

2026/7/21 23:06:52阅读更多 →
Sqribble:轻量级文档工程系统与自动化排版原理

Sqribble:轻量级文档工程系统与自动化排版原理

1. 项目概述:一个被严重低估的“文档流水线”系统 你有没有过这种经历:手头有一篇写得不错的博客文章,想快速变成一份体面的PDF电子书发给客户当赠品;或者团队刚整理完一份产品使用指南,领导突然说“明天要发给所有渠道…

2026/7/21 23:06:52阅读更多 →
二级市场终极陷阱:鱼见饵不见钩,全景深度复盘与破局之道

二级市场终极陷阱:鱼见饵不见钩,全景深度复盘与破局之道

前言古语有云:人见利而不见害,鱼见食而不见钩。出自《镜花缘》的这句俗语,是对二级市场绝大多数投资者亏损根源最精准、最透彻的终极概括,也是金融市场永恒的人性轮回。股市里所有的爆亏、深套、回撤、销户,几乎都不是…

2026/7/21 23:06:52阅读更多 →
纳斯达克、日本、韩国、科创板全景深度相关性分析:联动与独立行情本质

纳斯达克、日本、韩国、科创板全景深度相关性分析:联动与独立行情本质

前言全球科技资本市场并非孤立运行,纳斯达克、韩国KOSPI、日本东证科技板块、中国科创板构成了全球科技资产联动闭环。多数投资者存在普遍误区:认为四大市场高度同涨同跌、走势完全同步,实则四类市场仅在极端流动性冲击、全球系统性风险下高度…

2026/7/21 23:06:52阅读更多 →
深入解析ARP32 CPU中断延迟与指令集优化实战

深入解析ARP32 CPU中断延迟与指令集优化实战

1. 项目概述:为什么我们需要关注中断延迟? 在嵌入式系统,尤其是汽车电子、工业控制和音视频处理这类对实时性要求极高的领域,系统能否在规定时间内对外部事件做出响应,直接决定了产品的成败。想象一下,一辆…

2026/7/21 23:04:51阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/21 0:51:49阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 0:51:49阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 0:51:49阅读更多 →
Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

📌教程适配:OpenClaw v2.7.9 | 兼容 Windows10/11、macOS 双系统 📖前言 当下各类本地 AI 工具层出不穷,多数产品仅能完成文字问答交互,很难直接操控电脑执行实际操作。OpenClaw,业内常称小龙虾 AI&#…

2026/7/21 0:01:46阅读更多 →
Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

聊《一次Codex项目复盘,问题最后出在流程而不是模型》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。摘要先把这篇文章的目标说清楚:看完之后,你应该能判断这件事值不值得做&…

2026/7/21 0:01:46阅读更多 →
手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

大家好,还是我。前几期带大家做了心情日记本和可视化大屏,后台有朋友留言:“能不能教点好玩的?我想做游戏,但一行代码都不会。”行,这期就安排。今天的目标:从零做一个五子棋游戏。 带AI对战、三…

2026/7/21 0:03:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/21 22:53:50阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/21 18:53:30阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/21 18:53:30阅读更多 →