ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

V-JEPA: 从视频帧到3D时空Token,V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余

V-JEPA: 从视频帧到3D时空Token,V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余 从视频帧到3D时空Token:彻底理解V-JEPA如何用ViT切分Tubelet、构建三维网格、加入位置编码,并用贯穿时间维的3D Multi-Block Mask遮住时空区域与抑制视频冗余的直觉教程从视频帧到3D时空Token1. 第一件事情:视频为什么不能直接扔进 ViT?普通 ViT 本质上处理的是:TokenSequence\text{Token Sequence}TokenSequence而一段视频原始是:T×H×W×3T\times H\times W\times3T×H×W×3其中:TTT是帧数;HHH是图像高度;WWW是图像宽度;333是 RGB 三个通道。因此必须先把视频切成很多小块,再把这些小块变成 Token。但图片只有空间:H×WH\times WH×W视频则有:T×H×WT\times H\times WT×H×W所以 V-JEPA 不再切二维 Patch,而是切三维时空 Patch(3D Spatio-temporal Patch)。2. V-JEPA 的一个 Token 到底是什么?V-JEPA 默认的基本 Patch 尺寸为:2×16×16\color{red}{2\times16\times16}2×16×16顺序是:Time×Height×Width\text{Time}\times\text{Height}\times\text{Width}Time×Height×Width也就是说:时间方向包含连续222帧;高度方向包含161616像素;宽度方向包含161616像素。因此一个 Token 不是:“某一帧里面一个16×1616\times1616×16小方块”。而是:“同一个空间小区域,在连续两帧中的内容”。这种跨时间的小立方体也常被称为Tubelet(时空管状块)。V-JEPA 官方模型配置使用2×16×162\times16\times162×16×16的时空 Patch。3. 用真正直观的六帧视频理解 Tubelet假设我们有一个非常小的视频:T=6,H=W=32T=6,\qquad H=W=32T=6,H=W=32每一帧只有:32×3232\times3232×32像素。空间 Patch 大小是:16×1616\times1616×16所以每一帧可以切成:2×22\times22×2四个小方块。先不要急着生成 Token。我们先把原始6 帧全部画出来。时间轴 │ │ ▼ Frame 1 Frame 2 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 1-a │ 2-a │ │ 1-b │ 2-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 3-a │ 4-a │ │ 3-b │ 4-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘ Frame 3 Frame 4 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 5-a │ 6-a │ │ 5-b │ 6-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 7-a │ 8-a │ │ 7-b │ 8-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘ Frame 5 Frame 6 ┌──────────┬──────────┐ ┌──────────┬──────────┐ │ 9-a │ 10-a │ │ 9-b │ 10-b │ │ 左上16×16│ 右上16×16│ │ 左上16×16│ 右上16×16│ ├──────────┼──────────┤ ├──────────┼──────────┤ │ 11-a │ 12-a │ │ 11-b │ 12-b │ │ 左下16×16│ 右下16×16│ │ 左下16×16│ 右下16×16│ └──────────┴──────────┘ └──────────┴──────────┘时间 T ↑ │ │ Frame 6 │ ──────────┼────────── / /| / 9-b 10-b / | / 左上16×16 右上16×16/ | ├──────────┬──────────┤ | / 11-b / 12-b / | / 左下16×16/ 右下16×16 / | └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 5 | ────────── | / /| | / 9-a 10-a / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 11-a / 12-a / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 4 | ────────── | / /| | / 5-b 6-b / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 7-b / 8-b / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 3 | ────────── | / /| | / 5-a 6-a / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 7-a / 8-a / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 2 | ────────── | / /| | / 1-b 2-b / | | / 左上16×16 右上16×16/ | | ├──────────┬──────────┤ | | / 3-b / 4-b / | | / 左下16×16/ 右下16×16 / |/ └──────────┴──────────┘ | ▲ | │ | │ 时间 | │ | Frame 1 / ────────── / / / / 1-a 2-a / / 左上16×16 右上16×16/ ├──────────┬──────────┤ / 3-a / 4-a / / 左下16×16/ 右下16×16 / └──────────┴──────────┘ ↓ Height / 高度 Width / 宽度 →注意这里暂时用a、b表示某个 Token 中来自不同帧的空间切片。4. 现在把相邻两帧的同一个空间位置粘在一起Tubelet 的时间大小是222,所以:Frame 1 和 Frame 2 被配成一组。Frame 3 和 Frame 4 被配成另一组。Frame 5 和 Frame 6 被配成第三组。例如左上区域:Frame 1 Frame 2 ┌──────────────┐ ┌──────────────┐ │ │ │ │ │ 1-a │ ========= │ 1-b │ │ 16×16 │ 时间 │ 16×16 │ │ │ 深度=2 │ │ └──────────────┘ └──────────────┘ \____________________________/ │ ▼ Token 1 2×16×16所以:Token1={ Frame1左上,Frame2左上}\text{Token 1}=\{\text{Frame 1 左上},\text{Frame 2 左上}\}Token1={Frame1左上,Frame2左上}同理:Token2={ Frame1右上,Frame2右上}\text{Token 2}=\{\text{Frame 1 右上},\text{Frame 2 右上}\}Token2={Frame1右上,Frame2右上}Token3={ Frame1左下,Frame2左下}\text{Token 3}=\{\text{Frame 1 左下},\text{Frame 2 左下}\}Token3={Frame1左下,Frame2左下}Token4={ Frame1右下,Frame2右下}\text{Token 4}=\{\text{Frame 1 右下},\text{Frame 2 右下}\}Token4={Frame1右下,Frame2右下}而 Frame 3 和 Frame 4 得到:Token5,Token6,Token7,Token8\text{Token 5},\text{Token 6},\text{Token 7},\text{Token 8}Token5,Token6,Token7,Token8Frame 5 和 Frame 6 得到:Token9,Token10,Token11,Token12\text{Token 9},\text{Token 10},\text{Token 11},\text{Token 12}Token9,Token10,Token11,Token125. 这就是之前为什么会画成三个矩阵Tubelet 化之后,原来的:6×32×326\times32\times326×32×32视频在 Token 空间里变成:3×2×23\times2\times23×2×2为什么?时间:T′=62=3T'=\frac{6}{2}=3T′=26​=3高度:H′=3216=2H'=\frac{32}{16}=2H′=
返回列表