Florence-2 概括版
1. 核心目标与背景核心目标构建一个统一的视觉基础模型Vision Foundation Model通过统一的序列生成方式Sequence-to-Sequence同时解决不同粒度的视觉任务Image-level图像分类、图像描述CaptioningRegion-level目标检测、区域定位GroundingPixel-level像素级分割Segmentation现有模型的两大痛点Motivation训练数据不够全面现有模型如CLIP主要依赖 Image-Text Pair只能提供图像级全局语义缺少目标位置、区域描述和像素级语义如狗在哪Mask 是什么。模型任务不统一很多模型针对单一任务设计检测输出 Box分割输出 Mask描述输出 Text导致不同任务需要不同网络结构难以实现真正的“基础模型”。2. 核心创新一Florence Data Engine 与 FLD-5B 数据集要训练统一模型最大的瓶颈是缺少多粒度数据。论文通过Florence Data Engine自动构建了FLD-5B数据集。2.1 数据生成与迭代流程 (Data Engine)采用“群体智慧”不依赖单一模型而是使用多个现有的视觉专家模型Specialist Models协同生成初始数据再通过迭代优化Train - Predict - Filter - Refine清洗噪声。流程Web Images → 多专家模型协同标注 → Initial Annotations → 过滤与优化 → FLD-5B2.2 FLD-5B 数据规模与组成包含126M图像、5.4B视觉标注远超同类数据集的精细度。单张图片包含多粒度标注Text Annotation (全局)Image → CaptionRegion-Text Pair (区域)Image → Region (Box) → Text如[120,80,300,250]对应dogPhrase-Region Pair (细粒度)Text phrase → Specific RegionPixel-level (像素)Region → Segmentation Mask对比优势结合了 LAION 的“海量规模”与 COCO 的“多粒度精细标注”为模型学习全局到像素级语义提供了数据基础。3. 核心创新二统一序列生成模型架构Florence-2 摒弃了为不同任务设计不同 Head 的传统做法采用Vision Encoder Multimodal Encoder-Decoder架构将所有视觉任务转换为 Token 序列生成。3.1 整体架构Vision Encoder (DaViT)将图像切分为 Patch 并提取视觉特征Visual Tokens。Multimodal Encoder (BART-like)融合视觉特征Visual Tokens与任务指令文本Text Tokens。Decoder (BART-like)统一进行自回归Autoregressive生成输出 Text / Box / Mask Tokens。为什么用 Encoder-Decoder 而不是 Decoder-only LLM视觉任务天然包含“输入Image Instruction→ 输出Structured Prediction”的属性Encoder-Decoder 更适合这种视觉到结构化数据的转换。3.2 任务统一与特殊 Token 设计非文本输出坐标、Mask无法直接用语言表达Florence-2 设计了特殊 Token位置 (Location)将连续坐标离散化。如[100, 200, 300, 400]转换为loc_100 loc_200 loc_300 loc_400。回归问题变成了词汇表上的分类问题。分割 (Segmentation)使用seg mask tokens /seg表示。统一任务范式举例Image Prompt → Token GenerationCaptionimage What is in this image?→A dog running in the parkDetectionimage Detect objects→dog loc_100 loc_200 loc_300 loc_400Segmentationimage Segment dog→dog seg mask tokens /seg4. 训练策略本质是多任务自回归语言模型损失Autoregressive Language Modeling Loss。多任务混合训练同一个 Batch 内混合 Caption、Detection、Grounding、Segmentation 的数据共享一套模型参数计算相同的 Token Prediction Loss。这使得不同任务能互相促进如检测的空间能力辅助分割。两阶段训练预训练 (Pre-training)使用 FLD-5B 学习通用视觉、空间定位、图文对齐能力。微调 (Fine-tuning)在下游特定 Benchmark 数据上进一步优化。模型规模Florence-2-base (232M), Florence-2-large (771M)。证明了通过高质量多粒度数据和统一架构小模型也能具备强大的视觉基础能力对比 Flamingo 80B。5. 总结与多模态模型演进对比核心三大突破数据基础FLD-5B 解决了多粒度Image/Region/Pixel统一标注的缺失。统一架构抛弃独立检测/分割 Head用 Encoder-Decoder 完成统一建模。生成范式创新性地用loc和segTokens 将坐标和掩码转化为序列生成问题。多模态发展路线对比模型核心贡献与特点输出形式CLIP(2021)4亿图文对齐奠定多模态基础相似度/分类BLIP系列(2022-23)统一视觉语言预训练通过 Q-Former 桥接冻结的 LLM 与视觉模型Text (图像描述/问答)LLaVA / Qwen-VL(2023)视觉指令微调侧重多模态对话和复杂问答推理Text (长文本回答)Florence-2(2024)端到端训练统一视觉基础任务重基础视觉能力而非长篇对话Text, Boxloc, Maskseg一句话总结Florence-2 的最大价值不在于提出了新的大语言模型而是通过FLD-5B 多粒度数据集 特殊 Token 编码成功将传统计算机视觉的“分类、检测、分割”三大独立任务完美统一到了自然语言处理的“序列生成”框架下。

相关新闻

实时语音驱动NPC+AI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析

实时语音驱动NPC+AI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析

更多请点击: https://kaifayun.com 第一章:实时语音驱动NPCAI剧情分支引擎:Epic官方认证的AI辅助开发框架首次开源解析 Epic Games 于2024年Q2正式开源了其内部孵化的AI辅助游戏开发框架—— NarrativeSynth Engine,该框架获Epic…

2026/7/29 0:07:47阅读更多 →
目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案

目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案

更多请点击: https://codechina.net 第一章:目标模糊、资源泛滥、进度失控,AI学习计划制定失败的3大隐形陷阱及救急方案 目标模糊:学得越勤,离真实能力越远 当学习目标停留在“学会AI”或“搞懂大模型”这类宽泛表述…

2026/7/29 0:07:47阅读更多 →
卡梅德生物技术快报|牛单B细胞单抗制备:牛单B细胞单抗制备全流程解析:以HIV Env免疫原评估为例

卡梅德生物技术快报|牛单B细胞单抗制备:牛单B细胞单抗制备全流程解析:以HIV Env免疫原评估为例

【问题引入】 在抗体发现领域,单B细胞分选技术已经发展为一项核心平台技术。其基本原理是利用每个B细胞只产生一种特异性抗体的特点,直接从单个抗原特异性B细胞中扩增抗体基因,再通过重组表达获得完整单克隆抗体。这一技术相较于杂交瘤技术和…

2026/7/29 0:05:47阅读更多 →
有录网在2026留学服务榜单中的表现评价

有录网在2026留学服务榜单中的表现评价

在竞争激烈的留学市场中,选择一家靠谱的留学中介至关重要。有录网在2026年的留学服务中表现出色,为众多学生实现留学梦想助力。服务模式:多人协作保障申请稳定有录网采用顾问、文书、申请、签证等岗位分工协作的服务方式。这种多人协作模式避…

2026/7/29 1:32:10阅读更多 →
Gemini 多模态创作实测,图文一体创作效率高于其余几款模型

Gemini 多模态创作实测,图文一体创作效率高于其余几款模型

随着Kimi K3正式发布,AI大模型的能力边界再次被拓宽,在长文本理解、复杂逻辑推理、多维度内容生成等场景实现了全面升级。但对于企业运营、内容创作、程序开发、智能办公等各类从业者而言,单一模型始终存在能力短板:Kimi K3擅长长…

2026/7/29 1:32:10阅读更多 →
YOLOv11涨点改进| TGRS 2026 | 独家Conv创新改进篇 |引入MPConv多尺度部分卷积,进行多尺度特征高效提取,适合语义分割任务、遥感影像分割、医学图像分割、目标检测任务,有效涨点

YOLOv11涨点改进| TGRS 2026 | 独家Conv创新改进篇 |引入MPConv多尺度部分卷积,进行多尺度特征高效提取,适合语义分割任务、遥感影像分割、医学图像分割、目标检测任务,有效涨点

一、本文介绍 🔥本文给大家介绍使用 MPConv多尺度部分卷积 改进YOLOv11网络模型,MPConv通过多尺度部分卷积机制对不同尺度特征进行高效提取,并利用部分通道模块(ParCM)和部分空间模块(ParSM)增强通道间信息交互与关键空间区域感知,使模型能够更充分地学习目标的纹理、…

2026/7/29 1:32:10阅读更多 →
K8s资源调度与HPA自动扩缩容!AI流量波峰波谷自动适配,实现Agent服务智能弹性伸缩、降本增效

K8s资源调度与HPA自动扩缩容!AI流量波峰波谷自动适配,实现Agent服务智能弹性伸缩、降本增效

0. 导读在前十一篇专栏中,我们已经闭环了云原生核心基础能力:容器原理、镜像构建、私有仓库、集群架构、Pod生命周期、Deployment发布、网络通信、配置管理、持久化存储。至此,我们已经可以搭建一套稳定、规范、可落地的JavaPython Agent云原…

2026/7/29 1:32:10阅读更多 →
K8s存储精讲!EmptyDir、PV/PVC、LocalPV、云盘,彻底解决Agent日志、向量数据、持久化存储问题

K8s存储精讲!EmptyDir、PV/PVC、LocalPV、云盘,彻底解决Agent日志、向量数据、持久化存储问题

0. 导读前面十篇我们已经搞定了:容器底层、镜像优化、Harbor仓库、K8s架构、Pod、Deployment、网络、配置中心。但绝大多数同学上线 AI 项目、Java 服务后,都会遇到一个致命线上问题:Pod 重启数据全部丢失。典型生产玄学问题你一定遇到过&…

2026/7/29 1:32:10阅读更多 →
Python 最易懂入门 | 从变量引用→列表拷贝→函数→判断循环,手把手实操代码

Python 最易懂入门 | 从变量引用→列表拷贝→函数→判断循环,手把手实操代码

一、前言本篇为纯上手实操向 Python 基础语法,所有代码均经过手写运行验证,新手跟着逐行执行即可掌握变量内存、列表复制、函数、条件判断、循环整套入门知识,避开 90% 新手踩坑点。二、第一阶段:变量本质 —— 变量是标签不是盒子…

2026/7/29 1:30:09阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/28 3:17:03阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →