ULIP-2总结
前言ULIP-2: Towards Scalable Multimodal Pre-training for 3D UnderstandingSalesforce AI Research 等CVPR 2024研究的是如何让 3D 点云表征学习到大规模图文预训练模型如 CLIP的开放语义从而具备 zero-shot / 开放词表能力。研究背景与动机3D 理解长期受限于标注数据稀缺与类别封闭——每换一个任务就要重新采集并标注点云成本极高。随着 CLIP 等视觉-语言模型在开放词汇识别上展现出强大泛化一个自然的想法是把 3D 表征对齐到 CLIP 已对齐的图文空间让 3D 模型借用图文模型的开放语义免去逐任务标注。当前现状这一方向已形成「冻结大模型 训练轻量 3D 编码器」的主流范式——PointCLIP 通过点云投影成深度图复用 CLIP 视觉编码器「绕道」获取语义ULIP 则更彻底冻结 CLIP 当「老师」、直接训练 3D 编码器对齐到图文空间在 zero-shot 3D 分类上大幅领先。但这类方法的语言模态普遍来自 CAD 模型 metadata 套 prompt 模板的短描述本质是人工标注。本文旨在解决的问题ULIP 式对齐存在一个被掩盖的数据瓶颈其语言模态有三大核心 gap不可扩展依赖数据集自带的类别 metadata面对无标注的大规模 3D 数据如 Objaverse 真实扫描寸步难行描述单一模板生成的句子千篇一律缺少对物体形态、材质、部件、功能的全面holistic语义质量有噪metadata 常有缺漏或错误且单个模板表达不稳定。ULIP-2 给出了回答用大模型 BLIP-2 对多视角渲染图自动生成 holistic 语言描述仅需 3D 数据本身全程零人工标注因此可扩展到任意大规模 3D 数据集同时把视觉-语言 backbone 放大到 OpenCLIP ViT-G。它在 Objaverse-LVIS zero-shot 分类上达到50.6%top-1比当前 SOTA OpenShape 高3.8%ModelNet40 zero-shot84.7%ScanObjectNN 微调91.5%仅1.4M参数。Figure 1. ULIP-2 预训练框架与下游任务总览。3D 物体经多视角渲染后由 BLIP-2 生成语言描述与 3D 点云、2D 渲染图组成可扩展三元组再通过对齐损失将 3D 编码器拉入 OpenCLIP 已对齐的图文空间并支持 zero-shot 分类、标准分类与 3D 描述生成三类下游任务。流程图分析Figure 2. 可扩展三元组构建流程。给定 3D 物体先多视角渲染 2D 图像再由 BLIP-2 为每张图独立生成 10 条描述用 CLIP 图文相似度排序后取 top-1 作为该物体的语言模态与点云、渲染图组成三元组——全程仅需 3D 数据零人工标注。整条流水线可以拆成三块来理解可扩展三元组构建3D 物体 → 表面采样点云 多视角渲染图 BLIP-2 生成的 holistic 描述CLIP 排序取 top-1。只有点云和渲染图参与训练描述完全自动生成因此可扩展到任意无标注 3D 数据集三模态特征提取OpenCLIP ViT-G 的图像/文本编码器全程冻结仅 3D 编码器可训练三模态特征通过对比损失对齐到 OpenCLIP 已对齐的图文空间对比对齐 下游适配P2I P2T 两个对比损失把 3D 表征拉向图文空间下游支持 zero-shot 3D 分类、标准 3D 分类微调、3D 描述生成接 LLM。关键姿态OpenCLIP 的图像与文本编码器全程冻结整个预训练只更新 3D 编码器参数。这与 ULIP 同一哲学但把「老师」从 SLIP ViT-B 放大到 OpenCLIP ViT-G——既规避了图文空间被小数据破坏的风险又让 3D 表征对齐到更强的语义空间。各模块功能对应总结模块作用是否可训练① 可扩展三元组构建3D 物体多视角渲染 BLIP-2 生成 10 条描述 CLIP 排序取 top-1全程零人工标注否数据预处理② 3D 点云提取从 3D 表面均匀采样点云Objaverse 12 视角 / ShapeNet 30 视角按下游任务取 2k/8k/10k 点否数据预处理③ 3D 点云编码器Point-BERT / PointNeXt 任选提取 3D 表征fP\mathbf{f}^{\mathrm{P}}fP是唯一训练对象④ OpenCLIP 图像编码器ViT-G提取渲染图特征fI\mathbf{f}^{\mathrm{I}}fI提供视觉语义监督冻结⑤ OpenCLIP 文本编码器ViT-G提取 BLIP-2 描述特征fT\mathbf{f}^{\mathrm{T}}fT冻结⑥ 跨模态对比损失P2I P2T 双向对称 InfoNCE 可学习温度τ\tauτ仅对齐 3D↔I 与 3D↔T损失函数无参数流程解析步骤 1可扩展三元组构建全自动、零人工标注ULIP-2 只需 3D 物体本身无需任何 metadata点云PPP从 3D 表面均匀采样Objaverse 渲染 12 视角取点ShapeNet 沿用 30 视角按任务取 2k/8k/10k 点渲染图III用 Blender 等距渲染多视角 2D 图像Objaverse 12 张 / ShapeNet 30 张 RGB 深度图语言TTT每张渲染图经 BLIP-2-opt6.7B 独立生成10 条详细描述再用 CLIP-ViT-Large 图文相似度排序取 top-1作为该物体的语言模态消融 Table 8 证明 top-1 最抗噪、效果最好。步骤 2三模态特征提取对应公式特征定义三个编码器分别提取各自模态特征特征空间已由 OpenCLIP 预对齐图像fIEI(I)\mathbf{f}^{\mathrm{I}} E_{\mathrm{I}}(\mathbf{I})fIEI​(I)EIE_{\mathrm{I}}EI​是冻结的 OpenCLIP ViT-G 图像编码器文本fTET(T)\mathbf{f}^{\mathrm{T}} E_{\mathrm{T}}(\mathbf{T})fTET​(T)ETE_{\mathrm{T}}ET​是冻结的 OpenCLIP ViT-G 文本编码器3DfPEP(P)\mathbf{f}^{\mathrm{P}} E_{\mathrm{P}}(\mathbf{P})fPEP​(P)EPE_{\mathrm{P}}EP​是可训练的 3D backbonePoint-BERT / PointNeXt。步骤 33D↔图像对比对齐对应公式 1用双向对称 InfoNCE 把 3D 特征拉向图像特征正样本对同物体的 3D-图像拉近负样本对跨物体推远温度τ\tauτ可学习。步骤 43D↔文本对比对齐 总目标对应公式 2、3同样用双向对称 InfoNCE 对齐 3D 与文本最终目标只优化 3D 编码器使 P2I P2T 两个损失之和最小公式 3。关键图像-文本对齐由 OpenCLIP 预先固定不更新因此只存在 2 个损失而非 ULIP 的 3 对对齐。步骤 5下游任务zero-shot 3D 分类直接计算 3D 特征与候选类别文本特征距离最小者胜无需微调标准 3D 分类用预训练 3D 编码器初始化在 ScanObjectNN / ModelNet40 微调3D 描述生成把预训练 3D 编码器接入冻结 LLM 的 X-InstructBLIP 框架实现 3D→language 生成。创新点分析1. 全自动可扩展三元组范式核心贡献ULIP-2 最根本的创新是把语言模态的来源从人工标注 metadata换成大模型自动生成。ULIP 依赖 CAD 模型的类别名套 prompt 模板本质上仍需人工标注且描述单一ULIP-2 只需 3D 物体本身由 BLIP-2 生成 holistic 多视角描述因此能扩展到 Objaverse 这类无标注的真实大规模 3D 数据。消融 Table 5 证明仅把语言模态从 manual 换成 BLIP-2 top-1ModelNet40 zero-shot 就从60.4% → 69.7%top-1——数据质量的提升立竿见影。2. 大模型知识蒸馏进语言模态BLIP-2 在海量图文对上预训练其生成的描述浓缩了大规模图文知识比模板句子语义更丰富涵盖形态、材质、功能、部件关系。论文指出这些描述encapsulate knowledge from a vast amount of language and image data直接丰富了 3D 形状描述的语义密度从而强化语言-3D 对齐。Table 6 进一步显示BLIP-269.7%优于更早的 BLIP67.7%说明多模态模型越强ULIP-2 越好——方法随大模型进步而增益。3. 多视角聚合 信息完整性ULIP-2 为每个 3D 物体渲染多视角图像并分别生成描述用视角多样性换取语义完整性。Figure 2 展示了这一机制消融 Table 7 显示视角数从 1 增至 30ModelNet40 top-1 从54.8% → 69.7%证明多样的 holistic 视角描述显著裨益 3D 表征学习。这呼应了 ULIP 用多视角渲染但 ULIP-2 把「视角」升级为「视角 自动描述」。4. 极简框架 backbone scaling 仍超 SOTAULIP-2 框架比 ULIP 更简单仅 2 个对齐损失、不更新图文空间却因更强 backbone 与更好数据全面超越基线Objaverse-LVIS zero-shot50.6%比当前 SOTA OpenShape46.8%高3.8%且用的预训练数据集更少Table 1。Table 9 显示放大 OpenCLIP 到 ViT-G 后 Objaverse-LVIS 从 28.3%→35.0%3D 编码器在 ~32.5M 参数处饱和——简单框架 放大 teacher 即登顶。重要公式分析ULIP-2 的 3 个公式刻画了「特征提取 → 双向对比对齐 → 优化」的完整逻辑链。与 ULIP 的 3 对对齐I-S / I-P / P-S不同ULIP-2只对齐3D → 已冻结的 I 与 T因此只有 2 个损失图文对齐由 OpenCLIP 预先固定。公式 (1)3D↔图像对比损失P2ILP2I−12∑ilog⁡exp⁡(fiPfiI/τ)∑jexp⁡(fiPfjI/τ)log⁡exp⁡(fiPfiI/τ)∑jexp⁡(fjPfiI/τ),(1)\mathcal{L}_{\mathrm{P2I}} - \frac{1}{2} \sum_{i} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{j}^{\mathrm{I}} / \tau)} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{j}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{I}} / \tau)},\tag{1}LP2I​−21​i∑​log∑j​exp(fiP​fjI​/τ)exp(fiP​fiI​/τ)​log∑j​exp(fjP​fiI​/τ)exp(fiP​fiI​/τ)​,(1)其中i,ji,ji,j为 batch 内采样索引τ\tauτ为可学习温度。双向对称第一项是「以 3D 为锚点」拉开与其他图像的距离第二项「以图像为锚点」拉开与其他 3D 的距离——保证两模态互相对齐而非单向依赖。公式 (2)3D↔文本对比损失P2TLP2T−12∑ilog⁡exp⁡(fiPfiT/τ)∑jexp⁡(fiPfjT/τ)log⁡exp⁡(fiPfiT/τ)∑jexp⁡(fjPfiT/τ).(2)\mathcal{L}_{\mathrm{P2T}} - \frac{1}{2} \sum_{i} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf{f}_{i}^{\mathrm{T}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf f_{j}^{\mathrm{T}} / \tau)} \log \frac{\exp(\mathbf{f}_{i}^{\mathrm{P}} \mathbf f_{i}^{\mathrm{T}} / \tau)}{\sum_{j} \exp(\mathbf{f}_{j}^{\mathrm{P}} \mathbf f_{i}^{\mathrm{T}} / \tau)}.\tag{2}LP2T​−21​i∑​log∑j​exp(fiP​fjT​/τ)exp(fiP​fiT​/τ)​log∑j​exp(fjP​fiT​/τ)exp(fiP​fiT​/τ)​.(2)结构与 P2I 完全对称只是把图像特征换成文本特征。两个损失共用同一温度τ\tauτ。公式 (3)总训练目标关键设计min⁡EPLP2ILP2T.(3)\min_{E_{\mathrm{P}}} \mathcal{L}_{\mathrm{P2I}} \mathcal{L}_{\mathrm{P2T}}.\tag{3}EP​min​LP2I​LP2T​.(3)最终只优化 3D 编码器EPE_{\mathrm{P}}EP​。关键设计只优化 3D 编码器图像/文本编码器冻结图文对齐空间不被小数据破坏规避 ULIP 中α0\alpha0α0防灾难性遗忘的同一考量但这里更彻底——根本不计算 I-T 对齐损失仅 2 个损失相比 ULIP 的 3 对 6 项对比ULIP-2 只用 P2I P2T框架更简洁、训练更稳定实际效果3D 编码器被单向「拉」入 OpenCLIP 已对齐的图文空间老师ViT-G不动学生3D 编码器靠拢。论文总结贡献回顾全自动可扩展的 3D 多模态预训练仅用 3D 数据 BLIP-2 自动生成描述消除人工标注瓶颈可扩展到 Objaverse 等大规模真实 3D 数据大模型 holistic 描述显著提升对齐质量BLIP-2 浓缩的图文知识让语言-3D 对齐更紧同数据下比 ULIP 高13.8%~24.9%Objaverse-LVIS top-1极简框架 放大 backbone 登顶 SOTAObjaverse-LVIS zero-shot50.6%3.8% over OpenShapeScanObjectNN91.5%仅 1.4M 参数发布 ULIP-Objaverse / ULIP-ShapeNet 三元组数据集并拓展 3D→language 生成新下游CIDEr28.3%。实验结果精华实验关键数字含义Objaverse-LVIS zero-shotULIP-250.6%vs OpenShape 46.8%3.8最简框架超当前 SOTA且用更少预训练数据ModelNet40 zero-shot84.7%top-1开放词表分类强ScanObjectNN 微调PointNeXt91.5%1.4M参数轻量模型刷新记录3D captioning (CIDEr)ULIP 132.2 → ULIP-2160.528.33D→language 生成能力显著增强同数据 vs ULIPObjaverse-LVIS 13.8~24.9%top-1描述质量 scaling 的增益来源Figure 3. 基于 X-InstructBLIP 的 3D-to-language 多模态生成。ULIP-2 预训练的 3D 编码器接入冻结 LLM 后能为 3D 形状生成更准确、更细致的语言描述。与前序论文关联ULIP治「如何对齐空间」→ ULIP-2 治「如何造可扩展数据」前者是治标借 SLIP 对齐框架 模板描述后者是治本用大模型自动造 holistic 描述破解数据瓶颈ULIPmetadata prompt 模板描述需人工标注描述单一ULIP-2BLIP-2 自动生成 holistic 描述零人工标注可扩展PointCLIP更遥远的「绕道」——把点云投影成深度图复用 CLIP3D 表征未学到语义ULIP/ULIP-2 是「直道」对齐且 ULIP-2 把直道的数据供给自动化PointNet / PointNet / Point-BERT / PointNeXt3D 编码器底座继承——ULIP-2 直接用 Point-BERT / PointNeXt 当 backbone验证「冻结大模型 训轻量 3D 编码器」范式的通用性演进逻辑从「借 2D 模型」(PointCLIP) →「对齐到 2D 空间」(ULIP) →「自动化造数据喂养对齐」(ULIP-2)一步步把 3D 多模态从巧思走向可工业级扩展。

相关新闻

面试说话总是没有很好的逻辑性

面试说话总是没有很好的逻辑性

总是会有很多重复的连接,比如“然后 就是 ” 我感觉本质上是因为脑子转不过弯来 已经到怀疑自己智商的程度。 以至于非常惧怕面试,惧怕需要面试的一切。我也是这样的~我超级害怕面试我是一个超级大i人。我第一次第二次面试前超级焦虑面试的时…

2026/7/21 6:36:26阅读更多 →
Obsidian Full Calendar插件终极指南:在笔记中构建你的智能日程系统

Obsidian Full Calendar插件终极指南:在笔记中构建你的智能日程系统

Obsidian Full Calendar插件终极指南:在笔记中构建你的智能日程系统 【免费下载链接】obsidian-full-calendar Keep events and manage your calendar alongside all your other notes in your Obsidian Vault. 项目地址: https://gitcode.com/gh_mirrors/obs/obs…

2026/7/21 5:59:42阅读更多 →
政务多终端协同方案:MultiKit 跨窗口数据同步政务一体机实践

政务多终端协同方案:MultiKit 跨窗口数据同步政务一体机实践

一、政务场景痛点与方案定位 1.1 政务一体机核心业务场景 政务大厅自助一体机(折叠2in1、鸿蒙PC、立式触控屏)典型协同链路: 群众手机采集材料:身份证、申请表、证照通过碰一碰上传至政务一体机表单;平行视界双窗口并行…

2026/7/19 22:24:50阅读更多 →
计算机毕业设计之基于PHP的个人网站的设计与实现

计算机毕业设计之基于PHP的个人网站的设计与实现

如今,在科学技术飞速发展的情况下,信息化的时代也已因为计算机的出现而来临,信息化也已经影响到了社会上的各个方面。它可以为人们提供许多便利之处,可以大大提高人们的工作效率。随着计算机技术的发展的普及,各个领域…

2026/7/21 7:04:58阅读更多 →
PowerBI数据准备—获取Sharepoint/Onedrive上的Excel

PowerBI数据准备—获取Sharepoint/Onedrive上的Excel

商业版的SharePoint和OneDrive是支持发布后&#xff0c;云端自动刷新 1、获取访问链接 ①-网页OneDrive 复制路径&#xff08;推荐&#xff09; 浏览器打开 OneDrive 商业版&#xff08;https://<公司>-my.sharepoint.com&#xff09; 找到目标 Excel &#xff0c;点…

2026/7/21 7:04:58阅读更多 →
计算机毕业设计之jsp作业管理系统

计算机毕业设计之jsp作业管理系统

随着信息技术和网络技术的飞速发展&#xff0c;人类已进入全新信息化时代&#xff0c;传统管理技术已无法高效&#xff0c;便捷地管理信息。为了迎合时代需求&#xff0c;优化管理效率&#xff0c;各种各样的管理系统应运而生&#xff0c;各行各业相继进入信息管理时代&#xf…

2026/7/21 7:04:58阅读更多 →
华为手机恢复出厂设置全指南:场景、操作与数据备份

华为手机恢复出厂设置全指南:场景、操作与数据备份

1. 华为手机恢复出厂设置的必要场景恢复出厂设置这个操作&#xff0c;对于华为手机用户来说就像给房子做一次彻底的大扫除。我经手过上百台华为设备的系统重置&#xff0c;发现用户主要在以下三种情况下会用到这个功能&#xff1a;第一种是手机准备转手出售或赠与他人时。去年帮…

2026/7/21 7:04:58阅读更多 →
RTS游戏大规模单位寻路方案:Flow Field流场寻路原理与C#实现详解

RTS游戏大规模单位寻路方案:Flow Field流场寻路原理与C#实现详解

1. 项目概述&#xff1a;当RTS遇上Flow Field 如果你做过或者玩过像《星际争霸》、《帝国时代》这类即时战略游戏&#xff0c;肯定对一个问题印象深刻&#xff1a;如何让成百上千个单位&#xff0c;在复杂的地图上&#xff0c;既快速又智能地移动&#xff0c;同时避免它们挤成一…

2026/7/21 7:04:58阅读更多 →
LangChain与LangGraph对比:复杂AI工作流开发指南

LangChain与LangGraph对比:复杂AI工作流开发指南

1. 为什么LangChain之后还需要LangGraph&#xff1f;当开发者第一次接触LangChain时&#xff0c;往往会被其强大的功能所震撼——它几乎解决了LLM应用开发中的所有基础问题&#xff1a;模型集成、文档加载、记忆管理、工具调用等。但当我们真正开始构建复杂的生产级AI应用时&am…

2026/7/21 7:02:58阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中&#xff0c;我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源&#xff0c;还是配置文件、证书等&#xff0c;都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下&#xff0c;但这…

2026/7/21 0:51:49阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP&#xff08;轻量级目录访问协议&#xff09;作为企业级身份认证的黄金标准&#xff0c;已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时&#xff0c;发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/21 0:51:49阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击&#xff1a; https://intelliparadigm.com 第一章&#xff1a;AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”&#xff0c;而是以可解释、可审计、可迭代的方式&#xff0c;赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/21 0:51:49阅读更多 →
Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

Windows+macOS 通用 OpenClaw 部署流程,内置依赖一键启动智能桌面助手

&#x1f4cc;教程适配&#xff1a;OpenClaw v2.7.9 | 兼容 Windows10/11、macOS 双系统 &#x1f4d6;前言 当下各类本地 AI 工具层出不穷&#xff0c;多数产品仅能完成文字问答交互&#xff0c;很难直接操控电脑执行实际操作。OpenClaw&#xff0c;业内常称小龙虾 AI&#…

2026/7/21 0:01:46阅读更多 →
Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

Codex 接入后 Bug 反增?复盘从个人演示到团队协作的“流程陷阱”

聊《一次Codex项目复盘&#xff0c;问题最后出在流程而不是模型》之前&#xff0c;先说一句实在的&#xff1a;别急着背概念&#xff0c;先看它在真实项目里到底解决什么问题。摘要先把这篇文章的目标说清楚&#xff1a;看完之后&#xff0c;你应该能判断这件事值不值得做&…

2026/7/21 0:01:46阅读更多 →
手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

手把手搓一个五子棋游戏,零代码也能当“游戏开发者”

大家好&#xff0c;还是我。前几期带大家做了心情日记本和可视化大屏&#xff0c;后台有朋友留言&#xff1a;“能不能教点好玩的&#xff1f;我想做游戏&#xff0c;但一行代码都不会。”行&#xff0c;这期就安排。今天的目标&#xff1a;从零做一个五子棋游戏。 带AI对战、三…

2026/7/21 0:03:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时&#xff0c;发现推理速度只有可怜的 1-2 FPS&#xff0c;而别人的演示视频却能跑到 30 FPS 以上&#xff0c;那么问题很可能不在模型本身&#xff0c;而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后&#xff0c;会直接使用官方示例…

2026/7/20 22:51:39阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一&#xff1a;为什么你需要了解 Coze 和 Dify&#xff1f;如果你对 AI 应用开发感兴趣&#xff0c;但一看到“大模型”、“智能体”、“工作流”这些词就头疼&#xff0c;觉得门槛太高&#xff0c;那这篇文章就是为你准备的。很多开发者&#xff0c;包括我自己&#…

2026/7/20 18:51:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会&#xff1a;配图一直是个让人头疼的问题。2026年&#xff0c;AI生图工具已经非常成熟了&#xff0c;但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1&#xff1a;速度之王2026年6月11日&#xff0c…

2026/7/20 18:51:18阅读更多 →