《面向地面图像与卫星图像配准的空间智能技术》-CVPR-2026
论文英文题目WRIVINDER: Towards Spatial Intelligence for Geo-locating Ground Images onto Satellite Imagery论文发表期刊/会议CVPR论文发表年份2026年1. 论文核心内容概括解决的问题论文解决了在GPS不可信或存在巨大视角差异的情况下如何准确地将地面图像与地理注册的卫星地图进行对齐的问题。采用的方法提出了Wrivinder框架。这是一种零样本Zero-shot、几何驱动的框架通过聚合多张地面照片重建一致的3D场景并将其与顶视卫星图像对齐。适用范围适用于自主导航、灾难响应、大规模地图绘制以及在GPS受限环境下的态势感知。它不依赖配对的训练数据因此在校园、建筑工地或乡村等缺乏标注数据的场景中表现稳健。2. 数据集情况论文发布了MC-Sat数据集这是首个链接多视图地面图像、SfM/3DGS 重建结果与地理注册卫星背景的数据集。数据来源集成了来自 ULTRAA、VisymScenes、ACC-NVS1 和 JHU-Ames 的地面图像。卫星数据采用了 USDA NAIP分辨率 0.6–1.0 米/像素和 ESRI World Imagery 底图。规模与多样性包含 15 个多视图场景共计约20,000 张地面图像。场景类型图像密度型Image Density图像集中在小型区域如建筑入口用于评估微观几何对齐。重建区域型Reconstructed Area跨越较大空间如校园用于评估远距离重建和对齐性能。3. 主要技术路线1总体概括Wrivinder 弃用了传统的检索范式利用几何重建和度量对齐来推断相机的物理位置。其核心思路是将多视图地面图像重建为 3D 场景生成天顶视图Zenith-view渲染图并将其与卫星图像直接匹配。2分项介绍3D 重建 (SfM 3DGS)输入无序地面图像集。流程首先使用 SfM 求解器如 HLOCCOLMAP估计相机内参、外参和稀疏点云随后使用3D 高斯泼溅3D Gaussian Splatting, 3DGS优化几何与外观。输出稠密且写实的 3D 场景模型。优势相比稀疏点云3DGS 能生成高质量的渲染图减少浮动伪影。天顶视角提取 (Zenith Viewpoint Extraction)输入稀疏 SfM 点云和语义掩码。流程利用 PCA 分析点云几何以确定垂直轴同时使用 Mask2Former 提取地面语义信息如道路、草地拟合地面平面。输出一致的顶视天顶视角参数。优势通过语义增强能更准确地识别可通行地面区域。度量映射器 (Metric Mapper)输入单目深度先验来自 DepthPro 或 PatchFusion。流程估计 SfM 深度与物理深度之间的全局尺度因数 \(s\)计算重建场景的物理足迹宽 \(W_m\)高 \(H_m\)。输出带有物理度量信息的渲染图模板。深度模板匹配器 (Deep Template Matcher, DTM)输入天顶渲染图与卫星图像。流程使用自监督的 ResNet-18 孪生网络预测图像间的 IoU从而确定天顶图在卫星地图中的精确位置。优势测试时自监督无需地面-卫星训练对即可实现稳健配准。地理定位 (Geolocator)流程将匹配得到的像素级对应点反向投影回 3DGS 和 SfM 模型。输出所有地面相机的 GPS 坐标经度、纬度、高度。3损失函数/优化目标DTM 训练采用自监督方式从卫星图像中提取伪地面真值块Pseudo GT Patch Pairs其中一个块经过高斯模糊和亮度扰动以模拟 3DGS 渲染的外观监督网络学习预测两者的IoU。4. 实验结果概括1评价指标平均地理定位均方根误差 (Mean Geolocation RMSE)预测坐标与真值间的平均哈弗斯距离。67% 分位地理定位误差 (67th Percentile RMSE)更稳健的异常值衡量指标。中心点地理定位误差 (Centroid Error)预测中心与真值中心间的距离。运行时间 (Run Time)以分钟为单位的计算开销。2评测结果总体表现在零样本实验中Wrivinder 在致密和大型场景中均实现了亚 30 米sub-30 m的定位精度。性能瓶颈在大范围场景中由于地面无法观测到屋顶等结构渲染图中会出现空隙导致误差升高。运行时间与图像数量呈线性相关SfM 阶段耗时最长。5. 图表描述与解读图1Wrivinder是一个零样本、几何驱动的空间智能框架旨在解决在 GPS 不可靠或存在巨大视角差异的情况下如何将多张无序地面图像精确配准到地理注册卫星地图上的难题。该框架通过SfM稀疏重建与3D 高斯泼溅稠密建模聚合场景信息利用语义感知和单目深度先验估计物理度量尺度从而生成与卫星视角一致的天顶视角渲染图。随后系统采用自监督的深度模板匹配器将渲染图与卫星背景对齐最终实现对地面相机位置的物理坐标推断。配合发布的涵盖 2 万张图像的MC-Sat 数据集Wrivinder 在无需配对训练数据的情况下于校园、工地等复杂户外场景中实现了亚 30 米的定位精度为大规模地图绘制和自主导航提供了稳健的技术路线。图2 展示了论文所提出的MC-Sat 数据集的场景示例通过三个子图直观呈现了地面图像与地理注册卫星切片之间的关联其中(a)展示了来自ULTRAA数据集的场景(b)展示了来自VisymScenes数据集的场景(c)展示了来自JHU AMES数据集的场景。该图体现了该数据集如何将多视图拍摄的地面照片与中心位置的高分辨率卫星底图链接在一起涵盖了不同的环境条件、传感器类型和地理区域为评估零样本及几何驱动的地面与卫星图像配准技术提供了基础。图3 详细展示了Wrivinder这一零样本、免训练系统的总体架构描绘了将地面图像定位到卫星地图上的五个核心技术阶段该流程始于对无序地面图像进行SfM稀疏重建并结合3D 高斯泼溅3DGS生成稠密场景模型4.1随后利用天顶视角提取器确定垂直方向并生成顶视渲染图4.2同时由度量映射器结合单目深度先验恢复物理尺度以确定渲染图的实际尺寸4.3。接着系统通过自监督的深度模板匹配器DTM在测试时将渲染图与地理注册的卫星图像进行精确对齐4.4最后利用高斯泼溅与相机地理定位器将匹配结果反向投影从而输出每个地面相机的经度、纬度和高度坐标。图4 集中展示了Wrivinder框架在执行过程中的关键中间产物直观地呈现了从地面视角到度量天顶模板的转化流程该图包含了输入端的(a) 原始地面图像以及通过 monocular 模型估计的(b) 度量深度图和用于识别地表结构的(c) 语义图。这些信息与(d) SfM 稀疏点云结合生成了能够区分地面与物体的(e) 语义化点云PCD并最终输出带有明确物理尺寸标注如 20m x 10m的(f) 度量天顶渲染图为后续与卫星地图的自监督对齐提供了具备几何一致性和物理比例的高保真 3DGS 模板。图5 展示了多个MC-Sat场景的卫星图像与Wrivinder生成的渲染图对照组具体包括(a) MUTC A09、(b) APL Back Door、(c) siteSTR0059和(d) MUTC A10四个示例。在每组对比中左侧为卫星视图其中散布的蓝色点标示了地面相机的真实地理位置Ground-truth右侧则是对应的3DGS 天顶视角渲染图。该图直观地揭示了重建质量对定位精度的影响明确指出渲染图中出现的空隙、模糊或缺失结构通常由于从地面无法观测到屋顶等高处表面所致会增加对齐的歧义性这也是导致某些场景出现较高定位误差的主要原因。表1 概述了集成到MC-Sat数据集中的原始地面图像源及其核心统计数据详细列出了包括ULTRAA3个场景1,028张地面图像、VisymScenes149个场景25.8万张地面图像、ACC-NVS16个场景14.8万张地面与机载图像和JHU-Ames1个场景1,717张地面与机载图像在内的四个子数据集的具体规模和图像类型。该表反映了 MC-Sat 如何通过整合这些具有地理和几何多样性的多源数据并将其与正射校正的卫星图像如 NAIP 和 ESRI进行配对从而构建起一个涵盖广泛环境条件、传感器类型和拍摄几何的基准测试集用以支持对零样本、几何驱动定位方法的系统评估。表2 详尽列出了Wrivinder框架在MC-Sat基准测试集的 15 个场景下的量化评估结果通过记录每个场景的图像数量、运行时间、反映 SfM 对齐质量的 World2Model RMSE以及包括平均地理定位均方根误差Mean Geolocation RMSE、67% 分位误差和中心点误差在内的多项关键地理定位指标全面衡量了系统在零样本设置下的性能表现。该表涵盖了来自 ULTRAA、VisymScenes、AMES 和 ACC-NVS 数据集的多种场景数据表明系统在图像密度型场景如 APL 门口精度可达约 1.96 米表现优异而在大规模重建区域则面临更高挑战且运行时间与图像数量大致呈线性相关从而为几何驱动的地面与卫星图像配准技术提供了核心的性能基准。

相关新闻

Cindy安全与隐私保护:开源AI助手如何保障你的数据安全

Cindy安全与隐私保护:开源AI助手如何保障你的数据安全

Cindy安全与隐私保护:开源AI助手如何保障你的数据安全 【免费下载链接】cindy Consider it done. The open-source AI agent that works out of the box 想到,就能做到。开源、开箱即用的 AI Agent。 项目地址: https://gitcode.com/gh_mirrors/cind/…

2026/7/29 22:50:40阅读更多 →
多品种、小批量农业机械生产,首件检验如何更快完成?

多品种、小批量农业机械生产,首件检验如何更快完成?

多型号农业机械提高首件检验效率的关键,是把每个型号的CAD模型、检查位置和检验步骤预先固化为数字化检查项目,首件下线后直接在生产现场完成CAD与实物比对,再将关键尺寸和疑点位置转入精密测量。安宝特拓影农业机械AR视觉质检方案基于Visome…

2026/7/29 22:50:40阅读更多 →
Prometheus数据模型详解:掌握多维度指标监控的秘诀

Prometheus数据模型详解:掌握多维度指标监控的秘诀

Prometheus数据模型详解:掌握多维度指标监控的秘诀 【免费下载链接】docs Prometheus documentation: content and static site generator 项目地址: https://gitcode.com/gh_mirrors/docs21/docs Prometheus作为开源监控系统的佼佼者,其核心优势…

2026/7/29 22:50:40阅读更多 →
ScreenToGif:把屏幕操作变成动图,这款开源小工具为什么成了教程党的标配?

ScreenToGif:把屏幕操作变成动图,这款开源小工具为什么成了教程党的标配?

写教程时文字描述半天,不如一张动图直观;汇报工作时演示操作流程,视频文件太大不方便发送——如果你经常需要"把屏幕上的动作保存下来给别人看",ScreenToGif 可能是你工具箱里效率最高的那一款。 ScreenToGif 是一款免…

2026/7/30 0:10:59阅读更多 →
为什么设计师们都爱用Bebas Neue?这款开源字体如何解决你的排版难题

为什么设计师们都爱用Bebas Neue?这款开源字体如何解决你的排版难题

为什么设计师们都爱用Bebas Neue?这款开源字体如何解决你的排版难题 【免费下载链接】Bebas-Neue Bebas Neue font 项目地址: https://gitcode.com/gh_mirrors/be/Bebas-Neue 你是否曾经在设计海报标题时,为找不到合适的字体而烦恼?或…

2026/7/30 0:10:59阅读更多 →
抖音下载器终极指南:三步免费获取高清无水印视频的完整教程

抖音下载器终极指南:三步免费获取高清无水印视频的完整教程

抖音下载器终极指南:三步免费获取高清无水印视频的完整教程 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback …

2026/7/30 0:10:59阅读更多 →
单片机毕设项目:基于 STM32 的流量参数按键调控预警终端设计,基于传感器采集的嵌入式流量智能管理装置(010401)

单片机毕设项目:基于 STM32 的流量参数按键调控预警终端设计,基于传感器采集的嵌入式流量智能管理装置(010401)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/30 0:10:59阅读更多 →
单片机毕设项目:基于单片机继电器驱动的粉尘超标自动排风装置开发 ,嵌入式 STM32 平台下 PM2.5 监测与声光报警系统设计010301

单片机毕设项目:基于单片机继电器驱动的粉尘超标自动排风装置开发 ,嵌入式 STM32 平台下 PM2.5 监测与声光报警系统设计010301

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/30 0:10:59阅读更多 →
差旅报销自动化率超92%的企业都在用的5个AI引擎(未公开API调用规范泄露版)

差旅报销自动化率超92%的企业都在用的5个AI引擎(未公开API调用规范泄露版)

更多请点击: https://intelliparadigm.com 第一章:差旅报销自动化率超92%的AI引擎全景图 该AI引擎以多模态文档理解为核心,深度融合OCR识别、语义解析、规则引擎与微调大模型(LoRA适配的Qwen2-7B),构建端到…

2026/7/30 0:08:59阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/29 9:47:45阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/29 7:00:19阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/29 7:58:51阅读更多 →
3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 [特殊字符]

3分钟解锁iOS应用自由:TrollInstallerX让你的iPhone摆脱安装限制 🚀 【免费下载链接】TrollInstallerX A TrollStore installer for iOS 14.0 - 16.6.1 项目地址: https://gitcode.com/gh_mirrors/tr/TrollInstallerX 你是否曾经因为iOS系统的严格…

2026/7/30 0:00:58阅读更多 →
[GESP202606 四级] 扫雷

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:00:58阅读更多 →
Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/30 0:00:58阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/29 4:31:51阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/29 14:26:42阅读更多 →