向量数据库实战:选型、调优与落地~系列文章18:百万级向量数据的写入优化:批量导入、增量更新的最佳实践
百万级向量数据的写入优化批量导入、增量更新的最佳实践 本文是《向量数据库实战选型、调优与落地》专栏第 18 篇⏱️阅读时间约 12 分钟 开篇写入性能为什么重要很多团队在搭建向量数据库时把精力都放在了查询优化上——却忽略了写入性能同样关键 首次数据导入百万条数据写入要多久增量更新每天新增 10 万条怎么不影响在线查询数据重建换了嵌入模型全量数据要重新向量化怎么高效导入写入慢 上线慢 用户体验差 写入性能基线测试测试环境Milvus 2.48C16GSSD100 万条 1024 维向量写入方式速度总耗时CPU内存逐条写入2k/s8.3 min15%0.5GBbatch10012k/s1.4 min35%1.2GBbatch100025k/s40s⚡70%4GBbatch500024k/s42s85%12GB并发 batch1000×480k/s12.5s95%8GB结论并发批量写入比逐条写入快 40 倍️ 全量导入最佳实践方案一标准批量导入importtimeimportnumpyasnpfrompymilvusimportCollectiondefbulk_insert(collection,texts,embeddings,batch_size1000):标准批量导入totallen(texts)start_timetime.time()foriinrange(0,total,batch_size):batch_textstexts[i:ibatch_size]batch_embeddingsembeddings[i:ibatch_size]collection.insert([batch_texts,batch_embeddings])if(i//batch_size)%100:progressmin(ibatch_size,total)/total*100elapsedtime.time()-start_time speedprogress*total/100/elapsedprint(f进度:{progress:.1f}%, 速度:{speed:.0f}条/秒)elapsedtime.time()-start_timeprint(f导入完成总耗时:{elapsed:.1f}s, 平均速度:{total/elapsed:.0f}条/秒)# 使用bulk_insert(collection,all_texts,all_embeddings,batch_size1000)方案二并发批量导入importconcurrent.futuresfrompymilvusimportCollectiondefconcurrent_insert(collection,data,batch_size1000,max_workers4):并发批量导入batches[]foriinrange(0,len(data),batch_size):batches.append(data[i:ibatch_size])total_written0start_timetime.time()withconcurrent.futures.ThreadPoolExecutor(max_workersmax_workers)asexecutor:futures[]forbatchinbatches:texts[item[text]foriteminbatch]embeddings[item[embedding]foriteminbatch]futureexecutor.submit(collection.insert,[texts,embeddings])futures.append(future)forfutureinconcurrent.futures.as_completed(futures):resultfuture.result()total_writtenresult.insert_count elapsedtime.time()-start_timeprint(f并发导入完成总耗时:{elapsed:.1f}s)returntotal_written方案三Bulk Insert文件导入# 对于超大数据集使用文件导入更高效importjson# Step 1: 准备 JSON 文件defprepare_bulk_files(data,output_dir,file_size100000):将数据分成多个 JSON 文件foriinrange(0,len(data),file_size):batchdata[i:ifile_size]file_pathf{output_dir}/batch_{i//file_size}.jsonrows[]foriteminbatch:rows.append({text:item[text],embedding:item[embedding]})withopen(file_path,w)asf:json.dump({rows:rows},f)# Step 2: 通过 Milvus Bulk Insert API 导入frompymilvusimportutility# 将文件上传到 MinIO或指定存储# ...# 触发 Bulk Inserttask_idsutility.do_bulk_insert(collection_nameknowledge_base,files[batch_0.json,batch_1.json,batch_2.json])# 监控进度fortask_idintask_ids:stateutility.get_bulk_insert_state(task_id)print(f任务{task_id}:{state.state})文件导入 vs API 导入对比项API 导入文件导入Bulk Insert适合数据量 1000 万 1000 万✅速度25-80k/s100-500k/s⚡内存占用较高较低灵活性高可实时低批量操作断点续传需自己实现自动支持 增量更新策略方案一直接 Upsert# Milvus 支持 Upsert有则更新无则插入collection.upsert([[新文档内容],[new_embedding]])方案二分区增量# 使用分区管理增量数据frompymilvusimportCollection# 按日期创建分区collection.create_partition(data_2025_01)collection.create_partition(data_2025_02)collection.create_partition(data_2025_03)# 新数据写入最新分区partitioncollection.partition(data_2025_03)partition.insert([new_texts,new_embeddings])# 查询时搜索所有分区collection.load()# 加载所有分区resultscollection.search(...)方案三双 Buffer 切换┌─────────────────────────────────────────────────────────┐ │ 双 Buffer 增量更新 │ ├─────────────────────────────────────────────────────────┤ │ │ │ 在线 Buffer A当前服务 │ │ ┌──────────────────────────────────────┐ │ │ │ 存量数据 已索引 │ │ │ │ → 正常提供查询服务 │ │ │ └──────────────────────────────────────┘ │ │ │ │ 离线 Buffer B构建中 │ │ ┌──────────────────────────────────────┐ │ │ │ 增量数据写入 索引构建 │ │ │ │ → 不影响 Buffer A 的查询 │ │ │ └──────────────────────────────────────┘ │ │ │ │ 切换B 构建完成后原子切换到 B 提供服务 │ │ A 变成离线 Buffer接收下一批增量 │ │ │ └─────────────────────────────────────────────────────────┘⚠️ 写入优化的常见坑坑 1写入时不建索引# ❌ 错误边写边建索引forbatchinbatches:collection.insert(batch)collection.create_index(...)# 每次写入都建索引极慢# ✅ 正确先写完最后建一次索引forbatchinbatches:collection.insert(batch)# 全部写完后建索引collection.create_index(embedding,index_params)坑 2忽略 Flush# Milvus 写入后需要 Flush 才能持久化collection.insert(data)collection.flush()# 确保数据持久化# 批量导入后统一 Flushforbatchinbatches:collection.insert(batch)collection.flush()# 最后统一 Flush 一次坑 3内存溢出# ❌ 错误一次性加载所有数据到内存all_dataload_all_data()# 100GB 数据直接 OOM# ✅ 正确流式读取defstream_data(file_path,batch_size1000):batch[]withopen(file_path)asf:forlineinf:batch.append(json.loads(line))iflen(batch)batch_size:yieldbatch batch[]ifbatch:yieldbatchforbatchinstream_data(large_file.json):collection.insert(batch) 写入性能优化 Checklist优化项推荐值效果batch_size1000比逐条快 12x并发数4单机/ 8集群比单线程快 3-4x先写后建索引全部写完再建避免重复建索引Bulk Insert 1000万条数据比 API 快 5-10x流式读取大文件避免 OOM统一 Flush最后一次性减少 IO 次数 本篇核心要点回顾要点说明批量写入batch_size1000 是最佳平衡点并发写入单机 4 线程集群 8 线程超大数据用 Bulk Insert文件导入增量更新Upsert / 分区 / 双 Buffer常见坑先写后建索引、统一 Flush、流式读取下篇预告《向量数据库 RAG 融合实战构建企业级知识库的完整链路 》有问题欢迎评论区讨论觉得有用请点赞收藏 作者高炉炼铁智能化技术研究者专注钢铁冶金与人工智能 交叉领域。 如果觉得有帮助请点赞、收藏、转发版权归作者所有未经许可请勿抄袭套用商用(或其它具有利益性行为)。 关注专栏不错过后续精彩内容

相关新闻

Unity团结引擎开发OpenHarmony Next应用:从零搭建环境到真机调试全攻略

Unity团结引擎开发OpenHarmony Next应用:从零搭建环境到真机调试全攻略

1. 项目概述:为什么需要这份攻略?如果你是一名Unity开发者,最近肯定没少听到“鸿蒙”和“团结引擎”这两个词。当Unity官方宣布推出专为OpenHarmony(开源鸿蒙)适配的“团结引擎”时,整个开发者社区都兴奋了…

2026/7/25 16:52:13阅读更多 →
长期使用中观察到的API密钥管理与访问控制功能实用性

长期使用中观察到的API密钥管理与访问控制功能实用性

长期使用中观察到的API密钥管理与访问控制功能实用性 在长期、多项目的开发与运维实践中,大模型API的接入与管理逐渐从单纯的技术实现,演变为一项需要精细治理的工程任务。其中,API密钥的安全管理与访问控制是保障项目稳定、控制成本、防范风…

2026/7/25 16:52:13阅读更多 →
边缘计算与AI融合:实时目标检测的优化实践

边缘计算与AI融合:实时目标检测的优化实践

1. 边缘计算与AI原生的技术融合趋势在智能摄像头、工业质检机器人、自动驾驶等场景中,传统云计算架构的延迟和带宽限制日益凸显。去年参与某智慧工厂项目时,产线质检系统因网络抖动导致200ms的检测延迟,直接影响了流水线节拍。这促使我们转向…

2026/7/25 16:52:13阅读更多 →
XYZ轴机械模组设计:从需求分析到工程落地的系统方法

XYZ轴机械模组设计:从需求分析到工程落地的系统方法

1. 从“会画图”到“能设计”,先搞清楚XYZ轴模组到底要解决什么 很多人一上来就打开软件画图,画了半天发现装配不上,或者运动起来干涉,根本原因在于没想清楚XYZ轴机械模组设计的核心目标。它不是一个简单的“画三个能动的轴”,而是一个 集成了定位精度、运动平稳性、负载…

2026/7/25 21:16:56阅读更多 →
Kimi与OpenAI代码生成模型对比:从API集成到生产实践

Kimi与OpenAI代码生成模型对比:从API集成到生产实践

在实际 AI 应用开发和模型选型过程中,技术团队经常需要评估不同模型的编程能力、资源消耗和集成成本。近期,围绕 Kimi 和 OpenAI 系列模型的讨论热度不减,特别是关于算力资源投入、模型编程能力排行以及如何在实际开发环境中调用这些模型的问…

2026/7/25 21:16:56阅读更多 →
Mappedbus高级特性:对象与字节数组消息传递的最佳实践

Mappedbus高级特性:对象与字节数组消息传递的最佳实践

Mappedbus高级特性:对象与字节数组消息传递的最佳实践 【免费下载链接】Mappedbus Mappedbus is a low latency message bus for Java microservices utilizing shared memory. http://mappedbus.io 项目地址: https://gitcode.com/gh_mirrors/ma/Mappedbus …

2026/7/25 21:16:56阅读更多 →
IL2CPP环境下Unity游戏自动翻译失效的深度修复指南

IL2CPP环境下Unity游戏自动翻译失效的深度修复指南

1. 项目概述:当自动翻译在IL2CPP面前“哑火”如果你是一个喜欢玩各种独立游戏或者视觉小说的玩家,那么“XUnity.AutoTranslator”这个名字对你来说一定不陌生。它几乎是Unity引擎游戏实时翻译的“瑞士军刀”,通过Hook游戏内文本渲染流程&…

2026/7/25 21:16:56阅读更多 →
Linux运维学习路径:从零基础到实战部署的五个阶段

Linux运维学习路径:从零基础到实战部署的五个阶段

1. 零基础学Linux运维,到底要学什么、怎么学、学到什么程度?如果你正在考虑进入Linux运维这个领域,或者刚接触Linux,面对海量的命令、概念和教程感到无从下手,这篇文章就是为你准备的。我见过太多新手,一上…

2026/7/25 21:16:56阅读更多 →
如何永久保存微信聊天记录:WeChatMsg完整数据管理指南

如何永久保存微信聊天记录:WeChatMsg完整数据管理指南

如何永久保存微信聊天记录:WeChatMsg完整数据管理指南 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com/GitHub_Trending/we/WeCha…

2026/7/25 21:14:56阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/25 1:01:14阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/25 1:01:14阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/25 1:01:14阅读更多 →
突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存

突破文档下载限制:kill-doc让你看到的都能保存 【免费下载链接】kill-doc 看到经常有小伙伴们需要下载一些免费文档,但是相关网站浏览体验不好各种广告,各种登录验证,需要很多步骤才能下载文档,该脚本就是为了解决您的…

2026/7/25 0:01:16阅读更多 →
C++ string类模拟实现:从深拷贝到内存管理的完整指南

C++ string类模拟实现:从深拷贝到内存管理的完整指南

1. 项目概述:为什么我们要“手撕”string类?在C的学习道路上,尤其是从C语言过渡到C的“初阶”阶段,string类绝对是一个绕不开的核心。标准库里的std::string用起来太方便了,、find、substr,几个操作符和函数…

2026/7/25 0:01:16阅读更多 →
三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

三角洲寻宝鼠工具:高效文件搜索与资源管理实战指南

1. 先搞清楚“三角洲寻宝鼠”到底是什么工具从名称来看,“三角洲寻宝鼠”更像是一个资源查找或文件检索类工具,而不是游戏或娱乐软件。这类工具的核心价值在于帮助用户快速定位特定资源,比如文档、图片、压缩包或特定格式的文件。如果你经常需…

2026/7/25 0:01:16阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/24 23:01:03阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/25 19:03:04阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/25 19:03:04阅读更多 →