RAG管线四件套:从原始文档到可检索知识
一、概念什么是 RAG 管线四件套把原始文档变成可检索知识需要经过四步原始文档 ──①──→ 标准文档 ──②──→ 文档片段 ──③──→ 嵌入向量 ──④──→ 向量索引 Loader Splitter Embedding VectorStore每一步对应一个组件#组件职责输入输出①Document Loader从数据源加载文档文件路径 / URLlist[Document]②Text Splitter把长文档切成小片段list[Document]list[Document]更短③Embedding Model把文本转成向量strlist[float]④Vector Store存储向量并支持搜索文档 向量相似文档列表四步串起来就是 RAG 的离线索引管线。一句话总结四件套是原始文档 → 可检索知识的 ETL 管线——加载、切分、嵌入、存储每一步都有标准抽象。二、价值为什么需要标准化管线1. 数据源千差万别PDF、Word、Markdown、HTML、Notion、Slack、数据库……格式各异。Document Loader 把所有来源统一成Document(page_content, metadata)。2. 长文档必须切分一个 42K 字符的 PDF 超出多数模型的上下文窗口。即使塞进去模型也会注意力涣散。切分让每个片段独立可检索、大小可控。3. 语义搜索需要向量关键词搜索无法理解同义词。退货和退换意思相近但词不同。嵌入向量把语义映射到空间距离近义词自然靠近。4. 向量库是检索的基石有了向量索引才能毫秒级返回与查询最相似的文档片段。不同向量库Chroma、FAISS、Pinecone各有适用场景但接口统一。核心价值四件套把数据接入变成标准化 ETL 管线让你专注业务而非数据格式。三、用法四件套逐一实战① Document Loader加载数据# PDF from langchain_community.document_loaders import PyPDFLoader docs PyPDFLoader(report.pdf).load() # Markdown from langchain_community.document_loaders import UnstructuredMarkdownLoader docs UnstructuredMarkdownLoader(guide.md).load() # 网页 from langchain_community.document_loaders import WebBaseLoader docs WebBaseLoader(https://example.com/faq).load() # 纯文本 from langchain_community.document_loaders import TextLoader docs TextLoader(notes.txt, encodingutf-8).load() # CSV每行一个文档 from langchain_community.document_loaders import CSVLoader docs CSVLoader(data.csv).load()每个 Loader 返回list[Document]Document 有两个核心字段page_content: str — 文本内容metadata: dict — 元数据来源文件名、页码、URL 等② Text Splitter切分文档from langchain_text_splitters import RecursiveCharacterTextSplitter splitter RecursiveCharacterTextSplitter( chunk_size1000, # 每个片段最大 1000 字符 chunk_overlap200, # 相邻片段重叠 200 字符 separators[\n\n, \n, 。, , , , ], # 中文友好 add_start_indexTrue, # 记录每个片段在原文的起始位置 ) chunks splitter.split_documents(docs) print(f原文档: {len(docs)} 个, 切分后: {len(chunks)} 个片段)关键参数chunk_size片段上限。太大→噪声多太小→上下文断裂。经验值 500-1500chunk_overlap重叠区。保证片段边界不丢信息。经验值 chunk_size 的 10-20%separators切分优先级。RecursiveCharacterTextSplitter依次尝试每个分隔符直到片段足够小其他 SplitterSplitter适用场景RecursiveCharacterTextSplitter通用文本推荐默认MarkdownHeaderTextSplitter按标题层级切分 MarkdownPythonCodeTextSplitter按函数/类切分 Python 代码TokenTextSplitter按 token 数切分③ Embedding Model文本转向量from langchain_huggingface import HuggingFaceEmbeddings # 推荐多语言 中文优化 embeddings HuggingFaceEmbeddings( modelBAAI/bge-m3, ) # 嵌入单条文本 vector embeddings.embed_query(退货政策) print(f维度: {len(vector)}) # 通常 768 或 1024 # 批量嵌入 vectors embeddings.embed_documents([退货政策, 换货流程])选型指南模型维度特点安装BAAI/bge-m31024多语言中文优秀langchain-huggingfaceBAAI/bge-small-zh-v1.5512中文专用轻量langchain-huggingfacetext-embedding-3-small1536OpenAI需联网langchain-openai国内用户推荐bge-m3中文效果好、离线可用、免费。④ Vector Store存储 搜索from langchain_chroma import Chroma # 创建 索引一次性 vectorstore Chroma.from_documents( documentschunks, embeddingembeddings, collection_namemy_docs, persist_directory./chroma_db, # 持久化到磁盘 ) # 后续加载不用重新索引 vectorstore Chroma( collection_namemy_docs, embedding_functionembeddings, persist_directory./chroma_db, ) # 相似度搜索 docs vectorstore.similarity_search(退货政策, k3) # 带分数 docs_with_scores vectorstore.similarity_search_with_score(退货政策, k3) for doc, score in docs_with_scores: print(f分数: {score:.4f} | {doc.page_content[:80]})向量库选型向量库特点适用场景Chroma嵌入式零配置支持持久化开发/小规模部署FAISSFacebook 开源纯内存极快大规模内存检索Pinecone全托管云服务生产环境、免运维Milvus开源分布式支持 GPU超大规模生产QdrantRust 实现性能好中大规模生产完整管线从文件到可检索 Agentfrom langchain_community.document_loaders import PyPDFLoader from langchain_text_splitters import RecursiveCharacterTextSplitter from langchain_huggingface import HuggingFaceEmbeddings from langchain_chroma import Chroma from langchain.tools.retriever import create_retriever_tool from langchain.agents import create_agent # ① 加载 docs PyPDFLoader(company_policy.pdf).load() # ② 切分 chunks RecursiveCharacterTextSplitter( chunk_size1000, chunk_overlap200 ).split_documents(docs) # ③ 嵌入 ④ 存储 embeddings HuggingFaceEmbeddings(modelBAAI/bge-m3) vectorstore Chroma.from_documents(chunks, embeddings, persist_directory./db) # 接入 Agent retriever_tool create_retriever_tool( vectorstore.as_retriever(search_kwargs{k: 3}), namesearch_docs, description搜索公司政策文档, ) agent create_agent(deepseek:deepseek-chat, tools[retriever_tool]) result agent.invoke({ messages: [{role: user, content: 公司年假多少天}] })四、原理管线各步的内部机制1. Document Loader 的统一接口所有 Loader 继承BaseLoader实现load()→list[Document]class BaseLoader: def load(self) - list[Document]: ... def lazy_load(self) - Iterator[Document]: ... # 懒加载省内存大文件用lazy_load()避免一次性加载到内存。2. RecursiveCharacterTextSplitter 的递归策略原文: 第一章\n\n第一节\n\n内容A...\n\n第二节\n\n内容B... ↓ 尝试用 \n\n 切分 [第一章, 第一节\n\n内容A..., 第二节\n\n内容B...] ↓ 某段超过 chunk_size? 继续用 \n 切 ↓ 还超过? 用 。 切 ↓ 还超过? 用 切 ↓ 还超过? 按字符强制切递归保证优先在语义边界切分只在必要时才暴力切断。3. Embedding 的向量空间嵌入模型把文本映射到高维空间768/1024 维语义相近的文本在空间中距离近退货政策 ──→ [0.12, -0.34, 0.56, ...] 退换货流程 ──→ [0.11, -0.33, 0.55, ...] ← 距离很近 天气预报 ──→ [-0.45, 0.78, -0.23, ...] ← 距离很远相似度用余弦距离或欧氏距离计算。搜索时就是找查询向量最近的 K 个文档向量。4. Vector Store 的索引结构向量库用近似最近邻ANN算法加速搜索算法原理特点HNSW层级导航小世界图速度快、精度高内存占用大IVF倒排索引 聚类可控精度适合大规模PQ乘积量化压缩省内存精度略降Chroma 默认用 HNSWFAISS 支持 IVF PQPinecone 用自研索引。5. 管线性能优化瓶颈优化方向嵌入计算慢批量嵌入 GPU 加速搜索不够准调整 chunk_size / 换嵌入模型 / 加元数据过滤结果太相似用 MMR 搜索 / 调大 fetch_k中文效果差换中文优化的嵌入模型bge-m3索引更新频繁增量 add_documents()不全量重建小结视角一句话概念原始文档→可检索知识的 ETL 管线加载→切分→嵌入→存储价值标准化数据接入让你专注业务而非格式用法Loader 统一来源、Splitter 控制粒度、Embedding 选中文模型、VectorStore 选合适引擎原理递归切分保语义边界、向量空间做语义搜索、ANN 算法加速检索记住一件事四件套中切分Splitter对最终检索质量影响最大——切得不好后面嵌入再好、向量库再快也白搭。

相关新闻

高斯泼溅技术-从入门到精通

高斯泼溅技术-从入门到精通

自适应密度控制(Adaptive Density Control) 训练从稀疏点云初始化,经过几万步梯度下降,最终得到数百万个高斯体。这中间,高斯体的数量和位置是如何从初始状态演变到最终状态的?答案就是本文的主题——自适…

2026/7/23 22:45:43阅读更多 →
HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

HarmonyOS7 启动优化:冷启动从 3 秒降到 1 秒的 5 个技巧

文章目录前言冷启动 vs 热启动优化 1:延迟加载优化 2:减少 onCreate 逻辑优化 3:预加载优化 4:布局优化优化 5:懒初始化效果对比写在最后前言 我们的 App 上线后第一周,用户反馈最多的不是功能 bug&#x…

2026/7/23 22:45:43阅读更多 →
HarmonyOS7 状态管理全家桶:@State、@Prop、@Link 到底怎么选?

HarmonyOS7 状态管理全家桶:@State、@Prop、@Link 到底怎么选?

文章目录前言为什么状态管理这么头疼三种装饰器对比场景一:父子单向传递(Prop)场景二:父子双向同步(Link)场景三:跨层级传递(Provide Consume)场景四:列表中…

2026/7/23 22:45:43阅读更多 →
三维空间识别技术在危化品库区安全管理中的应用

三维空间识别技术在危化品库区安全管理中的应用

1. 项目背景与核心需求在化工园区、石油炼化等涉及危险化学品存储的场所,库区安全管理一直是重中之重。传统监控手段主要依赖二维平面摄像头和人工巡检,存在监控死角多、报警误报率高、响应滞后等问题。特别是在人员异常停留、未授权进入等场景下&#x…

2026/7/23 23:56:05阅读更多 →
深度观察|2026 阿里 / 1688 代运营公司推荐榜单解析:从流量获取到转化提升,看 GMV 增长实力

深度观察|2026 阿里 / 1688 代运营公司推荐榜单解析:从流量获取到转化提升,看 GMV 增长实力

随着 B2B 电商数字化进程的加速,1688 平台作为国内最大的内贸批发平台,已成为千万工厂和品牌商家布局线上渠道的核心阵地。然而,平台规则持续迭代、流量结构不断变化、运营精细化要求日益提升,让不少传统制造企业和新晋商家面临运…

2026/7/23 23:56:05阅读更多 →
数字孪生 + AI,不只是“好看“,这 4 个场景有了质的突破

数字孪生 + AI,不只是“好看“,这 4 个场景有了质的突破

一个园区数字孪生系统上线一年了,甲方运营负责人跟我说了句实话:"天天看,也不知道有什么用。领导来了打开演示一下,平时基本不登录。"与此同时,隔壁工厂项目组也做了一个数字孪生系统,但他们在上…

2026/7/23 23:56:05阅读更多 →
Cesium初始化优化

Cesium初始化优化

1.imageryProvider:false跳过默认底图2.取消默认地形(按需启用):terrainProvider: undefined3.关闭不需要的部件4.nextTick分布:先渲染空白globa,再加载底图5.添加isReady供父组件感知6.去除默认背景:①开启webgl中alpha的背景透明。②Cesium 场景视觉配置 — 透明背…

2026/7/23 23:56:05阅读更多 →
案例分享:施企云工程物资云×河南恒屹建设

案例分享:施企云工程物资云×河南恒屹建设

一、标杆案例:施企云工程物资云河南恒屹建设工程有限公司 多项目并行、异地管控难度大、材料成本居高不下,是跨区域经营建筑施工企业普遍面临的难题。河南恒屹建设工程有限公司(以下简称“河南恒屹建设”)深耕建筑施工行业多年&am…

2026/7/23 23:56:05阅读更多 →
AI病害识别怎么分级?千寻驰观技术解读

AI病害识别怎么分级?千寻驰观技术解读

AI病害识别分级的难点是把"养护工人的经验判断"变成"可量化、可复现的数据标准"。千寻位置基于千寻驰观智脑慧眼灵控三件套,内置JTG 5210-2018标准的MQI/PQI计算逻辑,实现22种病害实时分类与5mm裂缝感知,像素级面积量化。…

2026/7/23 23:54:05阅读更多 →
Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/23 0:56:31阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/23 0:56:31阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 0:56:31阅读更多 →
Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具

Chitchatter完整指南:免费开源的终极点对点安全聊天工具 【免费下载链接】chitchatter Secure peer-to-peer chat that is serverless, decentralized, and ephemeral 项目地址: https://gitcode.com/gh_mirrors/ch/chitchatter Chitchatter是一款革命性的安…

2026/7/23 0:00:28阅读更多 →
从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表)

更多请点击: https://intelliparadigm.com 第一章:从单点好评到指数级传播:AI副业主理人必须掌握的4层口碑渗透模型(含ROI测算表) 当AI副业主理人不再仅满足于单次服务交付,而是主动构建可复用、可裂变、可…

2026/7/23 0:00:28阅读更多 →
油泥处理设备哪里能买到

油泥处理设备哪里能买到

油泥处理设备哪里有?这是许多从事油田、炼化、清罐业务的从业者最关心的问题。根据河南三丰环保设备有限公司的行业经验,选购油泥处理设备的核心在于设备能否适配当地环保法规与原料特性,而非单纯看价格。该公司总经理王钦田先生指出&#xf…

2026/7/23 0:00:28阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/23 22:58:43阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/23 18:58:18阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/23 18:58:18阅读更多 →