Rag是什么,Rag的整体技术架构
01LLM的问题RAG的破局 大模型的缺点幻觉在没有答案的时候会提供一些虚假的信息。新鲜度模型知识的更新成本、周期、及大模型的通用能力问题。知识新鲜度的更新模型的训练都有滞后性用当下模型的时候会有知识的缺失。数据安全和隐私等问题。大多数模型的Context Window非常有限模型无法读取所有内容。输入太杂乱会影响模型理解。输入越多模型推理成本高、推理速度慢。RAG就是检索增强生成结合检索系统和生成模型来提高语言生成的准确性和相关性。通过从外部知识库中检索相关信息并将其作为提示Prompt输入给大型语言模型LLMs以增强模型处理知识密集型任务的能力提供更加符合上下文语境的回答。RAG的优势RAG的优势在于它能够在生成响应时引入外部知识提供更符合上下文语境的回答。与预训练模型不同RAG的内部知识可以很容易地修改甚至实时补充。相比微调技术RAG具备可观测性、可解释性等优势还可以有效降低大模型的幻觉问题。知识实时性困境大模型大模型训练数据存在时间截断。RAGRAG通过实时检索最新文档如科研论文/新闻动态扩展模型知识边界。事实准确性困境大模型纯生成模型易产生“幻觉”Hallucination虚构不存在的事实。RAGRAG先检索相关证据文档要求模型严格基于检索内容生成显著降低错误率。领域适配成本问题大模型微调Fine-tuning需要大量标注数据和计算资源。RAGRAG仅需构建领域文档库即可让通用模型输出专业内容如法律/医疗场景。Rag具有的特点可扩展性企业知识库以 TB/PB 计远超长上下文窗口的承载能力准确性长上下文模型存在“上下文悬崖”远未达到理论极限就已性能下降延迟与效率全量输入导致响应慢 成本高RAG能精准定位最相关信息数据隐私支持基于角色的访问控制避免将所有数据暴露给基础模型部署资源受限显存/算力限制无法支持超长上下文如 Qwen-14B 在 A100-40G上仅能接收约20k token实际案例即使百万token窗口也仅相当于1500页文档远不足以覆盖全库RAG系统的组成RAG是一个系统不是单一的组件由多个组件组成的复杂系统LLM只是其中的一个组件。RAG系统组件包括Chunk切块文档如果太大系统会把它拆成小片段。比如《报销手册》被拆成”机票报销“、”酒店报销“、”差旅补贴“。检索时就能更精准不需要把整本手册塞进给大模型。Embedding向量化把文字转成一组数字向量相似的句子距离很近不相关的距离很远。比如”机票报销“和”出差机票费用申请“离得近而和”量子纠缠“则完全不搭界。Vector Database向量数据库存放向量的仓库可以快速找出和问题最相近的几段内容。常见的向量数据库有Milvus、Weaviate、Pinecone等。Retrieval检索除了把切块转成向量用户的问题也会转成向量在向量数据库与其他数据片段比较“距离”距离越近代表内容越相关检索的结果就是找出最相关的几个片段。Generation生成检索到片段 用户问题 → 输入大模型 → 输出自然语言答案。切块、向量化、向量数据库这三部分可以理解为是离线部分去做检索和生成是在线部分做。RAG已死我们总会听到一个词叫RAG已死因为现在大模型有长上下文的能力之后它就可以吃到更多的TOKEN这样的话是不是RAG就没有用了 下面是Meta AI的一个Rag原文作者说他当时做Rag的一个初衷目标结合参数化记忆模型本身知识 非参数化记忆外部检索知识从而扩展语言模型的知识库。解决痛点无法访问私有企业内部数据模型无法访问 私有/专有数据参数知识过时无法实时更新其训练数据截止日期与当前时间之间总会存在差距。幻觉与归因问题模型经常编造听起来合理但错误的信息缺乏可验证来源。错误的二分法RAG vs 长上下文 vs 微调 vs MCP ≠ 你死我活正确认识它们是互补关系RAG → 获取外部知识微调 → 优化处理与应用长上下文 → 承载更多检索信息MCP → 简化工具/Agent集成类比RAG不是“过时工具”而像 硬盘与内存在系统中各司其职结论RAG永远不是“过时替代品”而是AI知识利用的基础设施。真正有价值的方案必然是 检索 长上下文 微调 MCP 的组合拳。传统问答系统 VS 问答对FAQ VS Rag检索增强生成传统问答系统 vs 现代问题系统(RAG)问答对FAQvs RAG检索增强生成基于问答对的问答基于问答对的问答就像一个“预设答案库”。系统会提前整理好一系列问题与对应的答案通常由人工或规则生成当用户提出问题时系统通过关键词匹配或语义向量匹配从库中找出最相似的问答对直接返回答案。它的核心在于高效匹配可以不依赖大型语言模型LLM实现简单且轻量。特点数据结构固定问答对数据库。匹配方式关键词或语义匹配。回答方式直接返回已有答。基于文档的问答RAGRAG是一种更现代的方案。它将文档切分成小块转化为向量存储在知识库中。当用户提问时系统先通过向量检索找到与问题最相关的文档片段再交给大型语言模型LLM生成自然语言回答。RAG结合了检索与生成灵活性更强。特点是数据结构文档切分后向量化存储。匹配方式向量相似度检索。回答方式LLM综合检索结果生成答案。灵活性能推理、组合生成新答案。双层知识库问答第一层FAQ知识库人工标注这是一个高质量、小而精的知识库存储着由领域专家撰写和审核的标准问答对。它专门针对那些频繁发生、具有标准问答对的回答。这一层的目标是提供零偏差的答案。第二层向量知识库文档语料这是一个大规模、广覆盖的知识库包含了操作手册、行业规范、领域文档等海量非结构化文档。通过文本分割、向量化后存储于向量数据库中。它负责处理FAQ知识库未覆盖的长尾问题和复杂查询。02大模型微调和Rag大模型微调RAG的对比03RAG的技术架构RAG的整体技术架构如上图主要分为离线和在线离线就是先进行文本切块再进行分词向量化得到一个向量库索引库索引库可以进行文本索引也可以做一个向量索引。当用户来进行提问之后分别做一个文本混合检索和一个向量检索计算用户的问题与语料库中哪些文本块相似比较相似高的k个块作为答案。检索完之后把数据进行重排序最后返回k个答案文本块给大模型。最后结合提示词工程模板将检索得到的k个块和用户的问题一起送进大模型大模型基于给定的文本块来回答用户的问题。Rag技术演进最开始的Rag是23年用户提问后对这个向量对这些文件进行一个检索当检索完回来之后直接组装成提示词送给大模型就回答了这是最简单的一个方式。更高级点就是在检索做了一个前优化一个后优化。那前优化就是做了一些查询的改写路由分配到哪些知识库这种路由检索完之后我们进行就是对检索内容再怎样进行检索检索完之后了我们在后在那个检索之后进行一个重排序融合这些操作之后最后组装成提示词之后给大模型这是高级进阶的rag。再之后就相当于把RAG拆成模块化RAG并不是一个单一的组件它是多个组件的组合组件就可以认为进行的模块化比如检索是一个组件重排序是一个组件OCR识别也是一个组件好处是可扩展在不同场景有些场景可能不需要重排序有些场景可能需要查询改写就可以对组件可以进行一个可插拔的方式对每个组件单独评估配置这样也好维护各组件之间就是松耦合这个是RAG的一个演进方式。主流开源框架①RAGFlow②QAnythingRAG开源框架对比RAG自研技术架构04RAG的“天地之间”上图是Rag的天地之间。天地之间下边的数据细节每个业务数据都是独一无二的就会有一些隐私数据。第二点就是在进行RAG调试的时候数据是非常重要的。Rag的思想很简单就是检索增强生成我们需要考虑的是如何搭建RAG把RAG进行普适的推广一定要进行数据分析把数据的细节做好。所以这是Rag的一个地一定要踩这个地才行。天是它的系统架构可以认为是一个工程架构。离线、在线怎么做我们要保证的是系统的整体最优而不是局部最优。优化检索、优化大模型也不一定对整体最优。如果检索的策略效果提升了但是检索内容会引入一些杂质需要进行测试才可以而且一些检索办法不一定完全适配于你的业务还是需要尝试的。这是Rag的一个系统架构中间部分是数据细节和系统架构是天地之间的内容是索引构建检索策略生成索引构建包括了离线文档解析、知识入库构建向量embedding还有一些数据库的选型。检索策略包括全文检索、向量检索检索之前用一个多轮的query改写检索之后可以把答案检索内容进行一个整合排序排版把内容送到大模型中。做完之后可能会有一些业务适配的情况需要围绕业务目标去设计流程去来实现场景化的一个落地。中间的索引架构、检索策略都是为了满足系统架构能够非常好可以达到系统架构最优的路径它不能光考虑局部最优还要考虑整体。第一数据可能会存在混淆的情况没法进行很好的问答 所以数据要进行分库进行数据筛选**。**第二过度依赖通用的检索算法比如用全文检索向量检索组合的混合检索如果大部分用户提问都是一些关键词全文检索就能检索到这部分内容就不需要向量检索了全文检索还比较准可靠。向量检索的场景是用户问题提问比较模糊基本不问关键词可能全文检索会拉低向量检索的得分这时就需要分析到底用单一的检索还是混合检索这是第二点误区**。**第三文本拆分的粒度不合理默认的切分方式为256、512这种实际上不同文档的切块方式是不一样的。比如法律类的文章就一大段一大段的切分256可能有点儿太细了512的大小是比较符合的。比如说我们有一些文章内容实际上他没有那么大可能256。所以就可以把接口开放给用户让用户去选择256还是512因为用户更比你更了解业务。第四将误将检索的召回率等同于检索的效果检索召回率的时候会有一些指标如NDCG其实更要关注的是一些精确率、准确率它只是召回来了但实际上得看看它的准确率有多少。拿到召回数据可以看看TOP1、TOP3、TOP5、TOP10的一个结果这样可以确认召回的效果。第五生成阶段过度依赖****大模型大模型可以承接很多上下文就很容易把这些内容直接扔给大模型这样的话会有一些杂质而且还会存在一种什么就是说你比如说你在提示词的时候告诉他基于以上内容进行回答大模型一看上面内容之后也不管这内容是否完全跟用户提问相关就直接回答所以还得在提示词里做一些约束严格基于以上内容进行回复跟用户问题相关。第六忽视用户的查询意图比如用户询问怎么解决手机充电慢的情况因为他的问题是一个偏口语化的检索回来可能就是手机充电原理这种情况就不是完全符合预期。需要增加改写功能把用户的提问改写成偏标准化的问题这样就可以解决检索到无关内容的情况避免检索到无关内容。第七是查询意图的理解除了改写之外还有前置的意图分类。比如有常见问题类有故障类这种问题把这两个数据都放在一个数据源里进行一个问答可能回答的不好因为常见问题会跟故障进行混淆但是把这两个库分开在前面做一个意图分发比如识别的时候用户的问题是跟常见问题相关那就在常见问题库里去检索那它一定是准的比在全库里更准。当用户进行提问之后先进行意图分发确定到哪个知识库后。再进行快速改写、检索。这就是Rag的一个天地之间。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

关于ESP32P4 SD卡读取速率慢的问题

关于ESP32P4 SD卡读取速率慢的问题

关于ESP32P4 SD卡读取速率慢的问题 使用了微雪的ESP32P4 86盒的开发板, 测试发现SD卡读取4.8MB的文件的时间大概是3.5s,速率约为1.4M/s,但是使用官方的SDMMC例程可以达到5M/s,测试发现有这几个问题导致的。通过这几个修改之后&…

2026/7/29 2:34:20阅读更多 →
XCOM 2模组管理终极指南:AML启动器完整使用教程

XCOM 2模组管理终极指南:AML启动器完整使用教程

XCOM 2模组管理终极指南:AML启动器完整使用教程 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom…

2026/7/29 2:34:20阅读更多 →
60、80、90、120法兰伺服电机如何匹配行星减速机框号?附计算与接口核对方法

60、80、90、120法兰伺服电机如何匹配行星减速机框号?附计算与接口核对方法

60、80、90、120法兰伺服电机如何匹配行星减速机框号?附计算与接口核对方法 “60法兰电机配060减速机,90法兰电机配090减速机”,是自动化行业中常见的快速匹配方法。 这套方法适合前期筛选,却不能作为最终订货依据。原因在于&…

2026/7/29 2:32:20阅读更多 →
Unity iOS内购服务器端验证:从原理到Node.js实战,构建安全支付系统

Unity iOS内购服务器端验证:从原理到Node.js实战,构建安全支付系统

1. 项目概述:为什么后台验证是IAP的“生命线”做Unity游戏内购,尤其是面向iOS平台,很多开发者朋友可能觉得,只要在Unity里把IAP插件配好,客户端能弹出购买窗口、能收到购买成功的回调,这事儿就算成了。如果…

2026/7/29 3:52:35阅读更多 →
SpringBoot+Vue2智能垃圾分类系统开发实战

SpringBoot+Vue2智能垃圾分类系统开发实战

1. 项目概述:SpringBoot智能垃圾分类管理系统的核心价值这套基于SpringBootVue2的智能垃圾分类管理系统源码,是我在参与某市智慧社区建设项目时沉淀下来的实战成果。系统通过图像识别与数据联动,实现了从垃圾投放到清运调度的全流程数字化管理…

2026/7/29 3:52:35阅读更多 →
电力电子器件串并联实战:从均压均流原理到IGBT/MOSFET布局避坑指南

电力电子器件串并联实战:从均压均流原理到IGBT/MOSFET布局避坑指南

1. 项目概述:为什么器件串并联是电力电子工程师的必修课?干了十几年电力电子,从做小功率开关电源到搞大功率变频器,有一个话题是绕不开的,那就是器件的串联和并联。乍一看,这好像是个基础得不能再基础的问题…

2026/7/29 3:52:35阅读更多 →
STM32 ADC从原理到实战:高精度数据采集与DMA应用详解

STM32 ADC从原理到实战:高精度数据采集与DMA应用详解

1. 项目概述:从模拟世界到数字世界的桥梁玩过STM32的朋友,肯定都听过“AD转换”这个词。听起来挺高大上,但说白了,它就是单片机的“耳朵”和“眼睛”。我们生活的世界是连续的、模拟的,比如温度的变化、声音的强弱、光…

2026/7/29 3:52:35阅读更多 →
环保AI模型正在被黑客逆向?(2024Q2攻防实测报告首发):3类侧信道攻击暴露、轻量化加密加固方案与等保2.0三级适配清单

环保AI模型正在被黑客逆向?(2024Q2攻防实测报告首发):3类侧信道攻击暴露、轻量化加密加固方案与等保2.0三级适配清单

更多请点击: https://codechina.net 第一章:环保AI模型安全态势总览 环保AI模型正逐步成为绿色计算与可持续人工智能发展的关键载体,其安全态势不仅关乎传统AI系统的鲁棒性与隐私性,更深度耦合能源效率、碳足迹透明度及生命周期可…

2026/7/29 3:52:35阅读更多 →
Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库,跑起来直接抛异常

Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库,跑起来直接抛异常

— 一次 POI 版本不一致导致的 SPI 加载异常排查记录 — 一、问题现场 今天用 Spring AI Alibaba 的 PoiDocumentReader 把 docx 灌进向量库,跑起来直接抛异常: Your InputStream was neither an OLE2 stream, nor an OOXML stream or you havent prov…

2026/7/29 3:50:34阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/28 4:06:39阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/28 2:08:06阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/28 1:38:28阅读更多 →
28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“!

28. Agent 执行到一半想暂停?用 interrupt 给它设个“关卡“! 在构建复杂的 Agent 系统时,我们经常会遇到这样的场景:Agent 正在执行一个多步骤的任务,比如“下单购买商品”,但执行到一半时,我们…

2026/7/29 0:01:46阅读更多 →
自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

自律同行,突破无界!NANK南卡正式官宣曾舜晞成为品牌代言人

近日,国际专注开放式技术研发的声学品牌Nank南卡,正式官宣实力艺人曾舜晞担任品牌代言人。消息一经发出便轰动全网。为什么耳机品牌不选择流量明星、老牌歌手?而且是选择曾舜晞?让我们一起来探索一下!比起短期的流量&a…

2026/7/29 0:01:46阅读更多 →
【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

【RT-DETR多模态创新改进】CVPR 2025 | 独家特征融合创新改进篇 | 引入RLAB残差线性注意力模块,有效融合并强调多尺度特征,多种改进点,适合红外与可见光融合目标检测任务,有效涨点

一、本文介绍 🔥本文在RT-DETR多模态融合目标检测中引入RLAB残差线性注意力模块,可在不同模态特征交互阶段进行多次残差细化,使可见光、红外等特征在尺度、语义和空间位置上更好对齐;随后将细化特征与解码器输出拼接并生成Q、K、V,通过线性注意力自适应强化关键通道、目…

2026/7/29 0:01:46阅读更多 →
YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

YOLOv8推理性能优化:从1.2FPS到35FPS的全链路加速实践

如果你在部署 YOLOv8 时,发现推理速度只有可怜的 1-2 FPS,而别人的演示视频却能跑到 30 FPS 以上,那么问题很可能不在模型本身,而在于你的整个处理链路。很多开发者拿到一个训练好的 YOLOv8 模型后,会直接使用官方示例…

2026/7/28 20:22:24阅读更多 →
Coze与Dify对比指南:低代码AI应用开发从入门到实战

Coze与Dify对比指南:低代码AI应用开发从入门到实战

1. 从零到一:为什么你需要了解 Coze 和 Dify?如果你对 AI 应用开发感兴趣,但一看到“大模型”、“智能体”、“工作流”这些词就头疼,觉得门槛太高,那这篇文章就是为你准备的。很多开发者,包括我自己&#…

2026/7/28 3:17:03阅读更多 →
AI生图工具怎么选?2026年6月版实测对比

AI生图工具怎么选?2026年6月版实测对比

做自媒体的朋友应该都有体会:配图一直是个让人头疼的问题。2026年,AI生图工具已经非常成熟了,但工具太多反而不知道怎么选。以下是截至2026年6月我对主流AI生图工具的实测对比。Midjourney V8.1:速度之王2026年6月11日&#xff0c…

2026/7/28 2:35:58阅读更多 →