大模型的外置记忆:MLP Memory把检索器压进参数里
如果大模型需要知识最常见的做法是外挂 RAG。但这篇论文问了一个反直觉的问题能不能让模型在训练时学会“像检索器一样想”推理时却不再检索RAG 的老问题过去两年RAG 几乎成了大模型落地的标准配件。模型不知道最新知识就去查文档模型容易编就把证据塞进上下文企业知识库不想重训模型也可以通过检索增强生成来接入。这条路线很实用但它也有几个绕不开的问题。第一推理变慢。每次回答都要先做向量检索再把召回文档拼进上下文尤其在大语料库和长上下文场景下首 token 延迟会明显增加。第二检索和生成是分开的。检索器在模型计算图外面工作LLM 只是被动读到一段额外文本。文档找到了不代表模型一定用对文档里有干扰信息模型还可能被带偏。第三微调也不是万能替代品。继续预训练CPT和 LoRA 可以把知识写进参数但会带来灾难性遗忘风险某些知识任务变好通用能力反而掉了。上海交大 LUMIA Lab、上海 AI Lab 和清华的这篇论文MLP Memory: A Retriever-Pretrained Memory for Large Language Models试图把这三件事重新组合起来。它不让模型每次都去检索文档也不直接改动主模型参数而是训练一个外置的MLP Memory训练时模仿 kNN 检索器推理时像一个参数化记忆模块一样输出 next-token 概率再和原 LLM 的输出做插值。一句话概括把 RAG 的“查资料能力”压缩成一个可前向计算的 MLP 记忆。它到底在记什么理解这篇论文最好先把 RAG、kNN-LM 和 MLP Memory 放在一条线上看。RAG 的做法是用户提问后系统从外部知识库里找文档把文档放进 prompt再让 LLM 作答。kNN-LM 更贴近语言模型内部。它会先把训练语料中的每个上下文表示存成 key把对应的下一个 token 存成 value。推理时当前上下文也会变成一个 query到这个巨大 datastore 里找近邻然后根据近邻 token 形成一个概率分布。这相当于给语言模型旁边放了一本巨大的“索引词典”。需要续写时不只看模型自己算出的概率还会查一查训练语料里类似上下文后面通常跟什么。问题是这本词典太大、查起来太慢。论文举的例子是kNN-LM 在 5B token 数据上可能对应几十 TB 级别 datastore而一个 1B 参数的 MLP Memory 大约是 4GB 级别。MLP Memory 的关键动作是把“查词典”改成“学会词典的行为”。训练阶段研究者先构造 kNN 检索器产生的目标分布。对每个训练上下文kNN 会告诉你类似上下文后面哪些 token 更可能出现以及概率大概怎样分布。然后MLP Memory 学习从 LLM 中间层 hidden state 直接预测这个 kNN 分布。这里不是只学标准答案 token而是学习一个分布Paris 可能很高London 可能也有一点Beijing 也许更低。这很像学生不是背答案而是模仿老师解题时的“概率判断”。老师来自 kNN 检索器学生是一个全 MLP 模块。训练时像检索器推理时不检索论文的方法并不复杂反而相当直接。给定一个上下文原始 LLM 会输出自己的概率分布P_LM。MLP Memory 读取某一层的 hidden representation输出另一个概率分布P_MLP。最后系统把两者做线性插值得到最终预测。也就是说最终答案来自两股力量一股是原模型的语言能力一股是外置记忆模块学到的检索式知识。训练目标也有两部分。一部分是 KL loss让 MLP Memory 尽量模仿 kNN 检索器产生的完整分布另一部分是交叉熵 loss让它不要忘记真实下一个 token。论文的消融实验显示两个目标都不能太极端最佳 KL 权重大约在0.4附近。这点很关键。只学真实 token容易变成普通语言模型只学 kNN 分布又可能过度贴近检索器本身的噪声。作者希望 MLP Memory 学到的是检索器的知识利用模式而不是机械复制检索结果。另一个有意思的发现是MLP Memory 读取的不是最后一层表示而是大约70% 深度位置的中间层表示效果更好。直觉上最后一层更接近输出决策中间偏后的层可能保留了更适合“查记忆”的语义结构。结果好在哪里论文主要从 scaling、问答、通用 NLP 任务、幻觉检测和推理效率几个角度做评估。在 scaling law 实验里作者用 GPT-2 系列做对比。在 WikiText-103 上加入 MLP Memory 的架构相对 decoder-only 继续训练模型参数 scaling 指数提升17.5%在 Web 数据集上提升24.1%。通俗讲这说明同样增加模型规模时带外置 MLP 记忆的架构 perplexity 下降得更快。在问答任务上论文用 Llama2-7B 和 Mistral-7B-v0.3 做 backbone比较 Base LM、RAG、kNN-LM、CPT、LoRA 和 MLP Memory。结果里最醒目的是 Mistral-7B-v0.3在 NQ、WebQA、TriviaQA、TruthfulQA、HotpotQA 五个 QA benchmark 上MLP Memory 平均相对提升12.3%。其中 WebQA 从 29.28 提到 37.45NQ 从 20.63 提到 25.20。Llama2-7B 上也有提升五个 QA 任务平均相对提升7.8%。更重要的是CPT 和 LoRA 在部分任务上会明显掉分尤其 HotpotQA 这类多跳问答RAG 也不是全胜有的任务因为检索文档引入干扰反而下降。MLP Memory 的优势在于它不改主模型参数也不在推理时塞入一堆可能有噪声的文档。在九个通用 NLP 任务上MLP Memory 的平均分从 Mistral-7B-v0.3 的 67.86 提到73.07绝对提升5.2 分。这点回应了一个常见担心外挂记忆会不会只对知识问答有用却伤害通用理解能力至少在这组实验里作者给出的答案是否定的。幻觉检测上MLP Memory 在 HaluEval 的 Dialogue、QA、Summarization 三类任务上分别提升9.68、10.08、2.14 分。RAG 在 QA 上略高于 MLP Memory但没有评估 summarizationCPT 和 LoRA 则整体更不稳定。最值得看的不是“更强”而是“少一次查库”这篇论文最有工程意味的点是推理路径。RAG 的成本不只在 LLM 本身还在检索系统向量库、召回、rerank、文档拼接、长上下文计算以及由此带来的延迟和不确定性。MLP Memory 推理时只需要一次前向计算。论文报告称它的 time-to-first-token 比 top-5 RAG 快2.5 倍比做了降维加速的 kNN-LM 快5.6 倍tokens per second 也比 RAG 高1.5 倍比 kNN-LM 高6 倍。更关键的是RAG 和 kNN-LM 的速度会随着语料库规模变化而 MLP Memory 的推理速度基本只取决于这个 MLP 模块本身。这就像把一座图书馆里的检索经验训练成一个随身助理。它不是真的带着每本书出门也不能随时查新书但面对已经训练过的知识分布它可以更快地给出判断。它不是 RAG 的终结这篇论文容易被误读成“RAG 要被替代了”。更准确的说法是它指出了 RAG 之外的一条参数化记忆路线。MLP Memory 适合的是相对稳定、可预训练、需要低延迟调用的知识分布。比如固定语料上的问答、常见事实、领域知识压缩、边缘部署或高并发服务。但如果知识经常变化比如企业最新文档、当天新闻、用户私有数据、审计要求很强的场景RAG 仍然有明显优势。因为 RAG 可以直接展示来源也能快速更新知识库MLP Memory 要更新知识至少需要重新构造监督信号并训练记忆模块。另一个边界是训练成本。论文实验使用 32 张 A800 80GB GPU并且需要先构造 datastore 和 kNN 目标分布。它把推理时的检索成本前移到了训练阶段不是凭空消除了成本。所以对工程实践来说这篇论文给出的不是“别用 RAG”而是一个新的权衡如果你的知识库足够稳定、推理延迟足够关键是否可以把显式检索蒸馏成一个外置参数记忆对从业者的启示记忆和推理可以拆开设计。传统 LLM 把语言建模、知识存储和推理能力混在一个 decoder 里。MLP Memory 说明记忆模块可以单独预训练再以概率插值方式接入主模型。RAG 的价值不只在文档本身也在检索分布。这篇论文真正蒸馏的不是某几篇文档而是“相似上下文通常如何续写”的统计结构。这可能比简单把文档塞进 prompt 更稳定。不要低估外置小模块。一个 1B 参数 MLP Memory 对 7B backbone 来说并不算小但它没有注意力、推理路径简单带来的延迟形态和 RAG 完全不同。知识更新仍是硬问题。如果一个系统必须每天吸收新资料显式 RAG 依然更灵活。MLP Memory 更像“长期记忆压缩”不是“实时资料查询”。未来可能出现混合形态。高频、稳定知识交给参数化记忆低频、长尾、实时知识交给 RAG需要证据追溯时再显式检索。真正的生产系统未必二选一。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻

如何快速配置rclone:跨平台云端文件同步完整指南

如何快速配置rclone:跨平台云端文件同步完整指南

如何快速配置rclone:跨平台云端文件同步完整指南 【免费下载链接】rclone "rsync for cloud storage" - Google Drive, S3, Dropbox, Backblaze B2, One Drive, Swift, Hubic, Wasabi, Google Cloud Storage, Azure Blob, Azure Files, Yandex Files 项…

2026/7/31 23:38:03阅读更多 →
如何在Chrome中诊断和优化Ruffle扩展的Flash模拟性能

如何在Chrome中诊断和优化Ruffle扩展的Flash模拟性能

如何在Chrome中诊断和优化Ruffle扩展的Flash模拟性能 【免费下载链接】ruffle A Flash Player emulator written in Rust 项目地址: https://gitcode.com/GitHub_Trending/ru/ruffle Ruffle是一款基于Rust语言开发的Flash Player模拟器,它让历史Flash内容在现…

2026/7/31 23:38:03阅读更多 →
终极go2rtc流媒体服务器:打造零延迟智能摄像头系统指南 [特殊字符]

终极go2rtc流媒体服务器:打造零延迟智能摄像头系统指南 [特殊字符]

终极go2rtc流媒体服务器:打造零延迟智能摄像头系统指南 🚀 【免费下载链接】go2rtc Ultimate camera streaming application 项目地址: https://gitcode.com/GitHub_Trending/go/go2rtc go2rtc流媒体服务器是一款功能强大的开源摄像头流媒体解决方…

2026/7/31 23:38:03阅读更多 →
从标清到AIGC仅差1个模型:省级广电媒资库智能标签化改造,准确率提升91.7%的关键路径

从标清到AIGC仅差1个模型:省级广电媒资库智能标签化改造,准确率提升91.7%的关键路径

更多请点击: https://intelliparadigm.com 第一章:从标清到AIGC仅差1个模型:省级广电媒资库智能标签化改造,准确率提升91.7%的关键路径 传统省级广电媒资系统长期依赖人工标注与规则引擎,面对日均超20万小时的新增音视…

2026/8/1 0:38:23阅读更多 →
如何让Kindle变身完美漫画阅读器:Kindle Comic Converter终极指南

如何让Kindle变身完美漫画阅读器:Kindle Comic Converter终极指南

如何让Kindle变身完美漫画阅读器:Kindle Comic Converter终极指南 【免费下载链接】kcc KCC (a.k.a. Kindle Comic Converter) is a comic and manga converter for ebook readers. 项目地址: https://gitcode.com/gh_mirrors/kc/kcc 你是否曾经在Kindle、Ko…

2026/8/1 0:38:23阅读更多 →
如何通过ChanlunX插件实现通达信缠论分析的智能化升级

如何通过ChanlunX插件实现通达信缠论分析的智能化升级

如何通过ChanlunX插件实现通达信缠论分析的智能化升级 【免费下载链接】ChanlunX 缠中说禅炒股缠论可视化插件 项目地址: https://gitcode.com/gh_mirrors/ch/ChanlunX 在技术分析领域,缠论以其严谨的逻辑和精确的走势分解方法而闻名,但传统的手工…

2026/8/1 0:38:23阅读更多 →
【JVM原理详解】26-Parallel-Scavenge与吞吐量优先

【JVM原理详解】26-Parallel-Scavenge与吞吐量优先

26-Parallel Scavenge 与吞吐量优先 上一篇讲了 Serial 和 ParNew,它们关注的是缩短单次 GC 停顿。但有一类应用并不在意某次停顿长短,而在意单位时间内完成的业务量——例如离线数据分析、批处理任务、ETL 作业。为这类场景,HotSpot 提供了…

2026/8/1 0:38:22阅读更多 →
AI 视频生成升温:可灵(Kling)获大额融资,视频创作门槛再降低

AI 视频生成升温:可灵(Kling)获大额融资,视频创作门槛再降低

2026 年,AI 视频生成赛道持续升温,国产视频大模型可灵(Kling)完成新一轮大额融资,估值空间进一步打开。这是继 2024-2025 年 AI 图像生成工具井喷之后,生成式 AI 向视频领域延伸的标志性事件。资本的大手笔…

2026/8/1 0:38:22阅读更多 →
百考通得力助手:AI赋能,精准抓取,助力每一份研究从良好开端走向卓越成果,让你少走弯路

百考通得力助手:AI赋能,精准抓取,助力每一份研究从良好开端走向卓越成果,让你少走弯路

毕业季、开题季,一份专业出彩的PPT是顺利通过答辩的关键。但从论文中提炼核心观点、规划答辩逻辑、设计美观版式,往往让学生们焦头烂额。百考通(https://www.baikaotongai.com) 凭借AI技术深度赋能,打造出一站式答辩PP…

2026/8/1 0:36:21阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/31 20:44:05阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/31 17:41:43阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/31 20:44:05阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/1 0:00:10阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/1 0:00:10阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/1 0:00:10阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/1 0:00:10阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/1 0:00:10阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/1 0:00:10阅读更多 →