别找了!最全的 RAG 整体结构解析,把这套架构彻底讲透,建议收藏!

既然更新,说明咖哥今年(2026年)又要开始放大招了。——新书(Agent架构相关的)3月份即将问世——(大作)敬请期待!

这篇文章复习一下RAG。《RAG实战课》问世半年,销量有增无减,口碑逐渐积累。看来,朋友们正逐渐意识到这本书的真正价值。

我个人观点,这本书精华中的精华,不在于技术总结的全,不在于语言轻松,而是书封底的那张体系框架图。是真的提纲挈领,真的深入浅出。

这张图,佳哥真是用心了

今天这一篇,我不讲案例、不讲代码、不讲某个框架的用法。

我只做一件事:

把这张图,从“看起来复杂”,讲到“你知道它为什么必须长这样”。


先说一句狠话

如果你觉得 RAG 是:

  • 向量库 + Embedding

  • 检索几段文本 + 丢给 LLM
  • 能跑就行

那你现在看到的大多数 RAG 系统,在规模一上来时,都会失效。

不是模型不行,是结构没搭完。

而这张图,讲的就是:

一个 RAG 系统,从“能用”,到“可扩展、可评估、可演化”,到底需要哪些结构层。


第一层:数据不是从“文本”开始的

很多人一上来就聊向量库,其实顺序是反的。

真正的起点在最底部:数据导入与文本分块。

你会看到这里不是一句“切 chunk”,而是:

  • 按字符 / 句子 / 语义的分块策略
  • 父子文档索引
  • 分层索引(RAPTOR)
  • 多表示索引

为什么?

因为检索失败,80% 不是检索算法的问题,是切块阶段就已经丢信息了。

如果你在这一层没有“结构意识”,

后面所有高级技巧,都是在补锅。


第二层:Embedding 从来不是一个模型的问题

中间这一大块,是很多人最容易误解的地方。

Embedding 不是只有一个向量。

你会看到:

  • 稠密向量(OpenAI / bge / jina)
  • 稀疏向量(TF-IDF / BM25)
  • 专用嵌入(Fine-Tuning / ColBERT)

为什么要这么复杂?

因为现实世界的检索,本来就不是一个相似度空间。

关键词、语义、领域信号,本来就不在同一个空间里。

真正可用的系统,一定是混合表示。


第三层:索引与向量库只是“物理层”

很多人把 FAISS、Milvus、HNSW 当成核心。

但在这张图里,它们被刻意画得很“靠后”。

因为它们解决的只是一个问题:

怎么快。

而不是:

怎么对。

索引策略(父子、分层、多表示),

远比你选哪种向量库重要。


第四层:真正开始像「系统」的地方——查询侧

图左上角,是整个系统的灵魂。

你会看到四件事同时出现:

  • 查询构建
  • 查询优化
  • 查询路由
  • HyDE / 主动检索

这一步意味着什么?

意味着系统已经不再是:

“用户问一句,我搜一遍”。

而是:

系统开始“理解该怎么问世界”。


第五层:检索后处理,决定答案质量上限

中间偏右那一块,是很多 Demo 系统里完全没有的东西。

  • 重排(Rerank / Cross-Encoder / ColBERT)
  • 压缩(相关性 + 冗余控制)
  • 校正(CRAG)
  • 主动补查

这一层解决的是:

不是有没有搜到,而是“哪些值得被看见”。

如果没有这一层,

你永远会觉得:

“有点对,但总差点意思”。


第六层:生成不只是“丢给模型”

右下角的生成部分,我刻意没有画成一个大脑就结束。

你会看到:

  • 提示工程
  • 结构化输出(Pydantic / JSON Schema)
  • 工具调用
  • Self-RAG / RRR
  • 主动再检索

这意味着一件事:

生成,本身也是一个可以被设计、被反思的过程。


第七层:评估,是系统是否“工程化”的分水岭

最右侧那一列,是很多人最不想做、但最重要的。

  • Precision / Recall / F1
  • MRR / MAP
  • BLEU / ROUGE / METEOR
  • 忠实度 / 安全性

有没有这一列,决定了:

你是在做 Demo,
还是在做系统。


那这张图,到底是什么?

它不是教程目录。

也不是技术大全。

它是一张工程演化图。

它回答的不是:“你现在该用什么技术”,

而是:“一个 RAG 系统,迟早会走到哪些结构层”。

好的,祝大家阅读愉快,我们过俩月新书(Agent设计相关)发布会见!!

如何学习大模型 AI ?

由于新岗位的生产效率,要优于被取代岗位的生产效率,所以实际上整个社会的生产效率是提升的。

但是具体到个人,只能说是:

“最先掌握AI的人,将会比较晚掌握AI的人有竞争优势”。

这句话,放在计算机、互联网、移动互联网的开局时期,都是一样的道理。

我在一线互联网企业工作十余年里,指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家,也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑,所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限,很多互联网行业朋友无法获得正确的资料得到学习提升,故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

第一阶段(10天):初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。

  • 大模型 AI 能干什么?
  • 大模型是怎样获得「智能」的?
  • 用好 AI 的核心心法
  • 大模型应用业务架构
  • 大模型应用技术架构
  • 代码示例:向 GPT-3.5 灌入新知识
  • 提示工程的意义和核心思想
  • Prompt 典型构成
  • 指令调优方法论
  • 思维链和思维树
  • Prompt 攻击和防范

第二阶段(30天):高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。

  • 为什么要做 RAG
  • 搭建一个简单的 ChatPDF
  • 检索的基础概念
  • 什么是向量表示(Embeddings)
  • 向量数据库与向量检索
  • 基于向量检索的 RAG
  • 搭建 RAG 系统的扩展知识
  • 混合检索与 RAG-Fusion 简介
  • 向量模型本地部署

第三阶段(30天):模型训练

恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。

到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?

  • 为什么要做 RAG
  • 什么是模型
  • 什么是模型训练
  • 求解器 & 损失函数简介
  • 小实验2:手写一个简单的神经网络并训练它
  • 什么是训练/预训练/微调/轻量化微调
  • Transformer结构简介
  • 轻量化微调
  • 实验数据集的构建

第四阶段(20天):商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。

  • 硬件选型
  • 带你了解全球大模型
  • 使用国产大模型服务
  • 搭建 OpenAI 代理
  • 热身:基于阿里云 PAI 部署 Stable Diffusion
  • 在本地计算机运行大模型
  • 大模型的私有化部署
  • 基于 vLLM 部署大模型
  • 案例:如何优雅地在阿里云私有部署开源大模型
  • 部署一套开源 LLM 项目
  • 内容安全
  • 互联网信息服务算法备案

学习是一个过程,只要学习就会有挑战。天道酬勤,你越努力,就会成为越优秀的自己。

如果你能在15天内完成所有的任务,那你堪称天才。然而,如果你能完成 60-70% 的内容,你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/news/1128841.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

LangChain能否集成M2FP?多模态Agent的新可能

LangChain能否集成M2FP?多模态Agent的新可能 🧩 M2FP 多人人体解析服务:从像素级分割到可视化输出 在构建智能视觉系统的过程中,人体解析(Human Parsing) 是一项关键的底层能力。它不仅要求模型能识别图像中…

政企项目实战:基于预置镜像的地址库清洗方案

政企项目实战:基于预置镜像的地址库清洗方案 在政府信息化建设中,建立标准地址库是提升城市管理效率的基础工作。某区政府在收集各街道提交的地址数据时,发现存在大量表述不一致的情况,例如"XX路12号"和"十二号XX…

企业级 Agent 落地指南:抛弃 ReAct,拥抱 LangGraph,一场关于“确定性”的代码革命!

还记得你第一次跑通 AutoGPT 时的兴奋吗?看着终端里 Agent 自己思考、调用工具、再思考,仿佛 AGI 就在眼前。 但当你试图把这个 Demo 搬进企业生产环境时,噩梦开始了: 死循环: Agent 在两个工具之间反复横跳&#xf…

银行风控升级:开户地址真实性验证方案

银行风控升级:基于MGeo模型的地址真实性验证方案实战 在信用卡申请等金融业务中,虚构地址是常见的欺诈手段之一。某银行发现大量申请使用虚假地址,但人工抽查覆盖率不足1%。本文将介绍如何利用MGeo多模态地理语言模型构建实时地址验证系统&am…

投影问题解决方案的快速原型设计

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 快速开发一个投影问题诊断工具的最小可行产品(MVP)。核心功能包括:1)基础驱动检测 2)常见错误匹配 3)驱动下载链接提供 4)简单修复按钮。界面只需一个主检测页面和结果…

M2FP人体部位分割教程:Python调用API实现批量图像处理

M2FP人体部位分割教程:Python调用API实现批量图像处理 📖 项目简介:M2FP 多人人体解析服务 在计算机视觉领域,人体部位语义分割(Human Parsing)是理解人物姿态、服装结构和行为分析的关键前置任务。传统的…

用ROOCODE在10分钟内打造一个产品原型

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 使用ROOCODE快速生成一个社交媒体应用的原型,包含用户注册、发帖、点赞和评论功能。根据自然语言描述(如“一个类似Twitter的社交平台”)自动生…

Z-Image-Turbo是否开源?代码仓库与社区支持情况

Z-Image-Turbo是否开源?代码仓库与社区支持情况 阿里通义Z-Image-Turbo WebUI图像快速生成模型 二次开发构建by科哥 在AI图像生成领域,Z-Image-Turbo 作为阿里通义实验室推出的高效图像生成模型,凭借其“1步出图”的极致推理速度和高质量输…

M2FP错误排查手册:常见问题与解决方案汇总

M2FP错误排查手册:常见问题与解决方案汇总 🧩 M2FP 多人人体解析服务概述 M2FP(Mask2Former-Parsing)是基于ModelScope平台构建的先进多人人体解析系统,专注于高精度、像素级的身体部位语义分割任务。该服务不仅支持单…

政务大数据清洗:基于MGeo镜像的地址标准化流水线

政务大数据清洗:基于MGeo镜像的地址标准化流水线实战 在智慧城市项目中,多源地址数据的融合一直是个令人头疼的难题。不同系统采集的地址数据格式各异,存在大量别名、缩写、错别字等问题,导致数据难以直接关联使用。本文将介绍如何…

FPGA vs GPU:深度学习推理的能效比实测对比

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 实现基于FPGA的YOLOv3-Tiny目标检测加速器。要求:1) 支持416x416输入分辨率 2) 量化到8位定点数 3) 包含DDR3内存控制器 4) 提供Python接口 5) 在Zynq-7000上实现PS-PL…

测试人员技术演讲技巧:会议准备

为何会议准备对测试人员至关重要 在软件测试领域,技术演讲是分享知识、推动团队协作的关键环节。测试人员常需在会议中演示测试策略、分析缺陷或推广新工具(如Selenium或JIRA),但缺乏准备可能导致信息混乱、听众流失。例如&#…

不动产登记改革:纸质档案地址数字化实战

不动产登记改革:纸质档案地址数字化实战指南 背景与需求分析 在不动产登记改革过程中,房管局面临一个普遍难题:如何将1950年代至今的房产证手写地址电子化?这些纸质档案中的地址信息存在三大典型问题: 行政区划变迁&am…

面向新一代域控的多维度软件测试方案

随着汽车智能化发展,车型功能日益丰富,导致分布式电子架构下的ECU数量激增,进而引发了控制器兼容性差、维护成本高等一系列问题。为此,行业开始向集成化、域控化方向转型,通过功能整合、集中管理来降低系统复杂性带来的…

用AI自动生成JDK 11环境配置工具,告别繁琐设置

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 请开发一个跨平台的JDK 11环境自动配置工具,要求:1. 支持Windows、MacOS和Linux三大操作系统;2. 自动检测系统环境并下载合适的JDK 11版本&…

Z-Image-Turbo掘金技术博客投稿方向指导

Z-Image-Turbo WebUI 图像快速生成模型二次开发实践指南 引言:从开源项目到定制化AI图像引擎 在AIGC(人工智能生成内容)浪潮中,阿里通义实验室推出的Z-Image-Turbo模型凭借其高效的推理速度和高质量的图像生成能力,迅…

京东关键词的应用场景

京东关键词在 API 层面的应用,是串联商品检索、数据运营、商业决策、工具开发的核心纽带,结合京东开放平台 API(如商品查询、联盟推广、数据统计类接口),其应用场景覆盖电商全链路的技术与商业需求。以下是具体的高频场…

AUGMENT CODE在金融科技中的实际应用案例

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 开发一个金融科技专用的代码增强工具,重点优化交易系统和风险模型的代码。功能包括自动检测安全漏洞、优化算法性能、生成合规性文档。支持与现有CI/CD管道集成&#x…

告别低效!Vue生命周期优化全攻略

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 创建一个性能对比项目:1. 传统方式实现一个数据仪表盘(包含图表、列表和过滤器);2. 优化版本使用生命周期钩子进行:数据分批加载(onMounted)、缓…

AI助力数据库管理:用Navicat连接MySQL的智能优化

快速体验 打开 InsCode(快马)平台 https://www.inscode.net输入框内输入如下内容: 创建一个AI辅助的Navicat连接MySQL配置工具,能够根据用户输入的数据库信息自动生成最优连接参数,提供连接测试功能,并在连接成功后给出数据库性…