RAG 检索环节:关键词检索完整落地讲解(附可运行 TF-IDF 代码)

发布时间:2026/7/19 20:35:55
RAG 检索环节:关键词检索完整落地讲解(附可运行 TF-IDF 代码) 我们先来搞清楚检索增强生成RAG到底是什么。 前面我们已经确定要搭建一套企业政策智能助手系统员工提出问题后系统会检索相关资料、扩充提示词再生成对应答复。接下来我们拆解这套流程每一步的工作原理先从检索环节讲起。 检索顾名思义就是调取匹配的相关资料。 但具体该怎么实现企业内部可能有成百上千份政策文件如何精准定位到和用户问题语境匹配的文档又该在文件里检索哪些内容 第一步我们会从用户的提问中提取若干关键词。举个例子假设用户问居家办公报销相关问题系统就会提取出报销、居家办公这两个核心关键词。 最简单的一种办法是使用 GREP 命令在所有文件中检索 “报销” 或 “居家办公” 这类特定词汇寄希望于能匹配到包含关键词的文档。 另一种方式如果文件存储在数据库中我们可以编写数据库查询语句进行检索。 但以上两种方式只会返回完全精准匹配关键词的内容很难每次都拿到准确有效的信息。 这种依靠精确文字匹配检索文档的方式叫做关键词检索也是各大搜索引擎广泛采用的基础技术。简单解释它的逻辑程序遍历全部文档提取关键词并根据关键词出现频次对文档排序。 举个简化例子系统统计所有文档里 “报销” 一词的出现次数第一份文档出现 3 次中间两份无相关内容第三份同样出现 3 次随后再统计 “居家办公”发现该词仅出现在居家办公配置说明文档中。将两组统计结果结合对比就能筛选出两个关键词总出现次数最多的文档以此判定这份文档和用户问题最相关。 以上只是极度简化的原理说明。关键词检索本身是一套完整技术体系背后包含大量复杂运算业界也衍生出多种成熟落地算法其中最主流的两种就是 TF-IDF 与 BM25。 我们不深入拆解底层运算逻辑只演示实操使用方式分别看下两种算法的运行效果。 首先从开源 Python 库 scikit-learn 中导入 TF 向量转换器。你可以把 scikit-learn 库理解成一个算法工具箱内置封装好的成熟算法无需从零手写实现。 接着我们定义三份样例文档这里先用简短句子演示实际项目中可以读取本地完整文件内容 然后实例化 TF-IDF 分析器 调用 transform 方法计算各个词汇对应的权重分值 最后将计算结果打印输出到控制台。RAG 检索环节关键词检索完整落地讲解附可运行 TF-IDF 代码1. 回顾核心定位整套企业政策智能助手的 RAG 流程 员工提问 → 检索企业政策文档 → 拼接检索到的文档 用户问题构造 Prompt → 大模型生成合规回答 检索是整套系统的信息来源检索不准后面大模型回答必然失真。 关键词检索是检索层最基础、低成本的第一阶段方案核心只匹配字面文字不理解语义。2. 关键词检索核心缺陷字面不匹配但语义相关的文档完全丢失 例用户问「远程办公补贴」文档写「居家办公报销标准」无重合关键词检索不到无法区分词语重要程度纯靠词频容易产生噪音同义词、近义词、简称、书面口语无法互通匹配。主流关键词检索算法TF-IDF、BM25TF-IDF词频 - 逆文档频率衡量单个词在当前文档重要性BM25在 TF-IDF 基础上优化增加文档长度、关键词位置加权企业知识库检索效果普遍优于原生 TF-IDF。3. Python TF-IDF 完整可运行演示代码基于 scikit-learn场景说明3 份企业政策文档用户查询居家办公报销标准python运行# 导入TF-IDF工具包 from sklearn.feature_extraction.text import TfidfVectorizer import pandas as pd # 1. 模拟企业政策文档库 docs [ 公司居家办公报销标准每月网络补贴100元凭缴费凭证每月15号提交申请, 外勤出差交通补贴、餐饮补贴报销规则出差需提前线上报备审批, 员工考勤管理制度上下班打卡、请假流程、加班调休相关规定 ] # 用户查询问句 query 居家办公报销多少钱 # 2. 初始化TF-IDF转换器 tfidf TfidfVectorizer() # 对全部文档计算TF-IDF权重矩阵 doc_tfidf tfidf.fit_transform(docs) # 把用户问句转为相同向量空间 query_tfidf tfidf.transform([query]) # 3. 计算查询与每篇文档的相似度余弦相似度 from sklearn.metrics.pairwise import cosine_similarity similarity_scores cosine_similarity(query_tfidf, doc_tfidf)[0] # 4. 整理输出结果 result pd.DataFrame({ 文档内容: docs, 匹配相似度得分: similarity_scores }).sort_values(匹配相似度得分, ascendingFalse) print( TF-IDF 检索匹配结果 ) print(result) print(\n最匹配文档, result.iloc[0][文档内容])代码运行结果解读工具会自动拆分文本词汇居家、办公、报销、补贴、出差、考勤等TF词频某词在单篇文档出现越多分值越高IDF逆文档频率词在全部文档里越稀有权重越高“居家办公” 只出现在第一篇文档IDF 权重极高“报销” 出现在第一篇、第二篇IDF 权重会被稀释余弦相似度用来衡量用户提问向量和文档向量重合度分数越高代表关键词重合越多。4. TF-IDF 检索的局限企业政策场景痛点纯文字匹配无语义理解 若文档写「远程工作费用补贴」提问「居家办公报销」无重叠关键词相似度趋近 0检索失效长文档干扰大 长篇政策里零星出现一次关键词会被误判为高相关无法处理行业简称、同义替换 文档线上办公补助 | 用户提问居家办公报销 → 完全匹配失败5. 补充BM25 简单对比TF-IDF 仅计算词权重 余弦相似度 BM25 额外优化两点惩罚过长文档避免长篇无关文档因偶然出现关键词排名靠前关键词多次连续出现会大幅加分更贴合政策文档短句匹配场景 企业知识库落地时一般先用 BM25 做关键词检索兜底再搭配向量语义检索组成混合检索。6. 企业 RAG 检索层进阶思路解决关键词检索短板关键词检索只能作为基础兜底方案完整企业政策助手检索流程通常分层第一层关键词检索BM25/TF-IDF快速召回字面高度匹配文档第二层向量语义检索Embedding 嵌入捕捉同义、近义、不同表述的相关政策重排序层将两层召回的文档统一打分筛选只保留 Top3-Top5 高相关文档送入大模型。