)
RAG 知识库工具脚本包切片、Embedding 预处理与检索评估零依赖实测RAG 知识库的效果好坏八成取决于检索质量而检索质量的上游是切片与评估——这两件事恰恰是大多数教程跳过的。本工具包把知识库落地的三个关键环节做成三个可直接运行的脚本切片、Embedding 预处理、检索评估零第三方依赖、样例数据内置。一、三环节分工脚本环节关键能力chunker.py切片Markdown 标题感知 滑动窗口重叠 → JSONLembed_prep.pyEmbedding 预处理清洗去重 批量请求体n-gram 哈希零依赖回退eval_retrieval.py检索评估标注查询集算 RecallK/MRR逐条明细二、三步跑通# 1. 切片sample_docs/ 内置 2 个样例文档python chunker.py sample_docs-ochunks.jsonl--size300--overlap60# 2. Embedding 预处理生成批量请求体OpenAI 兼容替换 model 即可接任意服务# 3. 检索评估对标注查询集算 RecallK / MRR标题感知切分让代码块、表格不被拦腰切断重叠窗口--size 300 --overlap 60起步保证语义边界处的答案不丢。三、两个设计亮点零依赖回退embed_prep 内置 n-gram 哈希向量——没有 Embedding API Key 也能离线联调整条管道切好就调通参数定型后再无缝切真实 Embedding 服务。评估先行eval_retrieval 对标注查询集输出逐条命中明细与调优提示切片参数改一版跑一次评估调优从「感觉变好了」变成数字对比。 本文对应的完整工具包3 脚本样例数据已整理上传点击查看资源包