多彩编程 多彩编程MZPH · CODE BLOG
ARTICLE DETAIL

文章详情

深耕前端与后端开发技术的一线实战笔记与踩坑复盘。

如何使用AutoSchemaKG构建高质量知识图谱?从文本到图谱的完整指南

如何使用AutoSchemaKG构建高质量知识图谱?从文本到图谱的完整指南 如何使用AutoSchemaKG构建高质量知识图谱从文本到图谱的完整指南【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKGAutoSchemaKG是一个创新的自动知识图谱构建框架它通过概念化实现模式生成能够从非结构化文本中构建高质量知识图谱。本文将为你提供从文本到图谱的完整指南帮助你快速掌握AutoSchemaKG的使用方法。1. AutoSchemaKG简介AutoSchemaKG是一个强大的知识图谱构建工具它能够自动从文本中提取知识并构建结构化的知识图谱。该框架结合了模式生成和概念化技术无需预定义模式即可实现全自动的知识图谱构建。AutoSchemaKG框架图标展示了知识图谱与AI概念的结合2. 环境准备在开始使用AutoSchemaKG之前需要确保你的环境中安装了必要的依赖包并配置了LLM端点和嵌入模型。以下是基本的环境配置步骤from atlas_rag.kg_construction.triple_extraction import KnowledgeGraphExtractor from atlas_rag.kg_construction.triple_config import ProcessingConfig from atlas_rag.llm_generator import LLMGenerator from openai import OpenAI # 初始化LLM客户端 client OpenAI(base_urlhttp://0.0.0.0:8129/v1, api_keyEMPTY) llm_generator LLMGenerator(clientclient, model_nameQwen/Qwen2.5-7B-Instruct)3. 知识图谱构建完整流程AutoSchemaKG提供了从原始文本到知识图谱的完整 pipeline。主要包括以下步骤3.1 配置处理参数首先需要设置处理配置指定模型路径、数据目录、输出目录等关键参数kg_extraction_config ProcessingConfig( model_pathQwen/Qwen2.5-7B-Instruct, data_directoryexample/example_data, filename_patternDulce, # 仅处理文件名包含此子串的文件 output_directoryexample/generated/test_data, ) kg_extractor KnowledgeGraphExtractor(modelllm_generator, configkg_extraction_config)3.2 执行知识图谱提取配置完成后执行以下步骤完成知识图谱的构建# 1. 提取三元组 kg_extractor.run_extraction() # 2. 转换为CSV格式 kg_extractor.convert_json_to_csv() # 3. 模式归纳 kg_extractor.generate_concept_csv_temp() # 4. 创建概念CSV kg_extractor.create_concept_csv() # 5. 转换为GraphML格式用于NetworkX kg_extractor.convert_to_graphml()4. 支持的文件格式AutoSchemaKG支持多种输入格式用于知识图谱构建和基准测试。对于PDF文件处理流程如下将PDF转换为Markdown格式将Markdown转换为JSON格式使用JSON文件进行知识图谱构建详细的PDF/Markdown转换指南可以参考example/pdf_md_conversion/readme.md。5. 检索增强生成(RAG)构建知识图谱后可以使用它进行检索增强生成。以下是基本步骤5.1 设置嵌入模型from sentence_transformers import SentenceTransformer from atlas_rag.vectorstore.embedding_model import SentenceEmbedding encoder_model_name sentence-transformers/all-MiniLM-L6-v2 sentence_model SentenceTransformer(encoder_model_name, trust_remote_codeTrue) sentence_encoder SentenceEmbedding(sentence_model)5.2 创建索引from atlas_rag.vectorstore import create_embeddings_and_index # 使用知识图谱构建步骤中的输出目录 working_directory example/example_data/test_data data create_embeddings_and_index( sentence_encodersentence_encoder, model_nameencoder_model_name, working_directoryworking_directory, keywordtest_data, include_conceptFalse, # 如果生成了概念设为True include_eventsFalse, normalize_embeddingsTrue )5.3 执行检索from atlas_rag.retriever import HippoRAG2Retriever # 初始化检索器 hipporag2_retriever HippoRAG2Retriever( llm_generatorllm_generator, sentence_encodersentence_encoder, datadata, ) # 检索上下文 query 你的问题 content, sorted_context_ids hipporag2_retriever.retrieve(query, topN3) print(f检索到的内容: {content})5.4 生成答案sorted_context \n.join(content) response llm_generator.generate_with_context( query, sorted_context, max_new_tokens2048, temperature0.5 ) print(response)6. 示例脚本和工具AutoSchemaKG提供了多个示例脚本帮助你快速上手atlas_full_pipeline.ipynb从原始文本到知识图谱构建和RAG的完整端到端 pipelineexample_scripts/parallel_generation/run_full_pipeline.sh运行完整 pipeline 的主脚本example_scripts/benchmark_extraction_example用于基准测试的提取 pipeline 示例7. 总结AutoSchemaKG是一个功能强大的知识图谱构建框架它能够自动从非结构化文本中提取知识并构建高质量的知识图谱。通过本文介绍的步骤你可以快速掌握AutoSchemaKG的使用方法从文本数据中构建知识图谱并进行检索增强生成。无论是学术研究还是工业应用AutoSchemaKG都能为你提供高效、准确的知识图谱构建解决方案。开始使用AutoSchemaKG释放你的数据价值吧【免费下载链接】AutoSchemaKGThis repository contains the implementation of AutoSchemaKG, a novel framework for automatic knowledge graph construction that combines schema generation via conceptualization.项目地址: https://gitcode.com/gh_mirrors/au/AutoSchemaKG创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表