微软 GraphRAG 与传统 RAG 架构设计精髓原创

发布于 2024-7-11 13:33

浏览

1收藏

在数据洪流不断涌来的今天，如何高效且精准地从浩瀚的信息海洋中提炼出有价值的资讯，成为了自然语言处理领域待解决的关键问题。传统的检索增强生成（RAG）架构，以其独特的检索与生成结合的方式，在一定程度上满足了这一需求，为信息处理带来了便捷。然而，随着应用场景的复杂化，传统RAG在处理全局性、深层次语义信息上的局限性逐渐显现。

正是在这样的背景下，微软创新性地推出了GraphRAG（图的检索增强生成）架构，它不仅保留了传统RAG架构中的精华部分——即快速检索与生成高质量响应的能力，更在此基础上引入了知识图谱这一革命性的技术元素。通过精心构建的知识图谱，GraphRAG实现了对信息结构的深度挖掘与全局性把握，使得其在处理复杂语义关系和多主题问题时展现出前所未有的优势。下面本文将针对 GraphRAG 与传统 RAG 架构设计分别进行分析。

一、传统 RAG 架构设计思想

微软 GraphRAG 与传统 RAG 架构设计精髓 -AI.x社区

1、文档编码：

传统RAG首先会对输入的文档进行预处理，如分词、去除停用词等。接着，利用自然语言处理（NLP）技术，如词嵌入或Transformer模型，将文档中的每个词或短语转换为高维向量，形成文档的向量表示。

2、信息检索：

在文档编码完成后，RAG架构会利用这些向量在已有的知识库中进行相似度计算，找到与输入文档最相关或最匹配的信息。知识库可以包括预训练的模型、外部数据库、历史问答对等。

3、融合生成：

检索到相关信息后，RAG架构会将这些信息与原始输入文档进行融合。融合的方法可以是通过某种权重机制、注意力机制等，使得原始文档与检索到的信息能够相互补充。最后，基于融合后的信息，RAG架构会生成相应的响应或输出。

二、微软 GraphRAG架构设计思想

微软 GraphRAG 与传统 RAG 架构设计精髓 -AI.x社区

1、知识图谱构建

GraphRAG架构的核心在于其知识图谱的构建。微软利用大型语言模型（LLM）从源文档中提取实体、关系和属性等信息。这些信息被组织成一个结构化的知识图谱，图谱中的节点代表实体，边代表实体之间的关系。

2、社区检测与摘要

在知识图谱构建完成后，GraphRAG会使用社区检测算法（如Leiden算法等）来识别图谱中紧密相关的实体组（社区）。每个社区代表一个特定的主题或领域，GraphRAG会为每个社区生成一个摘要，这个摘要能够概括该社区的主要内容或特点。

3、查询聚焦生成

当用户输入查询时，GraphRAG会根据查询内容在知识图谱中查找相关的社区和摘要。GraphRAG会基于这些相关的社区和摘要生成部分响应，每个响应都针对查询中的某个方面或主题。最后，GraphRAG会将所有相关的部分响应进行汇总和整合，形成一个完整的全局答案。

微软 GraphRAG 与传统 RAG 架构设计精髓 -AI.x社区

如上这是论文的一个截图，描述了 Graph RAG 处理流程。

下图展示了一个可视化示例。每个圆圈代表一个实体（例如，一个人、一个地点或一个组织），实体大小表示该实体具有的关系数量，颜色表示相似实体的分组。颜色分区是一种建立在图形结构之上的自下而上的聚类方法，它使我们能够回答不同抽象层次的问题。

微软 GraphRAG 与传统 RAG 架构设计精髓 -AI.x社区

三、微软 GraphRAG 与传统 RAG 架构设计对比分析

全局性：传统RAG更侧重于局部信息的匹配和融合，而GraphRAG通过知识图谱和社区检测机制能够捕获全局信息，提供更全面、准确的回答。

结构化表示：GraphRAG使用知识图谱来表示信息，这种结构化的表示方式使得信息更加清晰、易于理解和推理。而传统RAG则更依赖于向量序列来表示信息，基线 RAG 难以将各个点连接起来。

性能优势：GraphRAG的模块化设计使得在索引和查询时能够并行处理多个社区和摘要，提高了处理效率。

四、GraphRAG 系统的简单使用示例

环境要求：

Python 3.10-3.12

运行示例：

# 安装 GraphRAG

pip install graphrag


# 运行索引器，设置一个数据项目和一些初始配置

# 准备一个示例数据集
mkdir -p ./ragtest/input


# 获取查尔斯·狄更斯的《圣诞颂歌》数据
curl https://www.gutenberg.org/cache/epub/24022/pg24022.txt > ./ragtest/input/book.txt

# 初始化您的工作区，首先运行命令graphrag.index --init
python -m graphrag.index --init --root ./ragtest

# 这将在目录中创建两个文件：.env和。settings.yaml./ragtest  

# .env包含运行 GraphRAG 管道所需的环境变量。如果检查文件，您将看到已定义的单个环境变量。  

# GRAPHRAG_API_KEY=<API_KEY>这是 OpenAI API 或 Azure OpenAI 端点的 API 密钥。您可以将其替换为您自己的 API 密钥。  
# settings.yaml包含管道的设置。您可以修改此文件以更改管道的设置。

# 这里提供了两种方式，以下以 Azure OpenAI 用户应在 settings.yaml 文件中设置以下变量为例

type: azure_openai_chat # Or azure_openai_embedding for embeddings

api_base: https://<instance>.openai.azure.com

api_version: 2024-02-15-preview # You can customize this for other versions

deployment_name: <azure_model_deployment_name>

# 运行索引管道
python -m graphrag.index --root ./ragtest


# 运行查询引擎，有两种方式：
# 全局搜索提出高级问题的示例：
python -m graphrag.query \--root ./ragtest \--method global \"What are the top themes in this story?"

# 本地搜索询问有关特定角色的更具体问题的示例：
python -m graphrag.query \--root ./ragtest \--method local \"Who is Scrooge, and what are his main relationships?"

总结

微软GraphRAG通过引入知识图谱和社区检测机制，有效解决了传统RAG在处理全局性问题时的局限性。其结构化表示和并行处理的能力使得GraphRAG在信息检索和生成领域具有显著优势。然而，其复杂性和高昂的成本也是需要考虑的因素。未来，随着技术的不断进步和优化，GraphRAG有望在更多领域得到应用和发展。

开源地址：https://github.com/microsoft/graphrag

本文转载自公众号顶层架构领域

原文链接：https://mp.weixin.qq.com/s/k5sF7nYufXbwW8OO29sAtw

标签

大模型

RAG

已于2024-7-11 13:49:29修改