Marker-Inc-Korea/AutoRAG

AutoRAG: Now your agent can find anything in your computer. It gets smarter if you are using it frequently.

What it solves

AutoRAG 是一个“图书管理员智能体”,旨在取代传统的仅提供文件路径列表和匹配行的搜索工具。AutoRAG 不再强迫用户手动打开文件、阅读上下文并综合答案,而是跨各种文档集合进行搜索,直接读取源材料,并整理出一份结构化的、带编号的知识单元(答案)列表,用户可以立即采取行动。

How it works

AutoRAG 作为一个专门的搜索智能体(基于 Pi agent loop)运行,使用单个配置的模型来管理整个检索、阅读、判断和整理循环。它采用了几个关键机制:

  • Pluggable Retrieval: 它支持多种搜索策略,包括字面模式匹配 (grep)、语义向量搜索和关键词排名 (BM25),通常将它们结合成混合检索。
  • Direct File Access: 智能体使用内置的 bash 工具直接从配置的目录中打开并读取源材料。
  • Self-Evolving Memory: 它从每次搜索中学习,跟踪哪些检索方法和文档区域对特定查询最有效,并结合用户反馈随时间不断改进。
  • Advanced PDF Handling: 它使用默认解析器,并针对稀疏或多页 PDF 提供回退到混合后端 (docling-fast) 的机制,以确保高质量的提取。
  • Datasource Skills: 它可以通过外部 CLI 工具(如 wacrawl, slacrawl, discrawl)与外部数据源(如 Slack, Discord, Notion, GitHub, Gmail, Obsidian)集成,从而将外部通信和知识库引入到同一个检索流水线中。

Who it’s for

管理着庞大且碎片化的文档集合(PDFs, wikis, notes, research papers)以及外部通信渠道(chat apps, email, cloud drives)的用户,并且需要一个能够提供综合答案而非仅仅是搜索结果列表的系统。

Highlights

  • Curated Answers: 返回结构化的知识单元而非原始文件路径。
  • Self-Improving: 通过使用过程学习检索策略和高效的文档区域。
  • Multi-Modal Retrieval: 针对不同文档类型结合了 BM25, vector, 和 hybrid search。
  • Extensive Datasource Integration: 通过 rclone 连接到广泛的平台,包括 KakaoTalk, WhatsApp, Telegram, Slack, Discord, Notion, GitHub, Gmail, 和 cloud drives。
  • Duplicate Management: 集成了 dupey 以在索引期间检测并排除完全重复的文档。
  • Optional Discovery: 可以选择加入 Jikji 以获得先发现后索引的发现层。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目