Marker-Inc-Korea/AutoRAG
AutoRAG: Now your agent can find anything in your computer. It gets smarter if you are using it frequently.
What it solves
AutoRAG 是一个“图书管理员智能体”,旨在取代传统的仅提供文件路径列表和匹配行的搜索工具。AutoRAG 不再强迫用户手动打开文件、阅读上下文并综合答案,而是跨各种文档集合进行搜索,直接读取源材料,并整理出一份结构化的、带编号的知识单元(答案)列表,用户可以立即采取行动。
How it works
AutoRAG 作为一个专门的搜索智能体(基于 Pi agent loop)运行,使用单个配置的模型来管理整个检索、阅读、判断和整理循环。它采用了几个关键机制:
- Pluggable Retrieval: 它支持多种搜索策略,包括字面模式匹配 (grep)、语义向量搜索和关键词排名 (BM25),通常将它们结合成混合检索。
- Direct File Access: 智能体使用内置的
bash工具直接从配置的目录中打开并读取源材料。 - Self-Evolving Memory: 它从每次搜索中学习,跟踪哪些检索方法和文档区域对特定查询最有效,并结合用户反馈随时间不断改进。
- Advanced PDF Handling: 它使用默认解析器,并针对稀疏或多页 PDF 提供回退到混合后端 (
docling-fast) 的机制,以确保高质量的提取。 - Datasource Skills: 它可以通过外部 CLI 工具(如
wacrawl,slacrawl,discrawl)与外部数据源(如 Slack, Discord, Notion, GitHub, Gmail, Obsidian)集成,从而将外部通信和知识库引入到同一个检索流水线中。
Who it’s for
管理着庞大且碎片化的文档集合(PDFs, wikis, notes, research papers)以及外部通信渠道(chat apps, email, cloud drives)的用户,并且需要一个能够提供综合答案而非仅仅是搜索结果列表的系统。
Highlights
- Curated Answers: 返回结构化的知识单元而非原始文件路径。
- Self-Improving: 通过使用过程学习检索策略和高效的文档区域。
- Multi-Modal Retrieval: 针对不同文档类型结合了 BM25, vector, 和 hybrid search。
- Extensive Datasource Integration: 通过 rclone 连接到广泛的平台,包括 KakaoTalk, WhatsApp, Telegram, Slack, Discord, Notion, GitHub, Gmail, 和 cloud drives。
- Duplicate Management: 集成了
dupey以在索引期间检测并排除完全重复的文档。 - Optional Discovery: 可以选择加入
Jikji以获得先发现后索引的发现层。
相关
- 项目
- 项目
- 项目
- 项目
- 项目