Marker-Inc-Korea/AutoRAG

AutoRAG: Now your agent can find anything in your computer. It gets smarter if you are using it frequently.

解決する課題

AutoRAG は大規模なドキュメントコレクション向けの「ライブラリアンエージェント」として機能し、ファイルパスや一致行だけを提供するシンプルな検索ツールを超えます。ユーザーにファイルを手動で開き、コンテキストを読んで自ら答えを合成させるのではなく、検索・閲覧し、情報をクリーンで番号付けされたナレッジユニットに整理し、クエリに対して直接的な回答を提供します。

仕組み

AutoRAG は Pi エージェントループに基づく二層エージェントアーキテクチャを採用しています。親オーケストレータが計画、メモリチェック、検索シードの処理を行い、探索タスクを専門のエクスプローラーエージェントに委譲します。これらのエクスプローラーは readgrepfindls といったツールを使ってドキュメントを検査します。

高品質な検索を実現するために、複数のプラグイン可能な手法を使用します:

  • 語彙検索:キーワードランキングに BM25 を使用。
  • セマンティック検索:意味理解に MinSync を使用。
  • ハイブリッド検索:精度とリコールの両方を兼ね備えるために両者を組み合わせ。
  • ディスカバリー:オプションで Jikji と統合し、ファインドファーストのディスカバリーとインデックス作成を実現。

また、ユーザーフィードバックと過去の検索結果から学習し、特定のクエリタイプに対して最も効果的な検索手法とドキュメント領域を最適化する自己進化型メモリシステムも備えています。

対象ユーザー

主にマニュアル、法的文書、社内 Wiki、研究論文、会議ノート、PDF など、コード以外のドキュメントコレクションを管理する人向けに設計されています。

ハイライト

  • 自己進化メモリ:使用状況と明示的なユーザーフィードバックから学習し、時間とともに検索精度を向上。
  • 広範なデータソースサポート:Slack、Discord、Notion、GitHub、Google Drive、Gmail、Obsidian など外部ソースに接続可能。
  • マルチメソッド検索:同一インターフェースで BM25 とセマンティック検索(MinSync)を統合。
  • 構造化出力:生の検索結果ではなく、整理されたナレッジユニットを返却。
  • レガシーサポート:WebAssembly パーサーを内蔵し、レガシー HWP5 バイナリファイルからテキストを抽出可能。