benchen4395/alpha_agentic_search
Alpha Agentic Search — 分层记忆 RAG 检索问答系统
解決する課題
Alpha Agentic Search (AAS) は、従来のAI検索エージェントにおける不安定性、高レイテンシ、およびパーソナライズの欠如に対処します。階層型メモリシステムを実装することで時間とともに改善される、制御可能で低レイテンシのWebベースQ&Aフレームワークを提供し、頻繁に発生する質問や以前に回答した質問が、高い事実の正確性を維持しながらミリ秒の応答時間で処理されることを保証します。
仕組み
システムは古典的な Route → Rewrite → Retrieve → Verify → Summary パイプラインに従います:
- ショートサーキット (L1): QAキャッシュで完全またはファジーマッチをチェックし、即座に回答を返します。
- ルーティング: 専用ツール(例:Weather、GitHub、arXiv)がクエリに回答できるかどうかを判断します。できない場合は、検索に進みます。
- リライティング: 検索精度を向上させるために、時間と位置のコンテキストをクエリに注入します。
- 階層型RAG (L1–L5): 5つのレイヤー(L1 (QA Cache)、L2 (Wikipedia)、L3 (History)、L4 (Real-time Web)、L5 (Knowledge Graph))から並行してデータを検索します。結果はReciprocal Rank Fusion (RRF) を使用して融合され、関連性の確率に較正されます。
- 要約: LLMが検索された証拠を最終的な回答に統合し、ソースの帰属と引用の検証を含めます。
対象者
- 純粋な研究よりも安定性とレイテンシを優先する、本番環境対応の検索エージェントフレームワークを探しているAIエンジニアとアーキテクト。
- 「使うほどに強くなる」メモリメカニズムを備えた個人検索アシスタントを構築したい開発者。
- マルチエージェント検索パイプラインのリファレンス実装を求める、AI検索分野の初心者。
ハイライト
- 5層メモリスタック: 高速キャッシュ、教科書の常識、ユーザー履歴、リアルタイムWeb、および構造化された知識グラフを組み合わせています。
- クロスレイヤースコア較正: Platt scalingを使用して、異なるスコアリング指標(cosine、rankなど)を統一された信頼度スコアにマッピングします。
- L1キャッシュガードレール: 厳格なアドミッションポリシーと「slot gate」整合性チェックを実装し、間違った、または古い回答のキャッシュを防ぎます。
- プロンプトインジェクション保護: 信頼できないWebコンテンツを保護するために、3層防御(コンテンツクリーニング、XML構造区切り文字、システムプロンプトガード)を採用しています。
- レイテンシガバナンス: 階層化されたレイテンシ予算、ソフトタイムアウト、および戦略的な「RAG-first, LLM-last」ウォームアップシーケンスを備え、TTFTを最小化します。
- エンティティ曖昧さ回避: 知識グラフ内の曖昧なエンティティを解決するために、人気度(入次数)とクエリコンテキストシグナルの組み合わせを使用します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト