セマンティックな類似性を超えて:エージェンティックおよびレキシカルな検索の必要性

現在のAI駆動の情報検索(IR)のトレンドは、セマンティックな類似性、つまり埋め込み(embeddings)を使用してクエリと「概念的に」関連するドキュメントを見つける手法に大きく傾いています。このアプローチは、類義語の問題(「canine」を検索して「dog」を見つけること)を解決しますが、説明責任の欠如、予測不可能な結果、そしてきめ細かな制御の喪失という、新たな一連の課題をもたらしました。

論文 Beyond Semantic Similarity に関する最近の議論は、視点の転換を示唆しています。ブラックボックスである埋め込み空間だけに頼るのではなく、「エージェンティック検索(agentic search)」への関心が高まっています。これは、LLMがオーケストレーターとして機能し、検索用語を反復的に洗練させ、レキシカルなツール(grep のような)を使用し、発見されたコンテキストに基づいてコーパスをナビゲートする手法です。

セマンティック検索の摩擦

多くの開発者やパワーユーザーにとって、純粋なセマンティック検索への移行はフラストレーションの原因となってきました。主な問題は透明性の欠如です。キーワード検索が失敗した場合、その理由は明確です:その単語が存在しないからです。セマンティック検索が失敗したり、無関係な結果を返したりする場合、埋め込みモデルがなぜそのクエリを特定のドキュメントに関連付けたのかを理解することは、しばしば不可能です。

ある実務家は次のように述べています:

セマンティック検索の説明可能性は最悪だ。キーワード検索は、何を見つけていて何を見つけていないのかを正確に理解でき、知的に反復的な試行ができるため、素晴らしい。

この制御の欠如は、現代のウェブ検索エンジンに対する現在の不満を反映しています。現代の検索エンジンは、要求された正確な一致ではなく、ユーザーの意図を解釈しようとすることがよくあります。エージェンティックなワークフローにおいて、検索ツールに対して正確なフィードバックを提供できる能力は、エージェントが正しい答えに収束するために極めて重要です。

エージェンティックなワークフローにおけるレキシカル検索の力

セマンティック検索はしばしば「モダン」であり、キーワード検索は「レガシー」と見なされますが、後者はLLMエージェントと組み合わせることで非常に強力になります。エージェントは grepBM25 のようなツールを使用して正確な一致を見つけ、その結果得られたコンテキストを使用して次のクエリを洗練させることができます。この反復的なループにより、エージェントはプロセス中に発見したドメインに基づいて複数の検索用語を生成することで、類義語を扱うことができます。

特定のドメインは、このアプローチから他のドメインよりも大きな恩恵を受けます。例えば、技術ドキュメントやソースコードには、非常に精密な用語が使用されています。これらの環境では、固定文字列検索がセマンティックな近似よりも信頼できることが多いです。逆に、医療や法律のテキストのように、同じ概念が数十通りの異なる方法で表現される可能性がある場合は、網羅性を確保するために、依然としてセマンティックな第一段階のパスが必要になるかもしれません。

一部の開発者は、既存のバージョン管理ツールを活用することで、エージェントの仕組みを簡素化できることを見出しています。git grepgit log、または git diff を使用することで、エージェントは、埋め込みベースのRAG(Retrieval-Augmented Generation)がしばしば見逃してしまうようなレベルの精度で、複雑なコードベースをナビゲートすることができます。

実用的な制約:レイテンシ、スケール、および言語

エージェンティックなレキシカル検索の理論的な魅力にもかかわらず、いくつかの本番環境での障害が残っています:

1. レイテンシと予測可能性

反復的な検索は、本質的に単一のベクトル検索(vector lookup)よりも遅くなります。ベクトルデータベースは結果をミリ秒単位で返しますが、エージェントがコーパスを「彷徨う」ように、複数のターンにわたって検索を洗練させると、予測不可能なレイテンシが発生する可能性があります。5秒未満のレスポンスタイムを必要とするエンタープライズシステムでは、このアプローチは、バックグラウンドタスクに限定しない限り、遅すぎる可能性があります。

2. スケール問題

grep を用いて小さなローカルなコーパスを検索することは高速です。しかし、数百ギガバイトのエンタープライズデータに対して検索を行うことは、話が別です。分散ファイルシステムや高度に最適化されたインデックスがない限り、データ転送(data egress)のコストと、大規模なデータセットをスキャンすることに要する時間は、生のレキシカル検索を禁止的なコストにすることがあります。

3. クロス言語検索

セマンティックな埋め込みは、クロス言語検索(例:英語でクエリを投げ、ヒンディー語のドキュメントを見つけること)においてしばしば優れています。レキシカル検索は、正確な文字一致に依存するため、翻訳レイヤーが追加されない限り、これらのシナリオリオでは完全に失敗します。

新たなパターン:ハイブリッド検索とMap-Reduce

これらのトレードオフをバランスさせるために、業界はハイブリッドモデルへと収束しています。最も堅牢な本番環境のシステムは、通常、多段階のパイプラインを採用しています:

  1. 初期検索: BM25(レキシカル)と埋め込みベース(セマンティック)検索を組み合わせ、幅広く、かつ関連性の高い範囲をカバーします。
  2. リランキング: より高コストな「LLM-as-judge」またはクロスエンコーダー(cross-encoder)を使用して、精度のためにトップの結果を精査します。
  3. エージェンティックな洗練: 初期結果が不十分な場合、エージェントがインデックスを反復的にクエリするのを許可します。

また、IRにおけるMap-Reduceパターンの復活にも関意が寄せられています。コーパスのシャード(shards)を異なるエージェントにマッピングし、その結果をリデュース(reducing)することで、システムは高い局所性と網羅性を実現し、目的の情報が見つかるまでコーパスを反復的に探索することが可能です。

結論

「セマンティックな類似性を超えて」という動きは、埋め込み(embeddings)を放棄することではなく、それらが多くのツールの中の一つであることを認識することです。高精度なタスク、特に技術的なドメインにおいては、インテリジェントなエージェントによってオーケストレートされたレキシカル検索の透明性と制御性は、セマンティックな類似性の「ブラックボックス」よりも優れた性能を発揮することがよくあります。

Sources