usemoss/moss

The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.

解決する課題

ほとんどの検索スタックはリモートのベクトルデータベースに依存しており、200〜500ミリ秒のネットワーク遅延が発生します。これが原因で、リアルタイムの対話型AIエージェントの応答が遅れることがあります。Mossは、検索と埋め込みをアプリケーションプロセス内で直接実行することで、この「ホットパスにおけるネットワークホップ」を排除し、10ミリ秒未満のクエリレイテンシを実現します。

仕組み

Mossは、従来のデータベースではなく、検索ランタイムとして動作します。以下の3つのコンポーネントで構成されています:

  1. Moss Cloud: ドキュメントの取り込み、埋め込み、保存、および配布を管理します。
  2. Index: Moss Cloudに保存されたドキュメントとベクトルのパッケージ化されたアーティファクトです。
  3. Runtime: アプリケーションに組み込まれたSDKで、HTTPS経由でインデックスを取得し、メモリ内に保持し、ローカルでクエリを実行します。

サーバーサイド実行(Python, Node.js, Elixir, C)と、ブラウザ向けのWebAssemblyビルドによるクライアントサイド実行をサポートしています。

対象ユーザー

音声ボット、コパイロット、または低遅延がユーザー体験に不可欠な対話型インターフェースなど、リアルタイムAIエージェントを構築している開発者。

ハイライト

  • 超低遅延: エンドツーエンドのクエリ時間(埋め込み + 検索)が10ミリ秒未満。
  • ハイブリッド検索: セマンティック検索とキーワード検索を単一のクエリで組み合わせます。
  • 組み込みの埋め込み: 埋め込みモデルが標準で含まれており、外部APIキーの必要がありません。
  • 柔軟なデプロイ: バックエンド、またはWASMを介してブラウザ内でのみ実行可能です。
  • 幅広い統合: LangChain, LlamaIndex, DSPy、および各種音声AIプラットフォーム(Vapi, ElevenLabs, LiveKit)などのフレームワークと互換性があります。