usemoss/moss
The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.
解決する課題
ほとんどの検索スタックはリモートのベクトルデータベースに依存しており、200〜500ミリ秒のネットワーク遅延が発生します。これが原因で、リアルタイムの対話型AIエージェントの応答が遅れることがあります。Mossは、検索と埋め込みをアプリケーションプロセス内で直接実行することで、この「ホットパスにおけるネットワークホップ」を排除し、10ミリ秒未満のクエリレイテンシを実現します。
仕組み
Mossは、従来のデータベースではなく、検索ランタイムとして動作します。以下の3つのコンポーネントで構成されています:
- Moss Cloud: ドキュメントの取り込み、埋め込み、保存、および配布を管理します。
- Index: Moss Cloudに保存されたドキュメントとベクトルのパッケージ化されたアーティファクトです。
- Runtime: アプリケーションに組み込まれたSDKで、HTTPS経由でインデックスを取得し、メモリ内に保持し、ローカルでクエリを実行します。
サーバーサイド実行(Python, Node.js, Elixir, C)と、ブラウザ向けのWebAssemblyビルドによるクライアントサイド実行をサポートしています。
対象ユーザー
音声ボット、コパイロット、または低遅延がユーザー体験に不可欠な対話型インターフェースなど、リアルタイムAIエージェントを構築している開発者。
ハイライト
- 超低遅延: エンドツーエンドのクエリ時間(埋め込み + 検索)が10ミリ秒未満。
- ハイブリッド検索: セマンティック検索とキーワード検索を単一のクエリで組み合わせます。
- 組み込みの埋め込み: 埋め込みモデルが標準で含まれており、外部APIキーの必要がありません。
- 柔軟なデプロイ: バックエンド、またはWASMを介してブラウザ内でのみ実行可能です。
- 幅広い統合: LangChain, LlamaIndex, DSPy、および各種音声AIプラットフォーム(Vapi, ElevenLabs, LiveKit)などのフレームワークと互換性があります。