usemoss/moss

The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.

解決的問題

大多數檢索棧依賴於遠端向量資料庫,這會引入 200–500 毫秒的網路延遲,可能導致即時對話式 AI 代理反應遲緩。Moss 透過在應用程式程序內直接執行搜尋與嵌入,消除了這種「熱路徑上的網路跳轉」,實現了亞 10 毫秒的查詢延遲。

工作原理

Moss 是作為一個搜尋執行期而非傳統的資料庫運作。它由三個部分組成:

  1. Moss Cloud:管理文件攝取、嵌入、儲存與分發。
  2. Index:儲存在 Moss Cloud 上的文件與向量的封裝產物。
  3. Runtime:嵌入在應用程式中的 SDK,透過 HTTPS 獲取索引,將其保存在記憶體中,並在本地執行查詢。

它支援伺服器端執行(Python, Node.js, Elixir, C)以及透過 WebAssembly 建置實現的用戶端執行(瀏覽器)。

適用對象

構建即時 AI 代理的開發者,例如語音機器人、Copilot 或任何對低延遲有極高要求的對話式介面。

亮點

  • 超低延遲:亞 10 毫秒的端到端查詢時間(嵌入 + 搜尋)。
  • 混合搜尋:在單一查詢中結合語義搜尋與關鍵字搜尋。
  • 內建嵌入:開箱即用包含嵌入模型,無需外部 API 金鑰。
  • 靈活部署:可在後端執行,也可透過 WASM 完全在瀏覽器中執行。
  • 廣泛整合:相容於 LangChain, LlamaIndex, DSPy 以及各種語音 AI 平台(Vapi, ElevenLabs, LiveKit)。