usemoss/moss

The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.

解决的问题

大多数AI代理的检索架构依赖于远程向量数据库,导致网络往返延迟增加200–500毫秒。这种延迟会破坏实时对话型AI(如语音机器人或协作者)的流畅性,使其显得响应迟钝。

工作原理

Moss不是传统数据库,而是一个搜索运行时。它采用混合架构,由三部分组成:

  1. Moss Cloud:负责文档摄入、嵌入、存储和分发。
  2. Index:将文档和向量打包为单一的云上存储的工件。
  3. Runtime:作为SDK直接嵌入到应用程序中(支持Python、TypeScript、Elixir和C)。运行时通过HTTPS拉取索引并将其保留在内存中,使查询能在应用程序进程中本地处理,从而在热路径上完全消除网络跳转。

它还提供WebAssembly构建,可在浏览器中完全运行语义搜索。

适用人群

构建实时对话型AI代理、语音机器人、协作者以及需要超低延迟检索的离线优先应用程序的开发者。

核心亮点

  • 超低延迟:通过在进程内运行搜索,实现包含嵌入在内的查询时间低于10毫秒。
  • 混合搜索:在单个查询中结合语义搜索与关键词搜索。
  • 内置嵌入:开箱即用包含嵌入模型,无需外部API密钥。
  • 浏览器支持:基于WASM的SDK可在客户端无需服务器实现语义搜索。
  • 广泛集成:兼容LangChain、LlamaIndex、DSPy以及多种语音AI平台(Pipecat、Vapi、ElevenLabs)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目