usemoss/moss

The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.

解决的问题

大多数检索栈依赖于远程向量数据库,这会引入 200–500 毫秒的网络延迟,导致实时对话式 AI 智能体的响应迟缓。Moss 通过在应用程序进程内直接运行搜索和嵌入,消除了这种“热路径上的网络跳转”,实现了亚 10 毫秒的查询延迟。

工作原理

Moss 是作为一个搜索运行时而非传统的数据库运行的。它由三个部分组成:

  1. Moss Cloud:管理文档摄取、嵌入、存储和分发。
  2. Index:存储在 Moss Cloud 上的文档和向量的打包产物。
  3. Runtime:嵌入在应用程序中的 SDK,通过 HTTPS 获取索引,将其保存在内存中,并在本地执行查询。

它支持服务端执行(Python, Node.js, Elixir, C)以及通过 WebAssembly 构建实现的客户端执行(浏览器)。

适用对象

构建实时 AI 智能体的开发者,例如语音机器人、Copilot 或任何对低延迟有极高要求的对话式界面。

亮点

  • 超低延迟:亚 10 毫秒的端到端查询时间(嵌入 + 搜索)。
  • 混合搜索:在单个查询中结合语义搜索和关键词搜索。
  • 内置嵌入:开箱即用包含嵌入模型,无需外部 API 密钥。
  • 灵活部署:可在后端运行,也可通过 WASM 完全在浏览器中运行。
  • 广泛集成:兼容 LangChain, LlamaIndex, DSPy 以及各种语音 AI 平台(Vapi, ElevenLabs, LiveKit)。