usemoss/moss
The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.
解决的问题
大多数检索栈依赖于远程向量数据库,这会引入 200–500 毫秒的网络延迟,导致实时对话式 AI 智能体的响应迟缓。Moss 通过在应用程序进程内直接运行搜索和嵌入,消除了这种“热路径上的网络跳转”,实现了亚 10 毫秒的查询延迟。
工作原理
Moss 是作为一个搜索运行时而非传统的数据库运行的。它由三个部分组成:
- Moss Cloud:管理文档摄取、嵌入、存储和分发。
- Index:存储在 Moss Cloud 上的文档和向量的打包产物。
- Runtime:嵌入在应用程序中的 SDK,通过 HTTPS 获取索引,将其保存在内存中,并在本地执行查询。
它支持服务端执行(Python, Node.js, Elixir, C)以及通过 WebAssembly 构建实现的客户端执行(浏览器)。
适用对象
构建实时 AI 智能体的开发者,例如语音机器人、Copilot 或任何对低延迟有极高要求的对话式界面。
亮点
- 超低延迟:亚 10 毫秒的端到端查询时间(嵌入 + 搜索)。
- 混合搜索:在单个查询中结合语义搜索和关键词搜索。
- 内置嵌入:开箱即用包含嵌入模型,无需外部 API 密钥。
- 灵活部署:可在后端运行,也可通过 WASM 完全在浏览器中运行。
- 广泛集成:兼容 LangChain, LlamaIndex, DSPy 以及各种语音 AI 平台(Vapi, ElevenLabs, LiveKit)。