usemoss/moss

The retrieval layer for production AI systems. Lightning-fast (<10ms) search without vector databases. Built for browser, edge, on-device, and cloud.

해결하는 문제

대부분의 검색 스택은 원격 벡터 데이터베이스에 의존하므로 200~500ms의 네트워크 지연이 발생하며, 이는 실시간 대화형 AI 에이전트의 반응을 느리게 만들 수 있습니다. Moss는 검색 및 임베딩을 애플리케이션 프로세스 내에서 직접 실행하여 이러한 "핫 패스에서의 네트워크 홉"을 제거하고 10ms 미만의 쿼리 지연 시간을 달성합니다.

작동 방식

Moss는 전통적인 데이터베이스가 아닌 검색 런타임으로 작동합니다. 다음 세 가지 구성 요소로 이루어져 있습니다:

  1. Moss Cloud: 문서 수집, 임베딩, 저장 및 배포를 관리합니다.
  2. Index: Moss Cloud에 저장된 문서 및 벡터의 패키지 아티팩트입니다.
  3. Runtime: 애플리케이션에 내장된 SDK로, HTTPS를 통해 인덱스를 가져오고 메모리에 유지하며 로컬에서 쿼리를 실행합니다.

서버 측 실행(Python, Node.js, Elixir, C) 및 브라우저를 위한 WebAssembly 빌드를 통한 클라이언트 측 실행을 지원합니다.

대상 사용자

음성 봇, 코파일럿 또는 저지연이 사용자 경험에 중요한 모든 대화형 인터페이스와 같은 실시간 AI 에이전트를 구축하는 개발자.

주요 특징

  • 초저지연: 엔드 투 엔드 쿼리 시간(임베딩 + 검색)이 10ms 미만입니다.
  • 하이브리드 검색: 단일 쿼리 내에서 시맨틱 검색과 키워드 검색을 결합합니다.
  • 내장 임베딩: 임베딩 모델이 기본적으로 포함되어 있어 외부 API 키가 필요하지 않습니다.
  • 유연한 배포: 백엔드 또는 WASM을 통해 브라우저에서 완전히 실행할 수 있습니다.
  • 폭넓은 통합: LangChain, LlamaIndex, DSPy 및 다양한 음성 AI 플랫폼(Vapi, ElevenLabs, LiveKit)과 같은 프레임워크와 호환됩니다.