chroma-core/chroma

Search infrastructure for AI

What it solves

Chroma 为 AI 提供开源的数据基础设施,特别专注于嵌入向量的存储和检索。它简化了为 AI 应用创建向量数据库的过程,允许开发者存储文档和其相关的元数据(metadata),然后进行相似度搜索以找到最相关的信息。

How it works

Chroma 作为一个向量数据库,会自动处理分词(tokenization)、嵌入(embedding)和索引(indexing)。用户可以创建文档集合(collections),添加具有唯一 ID 和元数据(metadata)的文档,然后使用查询文本来查询这些集合,以根据向量相似度检索出最相似的结果。 它支持内存原型设计和持久化存储,以及客户端-服务器模式。

Who it’s for

它是为 AI 开发人员设计的,这些开发人员需要一种快速且简单的方式,为他们的 AI 应用集成向量搜索和数据持久化,无论是在 Python 或 JavaScript 中进行原型设计。

Highlights

  • 向量、混合和全文搜索能力。
  • 自动处理分词、嵌入和索引。
  • 具有创建集合、添加文档和元数据过滤的核心功能的简单 API。
  • 支持 Python 和 JavaScript 客户端。
  • 支持通过 Chroma Cloud 提供托管的无服务器版本。