laminlabs/lamindb

Open-source data management for multimodal AI. Query, trace, and govern with a lineage-native, format-agnostic lakehouse for agents and teams. With support for biological formats and registries by the creators of Scanpy. 🍊YC S22

解决的问题

LaminDB 提供了一个统一的系统,用于管理多模态 AI 数据集,特别解决了研究工作流中缺乏可追溯性和治理的问题。它防止了‘黑箱’问题——由于无法确定生成结果所使用的精确数据、代码和环境,导致结果不可信。该系统特别针对生命科学等高合规性环境(GxP 合规)设计,其中端到端的血缘关系是强制要求的。

工作原理

LaminDB 采用可扩展的湖仓架构,将元数据(存储在 SQLite 或 Postgres 中)与实际数据(存储在 Parquet 和 Zarr 等开放格式中)分离。它将文件、表格、数组和本体整合到一个统一系统中。

关键机制包括:

  • 血缘追踪:使用 ln.track() 自动记录源代码、计算环境、输入和输出之间的关系。
  • 版本控制:同时对代码和数据集进行版本化,允许用户追踪变更并回滚到之前的状态。
  • 分支:实现类似 Git 的分支和合并系统,用于隔离数据变更。
  • 模式验证:使用特征和注册表验证 DataFrame 以及生物数据格式(如 AnnData)的内容。

适用人群

专为生物技术公司、研究型医院和学术机构中的科学家与工程师设计,适用于管理大规模多模态数据集(从蛋白质、基因到生物样本),并需要严格可复现性的用户。

主要亮点

  • 无锁定:使用开放标准进行元数据和存储。
  • 多模态支持:原生支持生物格式、表格和数组。
  • AI Agent 就绪:内置技能,使 AI Agent 能够自动追踪其自身会话和计划。
  • 分布式联邦:支持跨不同数据库的零拷贝数据传输和具备血缘感知的共享。
  • 本体集成:通过 bionty 插件支持公共生物本体。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目