laminlabs/lamindb
Open-source data management for multimodal AI. Query, trace, and govern with a lineage-native, format-agnostic lakehouse for agents and teams. With support for biological formats and registries by the creators of Scanpy. 🍊YC S22
解决的问题
LaminDB 提供了一个统一的系统,用于管理多模态 AI 数据集,特别解决了研究工作流中缺乏可追溯性和治理的问题。它防止了‘黑箱’问题——由于无法确定生成结果所使用的精确数据、代码和环境,导致结果不可信。该系统特别针对生命科学等高合规性环境(GxP 合规)设计,其中端到端的血缘关系是强制要求的。
工作原理
LaminDB 采用可扩展的湖仓架构,将元数据(存储在 SQLite 或 Postgres 中)与实际数据(存储在 Parquet 和 Zarr 等开放格式中)分离。它将文件、表格、数组和本体整合到一个统一系统中。
关键机制包括:
- 血缘追踪:使用
ln.track()自动记录源代码、计算环境、输入和输出之间的关系。 - 版本控制:同时对代码和数据集进行版本化,允许用户追踪变更并回滚到之前的状态。
- 分支:实现类似 Git 的分支和合并系统,用于隔离数据变更。
- 模式验证:使用特征和注册表验证 DataFrame 以及生物数据格式(如 AnnData)的内容。
适用人群
专为生物技术公司、研究型医院和学术机构中的科学家与工程师设计,适用于管理大规模多模态数据集(从蛋白质、基因到生物样本),并需要严格可复现性的用户。
主要亮点
- 无锁定:使用开放标准进行元数据和存储。
- 多模态支持:原生支持生物格式、表格和数组。
- AI Agent 就绪:内置技能,使 AI Agent 能够自动追踪其自身会话和计划。
- 分布式联邦:支持跨不同数据库的零拷贝数据传输和具备血缘感知的共享。
- 本体集成:通过
bionty插件支持公共生物本体。
相关
- 项目
- 项目
- 项目
- 项目
- 项目