laminlabs/lamindb

Open-source data management for multimodal AI. Query, trace, and govern with a lineage-native, format-agnostic lakehouse for agents and teams. With support for biological formats and registries by the creators of Scanpy. 🍊YC S22

解決的問題

LaminDB 提供一個統一的系統,用於管理多模態 AI 數據集,特別解決研究工作流程中缺乏可追溯性與治理的問題。它防止了『黑箱』問題——由於無法確定產生結果所使用的精確數據、程式碼與環境,導致結果不可信。此系統特別針對生命科學等高合規性環境(GxP 合規)設計,其中端到端的血緣關係是強制要求的。

工作原理

LaminDB 採用可擴展的湖倉架構,將元數據(儲存在 SQLite 或 Postgres 中)與實際數據(儲存在 Parquet 和 Zarr 等開放格式中)分離。它將檔案、表格、陣列與本體整合至單一系統中。

關鍵機制包括:

  • 血緣追蹤:使用 ln.track() 自動記錄來源程式碼、計算環境、輸入與輸出之間的關係。
  • 版本控制:同時對程式碼與數據集進行版本化,允許使用者追蹤變更並回滾至先前狀態。
  • 分支:實作類似 Git 的分支與合併系統,用於隔離數據變更。
  • 模式驗證:使用特徵與註冊表驗證 DataFrame 及生物數據格式(如 AnnData)的內容。

適用對象

專為生物科技公司、研究型醫院與學術機構中的科學家與工程師設計,適用於管理大型多模態數據集(從蛋白質、基因到生物樣本),並需要嚴格可重現性的使用者。

主要亮點

  • 無鎖定:使用開放標準進行元數據與儲存。
  • 多模態支援:原生支援生物格式、表格與陣列。
  • AI Agent 就緒:內建技能,使 AI Agent 能自動追蹤其自身會話與計畫。
  • 分散式聯邦:支援跨不同資料庫的零複製資料傳輸與具備血緣感知的共享。
  • 本體整合:透過 bionty 插件支援公開生物本體。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案