laminlabs/lamindb
Open-source data management for multimodal AI. Query, trace, and govern with a lineage-native, format-agnostic lakehouse for agents and teams. With support for biological formats and registries by the creators of Scanpy. 🍊YC S22
解決的問題
LaminDB 提供一個統一的系統,用於管理多模態 AI 數據集,特別解決研究工作流程中缺乏可追溯性與治理的問題。它防止了『黑箱』問題——由於無法確定產生結果所使用的精確數據、程式碼與環境,導致結果不可信。此系統特別針對生命科學等高合規性環境(GxP 合規)設計,其中端到端的血緣關係是強制要求的。
工作原理
LaminDB 採用可擴展的湖倉架構,將元數據(儲存在 SQLite 或 Postgres 中)與實際數據(儲存在 Parquet 和 Zarr 等開放格式中)分離。它將檔案、表格、陣列與本體整合至單一系統中。
關鍵機制包括:
- 血緣追蹤:使用
ln.track()自動記錄來源程式碼、計算環境、輸入與輸出之間的關係。 - 版本控制:同時對程式碼與數據集進行版本化,允許使用者追蹤變更並回滾至先前狀態。
- 分支:實作類似 Git 的分支與合併系統,用於隔離數據變更。
- 模式驗證:使用特徵與註冊表驗證 DataFrame 及生物數據格式(如 AnnData)的內容。
適用對象
專為生物科技公司、研究型醫院與學術機構中的科學家與工程師設計,適用於管理大型多模態數據集(從蛋白質、基因到生物樣本),並需要嚴格可重現性的使用者。
主要亮點
- 無鎖定:使用開放標準進行元數據與儲存。
- 多模態支援:原生支援生物格式、表格與陣列。
- AI Agent 就緒:內建技能,使 AI Agent 能自動追蹤其自身會話與計畫。
- 分散式聯邦:支援跨不同資料庫的零複製資料傳輸與具備血緣感知的共享。
- 本體整合:透過
bionty插件支援公開生物本體。
相關
- 專案
- 專案
- 專案
- 專案
- 專案