quiltdata/quilt

Quilt is a Scientific Data Management Platform on AWS that helps teams and AI find, trust, and reuse data through deeply versioned, context-rich data packages.

解决的问题

Quilt 解决了科学数据长期可用性的挑战。它防止了团队和工作流演进过程中通常会丢失的上下文、结构和血缘信息,从而避免了AI项目进展缓慢以及数据团队陷入手动支持角色的情况。

工作原理

Quilt 将云数据转换为持久、可搜索且可重用的「包」。每个包将数据与其元数据、文档和版本历史记录捆绑在一起。基于 AWS 构建,允许组织在不进行破坏性迁移的情况下原地管理数据。

适用对象

适用于科学机构、数据科学家以及对数据可复现性和可信度至关重要的生物信息学工作负载。

主要亮点

  • 深度版本控制: 记录数据包的版本历史和血缘信息,确保可复现性。
  • 原生 AWS 支持: 直接与 AWS 上的数据协同工作,无需严格的迁移流程。
  • Python SDK 与 CLI: 提供用于创建、安装和上传包至 S3 的工具。
  • 混合模式: 同时提供开源 SDK/CLI 和具备高级搜索与可视化功能的企业级平台。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目