scverse/anndata

Annotated data.

解决的问题

anndata 提供了一种标准化的方式来处理带注释的数据矩阵,填补了 pandas 和 xarray 之间的空白。它使研究人员能够高效地在内存或磁盘上管理大型数据集——包括单细胞组学分析中使用的数据集。

工作原理

该包实现了一种支持注释矩阵的数据结构。其特点包括计算高效的运算,支持稀疏数据和延迟操作,从而能够在不一次性将所有数据加载到内存中的情况下,高效处理大规模数据集。

适用人群

主要面向数据科学家和研究人员,特别是处理单细胞组学数据的用户(因为它最初是为 Scanpy 开发的),但任何需要注释数据矩阵的应用场景都适用。

主要亮点

  • 专为注释矩阵设计的自定义数据结构
  • 支持稀疏数据以减少内存使用
  • 支持延迟操作以实现高效处理
  • 兼容内存和磁盘后端的数据集
  • 与 scverse 生态系统集成

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目