NVIDIA/aistore
AIStore: scalable storage for AI applications
解决的问题
AIStore (AIS) 解决了 AI 和机器学习工作负载中常见的存储瓶颈。它提供了一个高性能、可扩展的分布式存储栈,能够在多个云后端和本地集群之间处理大规模数据集,而不会像将远程数据视为简单缓存时那样出现性能下降。
工作原理
AIS 作为一个弹性集群的存储节点和网关运行,可部署在裸金属 Linux 机器或 Kubernetes 上。它使用统一命名空间来管理独立集群之间的数据,并支持原生 HTTP API 和 S3 兼容 API。系统具备 "Get-Batch" 操作,可在一次调用中获取整个训练批次,从而减少 ML 管道的开销。它还支持 ETL 卸载,允许在存储节点上直接执行数据转换,以减少数据移动。
适用人群
专为需要管理拍字节级数据集并确保向训练集群高吞吐量数据交付的 AI 研究人员、数据科学家和 ML 工程师设计。
主要亮点
- 多云访问: 无缝管理 AWS S3、GCS、Azure 和 OCI 之间的内容。
- 线性扩展: 随着集群节点数量增加,性能保持一致。
- Get-Batch: 通过一次操作获取多个对象(以 TAR 或其他序列化格式),专为 ML 管道优化。
- ETL 卸载: 在数据附近执行 I/O 密集型转换,支持内联或批处理方式。
- 灵活部署: 可在单个 Linux 虚拟机到拍字节级 Kubernetes 集群的任何环境中运行。
- 原生 PyTorch 集成: 提供专用于 PyTorch 工作流的数据集、采样器和数据加载器。
相关
- 项目
- 项目
- 项目
- 项目
- 项目