ray-project/ray
Ray is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads.
What it solves
Ray 旨在解决扩展 Python 和 AI 应用的问题。它允许开发者在无需更改基础设施或重写代码的情况下,从单节点开发环境(如笔记本电脑)向大规模集群扩展。
How it works
Ray 提供了一个核心的分布式运行时,具有三个关键抽象概念: \n* Tasks: Stateless functions 在集群中执行。
- Actors: Stateful worker processes 在集群中执行。
- Objects: 不可变的值,可以在集群中访问。
它还包含了一套专用的 AI 库,以简化机器学习计算,包括用于数据处理、分布式训练、超参数调优和强化学习的库。
Who it’s for
它是为 Python 开发者和 AI 研究人员设计的,需要高效地运行计算密集型 ML 工作负载,且这些工作负载已经超出了其本地机器的范围。
Highlights
- Unified Framework: Python 应用可以从笔记本电脑无缝地扩展到集群。 \
- AI Libraries: 包含用于 Data, Train, Distributed Training, Tune (Hyperparameter Tuning), RLlib (Reinforcement Learning), 和 Serve (Model Serving) 的专用工具。
- Flexible Deployment: 可以在任何机器、集群、云端提供商或 Kubernetes 上运行。
- Observability: 包含用于监控的内置 Dashboard 和用于故障排除的 Debugger。