ray-project/ray

Ray is an AI compute engine. Ray consists of a core distributed runtime and a set of AI Libraries for accelerating ML workloads.

What it solves

Ray 旨在解决扩展 Python 和 AI 应用的问题。它允许开发者在无需更改基础设施或重写代码的情况下,从单节点开发环境(如笔记本电脑)向大规模集群扩展。

How it works

Ray 提供了一个核心的分布式运行时,具有三个关键抽象概念: \n* Tasks: Stateless functions 在集群中执行。

  • Actors: Stateful worker processes 在集群中执行。
  • Objects: 不可变的值,可以在集群中访问。

它还包含了一套专用的 AI 库,以简化机器学习计算,包括用于数据处理、分布式训练、超参数调优和强化学习的库。

Who it’s for

它是为 Python 开发者和 AI 研究人员设计的,需要高效地运行计算密集型 ML 工作负载,且这些工作负载已经超出了其本地机器的范围。

Highlights

  • Unified Framework: Python 应用可以从笔记本电脑无缝地扩展到集群。 \
  • AI Libraries: 包含用于 Data, Train, Distributed Training, Tune (Hyperparameter Tuning), RLlib (Reinforcement Learning), 和 Serve (Model Serving) 的专用工具。
  • Flexible Deployment: 可以在任何机器、集群、云端提供商或 Kubernetes 上运行。
  • Observability: 包含用于监控的内置 Dashboard 和用于故障排除的 Debugger。