AWS 和 OpenAI 战略合作伙伴关系

AWS 和 OpenAI 宣布了一项多年战略合作伙伴关系,以向 OpenAI 提供对 AWS 基础设施的即时访问,以扩展其核心 AI 工作负载。这项价值 380 亿美元的协议,为期七年,使 OpenAI 能够利用 AWS 的大规模基础设施扩展其计算能力,以支持下一代模型的训练以及 ChatGPT 的推理服务。

计算基础设施与扩展

OpenAI 将使用由数十万台最先进的 NVIDIA GPU 组成的 AWS 计算资源,并且有能力扩展到数千万 CPU。此基础设施专门设计用于支持代理工作负载的快速扩展以及前沿 AI 模型所需的通用计算能力需求。

硬件与架构

基础设施部署具有一种针对 AI 处理效率进行优化的架构设计。关键技术规格包括:

  • 硬件: 该部署利用 Amazon EC2 UltraServers 将 NVIDIA GB200 和 GB300 聚簇。
  • 连通性: 通过将这些 GPU 在同一网络上聚簇,系统在互连系统之间实现低延迟性能。
  • 部署时间表: 所有初始容量的目标是在 2026 年底之前部署,并有进一步扩展到 2027 年及以后的选项。

战略目标与模型部署

此合作伙伴关系旨在加强支持下一代 AI 时代所需的计算生态系统。根据 OpenAI 首席执行官 Sam Altman 的说法:“扩展前沿 AI 需要巨大且可靠的计算资源。”

与 Amazon Bedrock 的集成

在此战略合作伙伴关系之前,OpenAI 的开放权重基础模型已在 Amazon Bedrock 上提供。这已经导致包括 Peloton、Thomson Reuters、Comscore、Bystreet、Triomics 和 Verana Health 在内的数千客户使用 OpenAI 模型执行诸如下列任务:

  • 代理工作流程
  • 编码
  • 编码和科学分析
  • 数学问题求解

运营规模与安全

AWS 提供了 OpenAI 大规模工作负载所需的规模和安全性。AWS 有管理超过 500,000 块芯片的集群经验,这确保了用于运行 ChatGPT 和训练未来模型的基础设施的可靠性。

Sources