GPU 管理:为何闲置 GPU 成为新型停飞飞机
从模型质量到计算约束的转变
企业 AI 已达到一个临界点,主要制约因素不再是模型的智能,而是其运行硬件的利用率。由于 GPU 按日历小时计费,无论是否在使用,最大化投资回报率需要从单纯的采购转向主动、持续的 GPU 管理。
在企业 AI 的第一波浪潮中,竞争优势来源于模型质量、参数数量和排行榜排名。然而,随着模型足够强大以处理真实的企业工作负载,瓶颈转向了运行这些模型所需的专用硬件。
计算资源稀缺仍然是即使是资本最充足的实验室也面临的关键战略约束。例如,Anthropic 在四个平台(Amazon、Google、Microsoft 和 AMD)上同时管理多吉瓦级的承诺,以确保足够的容量。
对企业而言,这种稀缺表现为定价问题。虽然 API 成本随令牌使用量线性增长,拥有基础设施则将可变成本转为固定资本支出。然而,拥有 GPU 带来了新的挑战:确保硬件保持忙碌。一旦集群上线,战略问题就从能否获取加速器转变为能否保持其被利用。
高占用率并不等同于效率
集群即使报告出高平均占用率,仍可能浪费大量潜力。这种低效源于 GPU 需求并非恒定,不同工作负载对硬件的需求相互冲突:
- 实时推理: 优先低延迟。
- 批处理工作: 优先吞吐量,容忍延迟。
- 训练: 需要数小时或数天的持续占用。
- 量化: 需要短时间内的高容量。
GPU 管理作为学科的兴起
最大化 GPU 投资回报率需要一个编排层——GPU 管理,位于工作负载、模型和硬件之间。该层实时、自动地决定哪个工作负载运行在特定的 GPU 上以及其优先级。
此转变将智能从模型边界转移到基础设施。虽然供应是购买时一次性的决策,但分配是持续的过程。自动化编排是必要的,因为人工监督无法应对所需的高频决策——例如决定已完成的训练任务是否应将 GPU 交给排队的批处理作业,或保留以应对客户流量的突发。
专业化与编排的协同效应
缩小已装容量与有效产出之间的差距需要两条并行策略:模型专业化和基础设施编排。
模型专业化
专用的、更小的模型可以以大型通用模型资源成本的一小部分完成特定任务。这释放了原本会被大型模型占用的容量,使其在作业期间可供其他使用。
编排
只有在编排层主动回收并重新分配释放的容量时,专业化才能提升投资回报率。若没有编排,专用模型节省的容量仅会转化为另一种闲置浪费。
随着行业成熟,能够通过专业化同时缩减每个工作负载资源需求,并通过主动 GPU 管理最大化基础设施回报的公司,将引领 AI 竞争的步伐。