Hugging Face 与 FriendliAI 合作进行模型部署

Hugging Face 和 FriendliAI 已合作,将 FriendliAI 的推理基础设施直接集成到 Hugging Face Hub。此合作使开发者能够通过模型卡上的“部署此模型”按钮部署生成式 AI 模型,减少了模型发现与生产服务之间的摩擦。

高性能推理基础设施

FriendliAI 提供基于 GPU 的生成式 AI 推理,针对速度和成本效益进行了优化。根据 Artificial Analysis,FriendliAI 被评为最快的基于 GPU 的生成式 AI 推理提供商。这种性能得益于以下几项核心技术优化:

  • 连续批处理: 优化请求处理方式以提高吞吐量。
  • 原生量化: 在不显著损失性能的情况下减小模型大小和内存需求。
  • 行业领先的自动伸缩: 动态调整资源以匹配需求,降低延迟和运营成本。

一键部署工作流

此集成使从 Hugging Face Hub 到 FriendliAI 部署环境的过渡变得无缝。用户现在可以在模型卡的部署选项中选择 Friendli Endpoints,这将把他们重定向到 FriendliAI 模型部署页面。

从这个界面,用户可以使用 Friendli Suite 账户部署开源或自定义的生成式 AI 模型。此工作流程简化了将模型从 Hub 移动到托管推理服务的过程,无需手动配置基础设施。

部署选项:专用端点 vs. 无服务器端点

Friendli 专用端点

专用端点提供在 NVIDIA H100 GPU 上部署模型的托管服务。此选项专为需要峰值性能和对其基础设施完全控制的用户设计。FriendliAI 的优化推理引擎使开发者能够减少维持高性能所需的 GPU 总数,从而降低与 H100 集群相关的运营成本。

Friendli 无服务器端点

无服务器端点提供低成本、高性能的 API,用于推理由 FriendliAI 优化的开源模型。这是一种精简的解决方案,适合希望在不管理任何底层硬件或专用实例的情况下使用强大开源模型的开发者。

对 AI 开发的影响

此合作消除了基础设施管理的复杂性,使开发者和研究者能够专注于模型创新,而不是 GPU 编排的后勤工作。通过直接访问优化的 NVIDIA H100 基础设施和无服务器选项,该合作提高了全球开发者对高性能开源 AI 的可访问性。

Sources