Hugging Face와 FriendliAI의 모델 배포 파트너십

Hugging Face와 FriendliAI는 파트너십을 맺어 FriendliAI의 추론 인프라를 Hugging Face Hub에 직접 통합했습니다. 이 협력을 통해 개발자는 모델 카드에 있는 '이 모델 배포' 버튼을 사용하여 생성형 AI 모델을 배포할 수 있게 되어, 모델 탐색과 프로덕션 서비스 사이의 마찰을 줄일 수 있습니다.

고성능 추론 인프라

FriendliAI는 속도와 비용 효율성에 최적화된 GPU 기반 생성형 AI 추론을 제공합니다. Artificial Analysis에 따르면, FriendliAI는 가장 빠른 GPU 기반 생성형 AI 추론 제공업체로 랭크되었습니다. 이 성능은 다음과 같은 핵심 기술 최적화에 의해 구동됩니다:

  • 연속 배치: 요청 처리 방식을 최적화하여 처리량을 증가시킵니다.
  • 네이티브 양자화: 성능에 큰 손실 없이 모델 크기와 메모리 요구 사항을 줄입니다.
  • 최고 수준의 자동 스케일링: 수요에 맞춰 리소스를 동적으로 조정하여 지연 시간과 운영 비용을 줄입니다.

원클릭 배포 워크플로

이 통합은 Hugging Face Hub에서 FriendliAI 배포 환경으로 원활한 전환을 가능하게 합니다. 사용자는 이제 모델 카드의 배포 옵션에서 Friendli Endpoints를 선택할 수 있으며, 이는 FriendliAI 모델 배포 페이지로 리디렉션됩니다.

이 인터페이스에서 사용자는 Friendli Suite 계정을 사용하여 오픈소스 또는 커스텀 생성형 AI 모델을 배포할 수 있습니다. 이 워크플로우는 수동 인프라 구성이 필요 없이 Hub에서 관리형 추론 서비스로 모델을 이동하는 과정을 간소화합니다.

배포 옵션: 전용 엔드포인트 대 서버리스 엔드포인트

FriendliAI는 다양한 개발자 요구 사항을 충족하기 위해 두 가지 주요 배포 경로를 제공합니다:

Friendli 전용 엔드포인트

전용 엔드포인트는 NVIDIA H100 GPU에서 모델을 배포하기 위한 관리형 서비스를 제공합니다. 이 옵션은 최고 성능을 요구하고 인프라에 대한 완전한 통제를 원하는 사용자를 위해 설계되었습니다. FriendliAI의 최적화된 추론 엔진은 개발자가 높은 성능을 유지하기 위해 필요한 GPU 총 수를 줄일 수 있게 하여, H100 클러스터와 관련된 운영 비용을 낮춥니다.

Friendli 서버리스 엔드포인트

서버리스 엔드포인트는 FriendliAI가 최적화한 오픈소스 모델에 대한 저비용 고성능 추론 API를 제공합니다. 이는 기반 하드웨어나 전용 인스턴스를 관리하지 않고 강력한 오픈소스 모델을 활용하고자 하는 개발자를 위한 간소화된 솔루션입니다.

AI 개발에 미치는 영향

이 파트너십은 인프라 관리 복잡성을 제거하여 개발자와 연구자가 GPU 오케스트레이션 물류보다는 모델 혁신에 집중할 수 있게 합니다. 최적화된 NVIDIA H100 인프라와 서버리스 옵션에 대한 직접적인 접근을 제공함으로써, 이 협력은 전 세계 개발자가 고성능 오픈소스 AI에 더 쉽게 접근할 수 있도록 높입니다.

Sources