허깅 페이스 PROs용 추론

허깅 페이스는 Inference for PRO를 출시했는데, 이는 PRO 사용자에게 고성능 모델에 대한 선별된 초고속 API 엔드포인트에 대한 접근을 제공하는 커뮤니티 제공 서비스입니다. 이 서비스는 사용자가 자체 인프라를 관리할 필요 없이 빠른 실험과 프로토타이핑을 용이하게 하도록 설계되었습니다.

최첨단 모델에 대한 가속화된 접근

Inference for PROs는 text-generation-inference (TGI)로 구동되는 선별된 강력한 모델 목록에 대한 독점적인 API 엔드포인트를 제공합니다. 무료 Inference API는 200,000+ 이상의 모델을 테스트하기 위해 모든 사용자에게 여전히 제공되며, PRO 사용자는 더 높은 속도 제한과 특정 고성능 모델에 대한 접근 권한을 얻습니다.

지원되는 모델 및 기능

모델 크기 컨텍스트 길이 주요 용도
Meta Llama 3 Instruct 8B, 70B 8k 토큰 채팅
Mixtral 8x7B Instruct 45B MOE 32k 토큰 고성능 채팅
Nous Hermes 2 Mixtral 8x7B DPO 45B MOE 32k 토큰 고급 Mixtral 튜닝
Zephyr 7B β 7B 4k 토큰 채팅 (7B 가중치)
Llama 2 Chat 7B, 13B 4k 토큰 대화형 AI
Mistral 7B Instruct v0.2 7B 4k 토큰 채팅 (7B 가중치)
Code Llama Base 7B, 13B 4k 토큰 코드 자동완성/인필
Code Llama Instruct 34B 16k 토큰 대화형 코드 어시스턴트
Stable Diffusion XL 3B UNet - 이미지 생성
Bark 0.9B - 텍스트-오디오 생성

기술적 구현 및 통합

통합은 PRO 계정 인증 토큰을 사용하여 모델의 API 엔드포인트에 HTTP POST 요청을 보내는 방식으로 처리됩니다. 개발자는 간편한 접근을 위해 curl 또는 huggingface_hub 파이썬 라이브러리의 InferenceClient 유틸리티를 사용할 수 있습니다.

Messages API 및 OpenAI 호환성

모든 텍스트 생성 모델은 이제 Messages API를 지원하여 OpenAI 클라이언트 라이브러리뿐만 아니라 LangChain 및 LlamaIndex와 같은 프레임워크와 호환됩니다.これにより 개발자는 base_urlhttps://api-inference.huggingface.co/v1/로 가리켜 openai 파이썬 클라이언트를 사용할 수 있습니다.

고급 생성 제어

사용자는 여러 생성 매개변수를 사용하여 모델 출력을 미세 조정할 수 있습니다:

  • 텍스트 생성:
    • do_sample: 결정적 탐욕 탐색(False)과 확률적 샘플링(True) 사이를 전환합니다.
    • temperature: 변동을 조절합니다; 코드에는 낮은 값이 권장되며, 개방형 텍스트에는 높은 값이 권장됩니다.
    • top_ktop_p: 샘플링 풀을 가장 확률이 높은 토큰으로 제한합니다.
    • repetition_penalty: 반복되는 단어의 발생 가능성을 줄입니다.
    • max_new_tokens: 생성된 시퀀스의 최대 길이를 설정합니다.
  • 이미지 생성 (SDXL):
    • negative_prompt: 이미지에서 제외할 콘텐츠를 정의합니다.
    • guidance_scale: 모델이 프롬프트를 얼마나 엄격히 따르는지를 제어합니다.
    • num_inference_steps: 디노이징 단계 수를 결정합니다 (일반적으로 20-50).

특수 추론 작업

코드 인필링

Code Llama를 사용하여 사용자는 접두사와 접미사 시퀀스를 제공하여 "인필링"을 수행할 수 있습니다. 모델은 형식 <PRE> {prefix} <SUF>{suffix} <MID> 를 사용하여その間에 들어갈 콘텐츠를 예측합니다.

토큰 스트리밍

지각된 지연을 줄이고 사용자 경험을 개선하기 위해 API는 토큰 스트리밍을 지원합니다. InferenceClient에서 stream=True를 전달하거나 curl-N 플래그를 사용하면 토큰이 생성되는 대로 하나씩 반환됩니다.

캐싱

최근 결과는 성능 향상을 위해 기본적으로 캐시됩니다. 샘플링 설정에 관계없이 강제로 새로 생성을 원할 경우, 사용자는 요청에 HTTP 헤더 x-use-cache: 0을 추가할 수 있습니다.

사용 권장 사항

Inference for PROs는 실험 및 프로토타이핑을 목적으로 합니다. 무거운 프로덕션 애플리케이션의 경우, 허깅 페이스는 전용 인프라를 제공하는 Inference Endpoints 사용을 권장합니다.

Sources