허깅 페이스 PROs용 추론
허깅 페이스는 Inference for PRO를 출시했는데, 이는 PRO 사용자에게 고성능 모델에 대한 선별된 초고속 API 엔드포인트에 대한 접근을 제공하는 커뮤니티 제공 서비스입니다. 이 서비스는 사용자가 자체 인프라를 관리할 필요 없이 빠른 실험과 프로토타이핑을 용이하게 하도록 설계되었습니다.
최첨단 모델에 대한 가속화된 접근
Inference for PROs는 text-generation-inference (TGI)로 구동되는 선별된 강력한 모델 목록에 대한 독점적인 API 엔드포인트를 제공합니다. 무료 Inference API는 200,000+ 이상의 모델을 테스트하기 위해 모든 사용자에게 여전히 제공되며, PRO 사용자는 더 높은 속도 제한과 특정 고성능 모델에 대한 접근 권한을 얻습니다.
지원되는 모델 및 기능
| 모델 | 크기 | 컨텍스트 길이 | 주요 용도 |
|---|---|---|---|
| Meta Llama 3 Instruct | 8B, 70B | 8k 토큰 | 채팅 |
| Mixtral 8x7B Instruct | 45B MOE | 32k 토큰 | 고성능 채팅 |
| Nous Hermes 2 Mixtral 8x7B DPO | 45B MOE | 32k 토큰 | 고급 Mixtral 튜닝 |
| Zephyr 7B β | 7B | 4k 토큰 | 채팅 (7B 가중치) |
| Llama 2 Chat | 7B, 13B | 4k 토큰 | 대화형 AI |
| Mistral 7B Instruct v0.2 | 7B | 4k 토큰 | 채팅 (7B 가중치) |
| Code Llama Base | 7B, 13B | 4k 토큰 | 코드 자동완성/인필 |
| Code Llama Instruct | 34B | 16k 토큰 | 대화형 코드 어시스턴트 |
| Stable Diffusion XL | 3B UNet | - | 이미지 생성 |
| Bark | 0.9B | - | 텍스트-오디오 생성 |
기술적 구현 및 통합
통합은 PRO 계정 인증 토큰을 사용하여 모델의 API 엔드포인트에 HTTP POST 요청을 보내는 방식으로 처리됩니다. 개발자는 간편한 접근을 위해 curl 또는 huggingface_hub 파이썬 라이브러리의 InferenceClient 유틸리티를 사용할 수 있습니다.
Messages API 및 OpenAI 호환성
모든 텍스트 생성 모델은 이제 Messages API를 지원하여 OpenAI 클라이언트 라이브러리뿐만 아니라 LangChain 및 LlamaIndex와 같은 프레임워크와 호환됩니다.これにより 개발자는 base_url을 https://api-inference.huggingface.co/v1/로 가리켜 openai 파이썬 클라이언트를 사용할 수 있습니다.
고급 생성 제어
사용자는 여러 생성 매개변수를 사용하여 모델 출력을 미세 조정할 수 있습니다:
- 텍스트 생성:
do_sample: 결정적 탐욕 탐색(False)과 확률적 샘플링(True) 사이를 전환합니다.temperature: 변동을 조절합니다; 코드에는 낮은 값이 권장되며, 개방형 텍스트에는 높은 값이 권장됩니다.top_k및top_p: 샘플링 풀을 가장 확률이 높은 토큰으로 제한합니다.repetition_penalty: 반복되는 단어의 발생 가능성을 줄입니다.max_new_tokens: 생성된 시퀀스의 최대 길이를 설정합니다.
- 이미지 생성 (SDXL):
negative_prompt: 이미지에서 제외할 콘텐츠를 정의합니다.guidance_scale: 모델이 프롬프트를 얼마나 엄격히 따르는지를 제어합니다.num_inference_steps: 디노이징 단계 수를 결정합니다 (일반적으로 20-50).
특수 추론 작업
코드 인필링
Code Llama를 사용하여 사용자는 접두사와 접미사 시퀀스를 제공하여 "인필링"을 수행할 수 있습니다. 모델은 형식 <PRE> {prefix} <SUF>{suffix} <MID> 를 사용하여その間에 들어갈 콘텐츠를 예측합니다.
토큰 스트리밍
지각된 지연을 줄이고 사용자 경험을 개선하기 위해 API는 토큰 스트리밍을 지원합니다. InferenceClient에서 stream=True를 전달하거나 curl에 -N 플래그를 사용하면 토큰이 생성되는 대로 하나씩 반환됩니다.
캐싱
최근 결과는 성능 향상을 위해 기본적으로 캐시됩니다. 샘플링 설정에 관계없이 강제로 새로 생성을 원할 경우, 사용자는 요청에 HTTP 헤더 x-use-cache: 0을 추가할 수 있습니다.
사용 권장 사항
Inference for PROs는 실험 및 프로토타이핑을 목적으로 합니다. 무거운 프로덕션 애플리케이션의 경우, 허깅 페이스는 전용 인프라를 제공하는 Inference Endpoints 사용을 권장합니다.
Sources
- OriginalInference for PROs