SearchSavior/OpenArc
Inference engine for Intel devices. Serve LLMs, VLMs, Whisper, Kokoro-TTS, Embedding and Rerank models over OpenAI endpoints.
해결하는 문제
OpenArc는 Intel 하드웨어에서 AI 모델을 배포하고 가속화하는 간소화된 방법을 제공합니다. 이는 추론 엔진 역할을 하여 사용자가 다양한 모델 유형을 로컬에서 프라이빗하게 실행할 수 있도록 하며, 다양한 AI 작업에 대해 OpenVINO 가속을 수동으로 구성해야 하는 복잡성을 제거합니다.
작동 방식
OpenVINO를 활용하여 CPU, GPU 및 NPU 장치에서 모델을 서비스합니다. 이 엔진은 OpenAI 호환 엔드포인트를 제공하여 기존 AI 워크플로우에 통합될 수 있습니다. LLM, VLM, Whisper 및 다양한 Qwen 기반 TTS, ASR 및 embedding 모델을 포함한 광범위한 모델 유형을 지원합니다.
대상 사용자
Intel 기반 장치에서 고성능 로컬 AI 모델을 실행하고자 하는 개발자 및 AI 애호가.
주요 특징
- 폭넓은 모델 지원: LLM, VLM, 오디오 모델(Whisper, Kokoro-TTS) 및 embedding/reranker 모델 서비스.
- Intel 하드웨어 가속: OpenVINO를 통해 CPU, GPU 및 NPU 장치에 최적화.
- OpenAI 호환성: 채팅 완성, 오디오 전사 및 음성 생성을 위한 표준 엔드포인트 제공.
- 추론 최적화: LLM을 위한 speculative decoding 및 멀티 GPU 파이프라인 병렬 처리 포함.
- 성능 추적: 내장된
llama-bench스타일 벤치마킹 및 TTFT, 처리량(throughput)과 같은 상세한 요청 메트릭 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch