openvinotoolkit/openvino.genai
Run Generative AI models with simple C++/Python API and using OpenVINO Runtime
해결하는 문제
OpenVINO GenAI는 PC 및 노트북에서 인기 있는 생성형 AI 모델을 로컬로 실행할 수 있는 경량 고성능 라이브러리를 제공합니다. 토큰화(tokenization)와 같은 핵심 기능을 라이브러리에 직접 통합하여 외부 종속성 필요성을 제거하고 로컬 실행 시 리소스 소비를 줄입니다.
작동 방식
OpenVINO Runtime를 기반으로 구축된 이 라이브러리는 다양한 생성 파이프라인을 실행하기 위한 C++, Python 및 Node.js API를 제공합니다. CPU, GPU 및 NPU 하드웨어에서의 추론을 지원합니다. 또한 생성 속도를 높이고 메모리 사용량을 줄이기 위해 투기적 디코딩(speculative decoding), KVCache 토큰 축출(KVCache token eviction), 희소 어텐션(sparse attention)과 같은 전문적인 최적화 기술을 포함합니다.
대상 사용자
복잡한 종속성 체인 없이 Intel 하드웨어에서 LLM, 이미지 생성기 및 음성 모델을 실행해야 하는 로컬 AI 애플리케이션 구축 개발자.
주요 특징
- 멀티모달 지원: 텍스트 생성(LLMs), 시각 처리(VLMs), 이미지 생성(Diffusers), 음성 인식(Whisper), 음성 생성(SpeechT5) 및 텍스트 임베딩 및 리랭킹과 같은 RAG 구성 요소를 지원합니다.
- LoRA 어댑터 지원: 모델당 여러 어댑터를 로드하고 알파 블렌딩(alpha blending)을 사용하여 이를 혼합할 수 있습니다.
- 고급 최적화: 투기적 디코딩, 희소 어텐션(Tri-shape 및 XAttention), 서빙 시나리오를 위한 프리픽스 캐싱을 포함한 연속 배칭(continuous batching)을 구현합니다.
- 하드웨어 가속: CPU, GPU 및 NPU 전반에 걸친 원활한 실행에 최적화되어 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch