microsoft/onnxruntime-genai

Generative AI extensions for onnxruntime

해결하는 문제

생성형 AI 모델(특히 LLM)을 로컬에서 디바이스에서 실행하기 위한 고성능이고 유연한 API를 제공하여, 생성 루프를 수동으로 복잡하게 구현할 필요를 제거합니다.

작동 방식

이 프로젝트는 ONNX 모델에 대한 완전한 생성형 AI 루프를 구현합니다. 전처리, ONNX Runtime을 통한 추론, KV 캐시 관리, 로지트 처리, 검색 및 샘플링 전략 실행을 포함합니다. 또한 도구 호출을 위한 문법 지정도 지원합니다.

대상 사용자

Windows, Linux, Mac, Android 등 다양한 플랫폼과 하드웨어 가속기(CPU, CUDA, DirectML, OpenVINO, QNN, WebGPU)에서 ONNX 형식을 사용하여 생성형 AI 모델을 배포하고자 하는 개발자들입니다.

주요 특징

  • 광범위한 모델 지원: Llama, Phi, Mistral, Gemma, Qwen 등 다양한 아키텍처를 지원합니다.
  • 크로스 플랫폼: 여러 운영 체제에서 작동하며 Python, C#, C/C++, Java용 API를 제공합니다.
  • 하드웨어 가속: CUDA, DirectML, WebGPU 등 다양한 백엔드를 활용해 최적화된 성능을 제공합니다.
  • 고급 생성 기능: Multi-LoRA, 연속 디코딩, 제약 디코딩을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트