NVIDIA-AI-Blueprints/llm-router
Route LLM requests to the best model for the task at hand.
해결하는 문제
현대의 AI 시스템은 정확도, 속도, 비용 사이의 트레이드오프에 직면하는 경우가 많습니다. 이 프로젝트는 사용자 프롬프트(텍스트 또는 멀티모달)를 분석하여 작업에 가장 적합한 LLM 또는 비전-언어 모델(VLM)을 추천함으로써 이러한 트레이드오프를 자동화합니다. 각 특정 요청에 대해 가장 효율적인 모델이 사용되도록 보장합니다.
작동 방식
시스템은 NVIDIA NeMo Agent Toolkit 기반의 라우터 백엔드로 구성되며, OpenAI 호환 API를 노출합니다. 두 가지 다른 라우팅 전략을 사용합니다:
- 의도 기반 라우팅: 소규모 LLM(Qwen 1.7B)을 사용하여 사용자의 의도(예: "이미지 이해" 또는 "어려운 질문")를 분류하고, 해당 의도를 미리 구성된 모델에 매핑합니다.
- 자동 라우팅: CLIP 임베딩을 사용해 텍스트와 이미지를 인코딩한 후, 이를 학습된 신경망에 통과시켜 품질, 지연 시간, 비용 지표를 기반으로 최적의 모델을 예측합니다.
이전 버전과 달리, 이 라우터는 요청을 프록시하지 않습니다. 대신 추천된 모델 이름을 반환하며, 호출 애플리케이션은 해당 모델로 API 호출을 실행하는 책임을 집니다.
대상 사용자
- AI 엔지니어 및 개발자: 멀티모달 라우팅 접근 방식을 탐색하는 사람.
- MLOps 팀: 학습 기반 라우팅 최적화 및 사용자 정의 모델 선택 전략을 구현하고자 하는 팀.
- 연구 팀: 생산 환경 배포를 위한 다양한 라우팅 전략을 평가하는 사람.
주요 특징
- 멀티모달 지원: 텍스트 및 이미지 입력을 기반으로 라우팅이 가능합니다.
- 두 가지 라우팅 전략: 제로샷 의도 분류와 데이터 기반 신경망 라우팅을 모두 제공합니다.
- OpenAI API 호환: 표준 챗 컴플리션 엔드포인트를 통해 모델 추천을 반환합니다.
- 유연한 구성: 의도 매핑을 업데이트하거나, 자체 데이터로 사용자 정의 신경망 라우터를 훈련할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트