Mistral AI, Ministral 3B 및 8B 엣지 모델 출시
Mistral AI는 엣지 컴퓨팅 및 온디바이스 사용 사례에 최적화된 두 가지 새로운 소형 언어 모델(SLM)인 Ministral 3B와 Ministral 8B를 발표했습니다. 이 모델들은 로컬 배포에 필요한 낮은 지연 시간과 효율성을 유지하면서도 지식, 추론, 함수 호출 측면에서 높은 성능을 제공하도록 설계되었습니다.
기술 사양 및 아키텍처
Ministral 3B와 8B는 최대 128k 토큰의 컨텍스트 길이를 지원하지만, 현재 vLLM에서는 32k로 제한되어 있습니다. 성능을 최적화하기 위해 Ministral 8B는 특수한 교차 슬라이딩 윈도우 어텐션 패턴을 사용하여 더 빠르고 메모리 효율적인 추론을 가능하게 합니다.
대상 사용 사례 및 응용 분야
Les Ministraux는 로컬, 개인정보 중심의 추론과 낮은 지연 시간을 요구하는 시나리오를 위해 설계되었습니다. 주요 응용 분야는 다음과 같습니다:
- 온디바이스 컴퓨팅: 로컬 분석, 인터넷 없이 작동하는 스마트 어시스턴트, 자율 로봇
- 엣지 번역: 온디바이스 번역 서비스
- 에이전트 워크플로우: Mistral Large와 같은 더 큰 모델과 함께 사용할 때, 함수 호출, 입력 파싱, 작업 라우팅을 위한 효율적인 중개자 역할 수행
성능 벤치마크
Mistral AI는 Ministral 3B와 8B가 10B 미만 범주에서 동료 모델들을 지속적으로 능가한다고 보고했습니다. 회사 내부 평가 프레임워크에 따르면, 가장 작은 모델인 Ministral 3B는 대부분의 벤치마크에서 원본 Mistral 7B를 이미 능가하고 있습니다.
가용성, 가격 및 라이선스
두 모델은 API를 통해 즉시 이용 가능합니다. la Plateforme의 가격은 다음과 같습니다:
| 모델 | API 엔드포인트 | 입력/출력 토큰당 가격 (100만 토큰 기준) | 라이선스 |
|---|---|---|---|
| Ministral 8B | ministral-8b-latest |
$0.10 | Mistral Commercial License / Mistral Research License |
| Ministral 3B | ministral-3b-latest |
$0.04 | Mistral Commercial License |
자체 배포를 위한 경우, 상용 라이선스가 필요합니다. Mistral AI는 특정 사용 사례에서 성능을 극대화하기 위해 손실 없는 양자화에 대한 지원도 제공합니다. Ministral 8B Instruct의 모델 가중치는 연구용으로 제공되며, 두 모델은 곧 클라우드 파트너를 통해 이용 가능해질 예정입니다.
Sources
- OriginalUn Ministral, des Ministraux
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch