Mistral Small 3 릴리스 노트
Mistral AI는 저지연 생성형 AI 작업에 적합한 24B 파라미터 모델인 Mistral Small 3을 발표했습니다. Apache 2.0 라이선스 하에 공개된 이 모델은 Llama 3.3 70B 및 Qwen 32B와 같은 더 큰 오픈웨이트 모델, 그리고 GPT-4o-mini와 같은 프로프라이어터리 모델에 비해 높은 효율성을 제공하는 대안으로 위치지어져 있습니다.
고효율 성능과 지연 시간
Mistral Small 3은 로컬 배포에 적합한 크기에서 성능을 최대화하도록 설계되었습니다. 경쟁 모델보다 더 적은 레이어를 사용함으로써 전방 전파에 필요한 시간을 크게 줄여, 초당 150토큰의 지연 시간을 달성했습니다.
주요 성능 지표는 다음과 같습니다:
- MMLU 정확도: 81% 이상.
- 속도: 동일한 하드웨어에서 Llama 3.3 70B Instruct보다 3배 이상 빠릅니다.
- 효율성: Mistral AI는 이 모델이 해당 카테고리에서 가장 효율적인 모델이라고 설명합니다.
모델 기능과 훈련
Mistral AI는 사전 훈련된 모델과 지시 조정된 체크포인트를 모두 공개했습니다. 일부 최신 추론 모델과 달리, Mistral Small 3는 강화 학습(RL) 또는 합성 데이터를 사용하지 않고 훈련되었습니다. Mistral AI는 이 모델이 DeepSeek R1과 같은 모델보다 생산 공정에서 더 초기 단계에 있다고 언급하며, 개발자들이 추론 능력을 축적할 수 있는 강력한 기반 모델이라고 설명합니다.
대상 사용 사례
Mistral Small 3는 지연 시간이 최소화된 강력한 지시 따르기와 언어 성능이 필요한 생성형 AI 작업의 약 80%에 최적화되어 있습니다. 추천 사용 사례는 다음과 같습니다:
- 대화형 보조: 거의 실시간 상호작용이 필요한 빠른 응답 가상 보조.
- 에이전트 워크플로우: 자동화된 프로세스를 위한 저지연 함수 호출.
- 도메인 특화: 의료 진단, 법적 조언, 기술 지원과 같은 분야에서 전문가 모델로 미세 조정.
- 로컬 추론: 양자화된 상태에서 단일 RTX 4090 또는 32GB RAM을 갖춘 맥북에서 개인적으로 배포 가능.
현재 고객들이 평가 중인 산업별 응용 사례로는 금융 서비스 분야의 사기 탐지, 헬스케어 분야의 고객 우선순위 지정, 자동차, 로봇, 제조 분야의 온디바이스 명령 및 제어가 있습니다.
가용성과 생태계
Mistral Small 3는 mistral-small-latest 또는 mistral-small-2501을 통해 la Plateforme에서 이용 가능합니다. 또한 Hugging Face, Ollama, Kaggle, Together AI, Fireworks AI, IBM Watson X와 같은 파트너를 통해도 이용할 수 있습니다. NVIDIA NIM, Amazon SageMaker, Groq, Databricks, Snowflake와의 통합도 곧 제공될 예정입니다.
오픈소스에 대한 약속
Mistral AI는 일반 목적 모델에 대해 Apache 2.0 라이선스에 대한 재약속을 발표하며, MRL 라이선스 모델에서 벗어나고 있습니다. 이를 통해 모델 가중치를 자유롭게 다운로드하고, 로컬에 배포하며, 수정할 수 있습니다.
Sources
- OriginalMistral Small 3
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch