Mistral NeMo 릴리스 노트

Mistral AI와 NVIDIA는 해당 크기 카테고리 내에서 최첨단 추론, 세상에 대한 지식, 그리고 코딩 정확도를 제공하도록 설계된 12B 파라미터 모델인 Mistral NeMo를 출시하기 위해 협력했습니다. 이 모델은 표준 아키텍처를 기반으로 하기 때문에 Mistral 7B를 사용하는 시스템의 드롭인 교체 모델(drop-in replacement)입니다.

모델 아키텍처 및 성능

Mistral NeMo는 최대 128k 토큰의 대규모 컨텍스트 창을 지원하는 12B 파라미터 모델입니다. 이 모델은 양자화 인식(quantization awareness) 방식으로 훈련되어 성능 저하 없이 FP8 추론이 가능합니다. 모델은 Apache 2.0 라이선스 하에 사전 학습된 베이스(pre-trained base) 및 지시어 튜닝된(instruction-tuned) 체크포인트로 제공됩니다.

다국어 능력 및 Tekken 토크나이저

Mistral NeMo는 글로벌 애플리케이션에 최적화되어 있으며 특히 영어, 프랑스어, 독일어, 스페인어, 이탈리아어, 포르투갈어, 중국어, 일본어, 한국어, 아랍어, 힌디어에 강점이 있습니다. 이를 위해 모델은 Tiktoken을 기반으로 하는 Tekken이라는 새로운 토크나이저를 사용합니다.

Tekken은 100개 이상의 언어로 훈련되었으며 이전 Mistral 모델에서 사용된 SentencePiece 토크나이저에 비해 우수한 압축 효율을 제공합니다. 구체적인 압축 개선 사항은 다음과 같습니다:

  • 소스 코드 및 유럽 언어: 소스 코드, 중국어, 이탈리아어, 프랑스어, 독일어, 스페인어, 러시아어에 대해 약 30% 더 효율적인 압축을 제공합니다.
  • 한국어 및 아랍어: 2배에서 3배 더 효율적인 압축을 제공합니다.
  • 일반 언어 숙련도: Tekken은 Llama 3 토크나이저와 비교했을 때 전체 언어의 약 85%에 대해 텍스트 압축 능력이 더 뛰어납니다.

지시어 미세 조정 및 정렬

Mistral NeMo는 고급 미세 조정 및 정렬 단계를 거쳤으며, 그 결과 Mistral 7B 대비 다음과 같은 분야에서 상당한 개선을 이루었습니다:

  • 지시어 준수: 정확한 지시를 따르는 능력이 향상되었습니다.
  • 추론: 추론 능력이 강화되었습니다.
  • 다회차 대화: 다회차 대화 처리가 개선되었습니다.
  • 코드 생성: 소스 코드 생성의 정확도가 높아졌습니다.

가용성 및 배포

Mistral NeMo는 연구자 및 기업을 위해 여러 채널을 통해 제공됩니다:

  • HuggingFace: 베이스 및 베이스-인스트럭트(base-instruct) 모델의 가중치가 여기에 호스팅됩니다.
  • Mistral AI Tools: 모델은 mistral-inference와 함께 사용할 수 있으며 mistral-finetune을 통해 조정할 수 있습니다.
  • la Plateforme: open-mistral-nemo-2407이라는 이름으로 사용 가능합니다.
  • NVIDIA NIM: 모델은 ai.nvidia.com에서 사용할 수 있는 NVIDIA NIM 추론 마이크로서비스로 패키징되어 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch