Mixtral 8x22B 출시 노트

Mistral AI는 높은 성능과 비용 효율성을 제공하도록 설계된 희소 Mixture-of-Experts (SMoE) 모델인 Mixtral 8x22B의 출시를 발표했습니다. 이 모델은 총 141B 파라미터 중 39B의 활성 파라미터를 사용하여, 밀집형(dense) 70B 모델보다 빠른 속도를 유지하면서도 높은 성능 대비 비용 비율을 유지할 수 있습니다.

Architecture and Efficiency

Mixtral 8x22B는 희소 Mixture-of-Experts 모델로 구축되어, 추론 과정에서 전체 파라미터의 일부만 활성화합니다. 39B의 활성 파라미터와 141B의 총 파라미터를 갖춘 이 모델은 비용 효율성과 속도를 위해 설계되었습니다. Mistral AI는 이 아키텍처가 모델을 그 어떤 밀집형 70B 모델보다 빠르게 만들며, 허용적 또는 제한적 라이선스 하에 제공되는 다른 오픈 웨이트(open-weight) 모델보다 더 뛰어난 능력을 갖추게 한다고 밝히고 있습니다.

Key Capabilities and Technical Specifications

Mixtral 8x22B는 다음과 같은 몇 가지 핵심 기술적 강점을 제공합니다:

  • Multilingualism: 모델은 영어, 프랑스어, 이탈리아어, 독일어, 스페인어에 능숙합니다.
  • Context Window: 64K 토큰 컨텍스트 창을 특징으로 하여, 대규모 문서에서 정확한 정보 회상을 가능하게 합니다.
  • Function Calling: 모델은 네이티브하게 function calling 기능을 갖추고 있습니다. la Plateforme의 제약된 출력 모드와 결합될 때, 이는 대규모 애플리케이션 개발 및 기술 스택 현대화를 지원합니다.
  • Reasoning, Math, and Coding: 모델은 추론에 최적화되어 있으며, 다른 오픈 모델과 비교하여 수학 및 코딩 작업에서 강력한 성능을 보여줍니다.

Performance Benchmarks

Mixtral 8x22B는 여러 산업 벤치마크에서 우수한 성능을 다음과 같이 보여줍니다:

Reasoning and Knowledge

모델은 추론에 최적화되어 있으며 MMLU (Measuring massive multitask language in understanding), HellaSwag, Wino Grande, Arc Challenge, TriviaQA, NaturalQS를 포함한 벤치마크에서 선도적인 성능을 보여줍니다.

Multilingual Performance

Mixtral 8x22B는 특히 프랑스어, 독일어, 스페인어, 이탈리아어 환경의 HellaSwag, Arc Challenge, MMLU 벤치마크에서 LLaMA 2 70B를 능가합니다.

Mathematics and Coding

다른 오픈 모델과 비교하여 Mixtral 8x22B는 코딩 및 수학 작업에서 최고의 성능을 발휘합니다. 모델의 지시형(instructed) 버전은 GSM8K maj@8에서 90.8%의 점수를, Math maj@4에서 44.6%의 점수를 달성했습니다.

Licensing and Availability

Mixtral 8x22B는 가장 허용적인 오픈 소스 라이선스인 Apache 2.0 라이선스 하에 출시되어 제한 없는 사용이 가능합니다. 베이스 모델의 가용성 또한 미세 조정(fine-tuning) 사용 사례를 위한 적합한 기반을 제공합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch