Mixtral 8x7B 출시 노트

Mistral AI는 Apache 2.0 라이선스 하에 오픈된 가중치를 갖춘 고품질의 희소 전문가 집합 모델(SMoE)인 Mixtral 8x7B를 출시했습니다. 이 모델은 성능과 비용 사이의 균형을 최적화하도록 설계되어, 대부분의 표준 벤치마크에서 GPT-3.5 및 Llama 2 70B를 능가하거나 동등하게 수행하면서도 훨씬 낮은 추론 지연 시간을 유지합니다.

희소 전문가 집합(SMoE) 아키텍처

Mixtral 8x7B는 희소 전문가 집합 네트워크를 사용하여, 토큰당 계산 비용이 비례적으로 증가하지 않으면서도 총 파라미터 수를 늘릴 수 있습니다.

기술적 구현

디코더 전용 모델로서, Mixtral 8x7B는 여덟 개의 서로 다른 파라미터 그룹 중에서 선택하는 피드포워드 블록을 사용합니다. 각 레이어의 모든 토큰에 대해 라우터 네트워크는 두 개의 "전문가"를 선택하여 토큰을 처리하고, 그 출력을 가산적으로 결합합니다.

파라미터 효율성

이 아키텍처는 높은 총 파라미터 수를 유지하면서도 지연 시간을 통제할 수 있게 해줍니다. Mixtral 8x7B는 총 46.7B의 파라미터를 가지지만, 토큰당 사용하는 파라미터는 12.9B에 불과합니다. 결과적으로 이 모델은 12.9B 파라미터 모델과 동일한 속도와 비용으로 출력을 생성합니다.

성능 및 벤치마크

Mixtral 8x7B는 Llama 2 시리즈 및 GPT-3.5 베이스 모델보다 뛰어난 효율성과 품질을 보여줍니다.

일반 벤치마크

Mixtral은 대부분의 표준 벤치마크에서 Llama 2 70B 및 GPT-3.5와 동등하거나 더 뛰어납니다. Llama 2 70B와 비교했을 때, Mixtral은 6배 빠른 추론 속도를 제공합니다.

다국어 기능

이 모델은 영어, 프랑스어, 이탈리아어, 독일어, 스페인어 등 다섯 가지 언어에서 뛰어난 능력을 보입니다.

전문 기능

  • 컨텍스트 창: 모델은 32k 토큰의 컨텍스트를 처리할 수 있습니다.
  • 코드 생성: Mixtral은 코드 생성에서 뛰어난 성능을 보입니다.
  • 편향 및 환상: BBQ 벤치마크에서 Mixtral은 Llama 2보다 편향이 적습니다. BOLD 벤치마크에서 Mixtral은 Llama 2와 유사한 분산을 보이면서 더 긍정적인 감정을 보여줍니다.

Mixtral 8x7B Instruct

기본 모델과 함께 Mistral AI는 Mixtral 8x7B Instruct를 출시했습니다. 이 버전은 지도 학습 및 직접 선호도 최적화(DPO)를 통해 지시어 수행에 최적화되어 있습니다.

지시어 수행 성능

MT-Bench에서 Mixtral 8x7B Instruct는 8.30의 점수를 기록하여, GPT-3.5와 유사한 성능을 보이는 클래스 내에서 가장 강력한 오픈소스 모델이 되었습니다.

모니터링 및 보호 기능

모니터링이 필요한 애플리케이션을 위해 특정 출력을 금지하도록 프롬프트할 수 있지만, 기본 동작은 제공된 지시사항을 따르며 내장된 제한 없이 작동합니다. 특정 프롬프트나 선호도 튜닝이 이루어지지 않은 경우, 모델은 제한 없이 지시사항을 따릅니다.

배포 및 생태계

오픈소스 커뮤니티를 지원하기 위해 Mistral AI는 vLLM 프로젝트에 Megablocks CUDA 커널을 통합하여 효율적인 추론을 지원합니다. vLLM 엔드포인트는 어떤 클라우드 인스턴스에서도 Skypilot를 통해 관리할 수 있습니다.

Mixtral 8x7B는 Mistral AI 플랫폼에서 베타로 mistral-small 엔드포인트로도 이용 가능합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch