Mistral 7B 릴리스 노트

Mistral AI는 크기가 작지만 높은 성능을 제공하도록 설계된 73억 파라미터 언어 모델인 Mistral 7B의 출시를 발표했습니다. 이 모델은 자유로운 사용과 배포가 가능한 Apache 2.0 라이선스 하에 공개됩니다.

성능 벤치마크

Mistral 7B는 모든 평가 벤치마크에서 Llama 2 13B를 능가하며, 많은 측면에서 Llama 1 34B와 유사한 성능을 보입니다. 코드 및 추론 능력 측면에서 이 모델은 이러한 모델들보다 훨씬 우수하며, CodeLlama 7B의 성능에 근접하면서도 영어 작업에서 뛰어난 전문성을 유지합니다.

Mistral AI에 따르면, 이 모델은 추론, 이해력, STEM 추론(예: MMLU) 분야에서 크기가 세 배 이상 큰 Llama 2 모델과 동등한 성능을 발휘합니다. 이러한 효율성은 메모리 절약과 더 높은 처리량을 가능하게 합니다.

평가 항목

성능은 여러 주제별로 측정되었습니다:

  • 일반적 추론: Hellaswag, Winogrande, PIQA, SIQA, OpenbookQA, ARC-Easy, ARC-Challenge, CommonsenseQA의 0-샷 평균
  • 세계 지식: NaturalQuestions와 TriviaQA의 5-샷 평균
  • 독해력: BoolQ와 QuAC의 0-샷 평균
  • 수학: 8-샷 GSM8K(maj@8)와 4-샷 MATH(maj@4)의 평균
  • 코드: 0-샷 Humaneval과 3-샷 MBPP의 평균
  • 통합 결과: 5-샷 MMLU, 3-샷 BBH, 3-5-샷 AGI Eval(영어 다중 선택 질문만)

기술적 아키텍처

Mistral 7B는 추론 속도와 시퀀스 처리를 최적화하기 위해 두 가지 주요 아키텍처 기능을 구현합니다.

그룹화된 쿼리 어텐션 (GQA)

Mistral 7B는 더 빠른 추론 속도를 가능하게 하는 그룹화된 쿼리 어텐션(GQA)을 사용합니다.

슬라이딩 윈도우 어텐션 (SWA)

슬라이딩 윈도우 어텐션(SWA)은 더 긴 시퀀스를 낮은 계산 비용으로 처리할 수 있게 해줍니다. 이 메커니즘에서는 각 레이어가 이전 4,096개의 은닉 상태에 주목하게 되어, 계산 비용이 선형적으로 O(sliding_window.seq_len)가 됩니다.

SWA는 트랜스포머의 쌓인 레이어 구조를 활용하여, 윈도우 크기보다 훨씬 더 오래된 정보에 접근할 수 있도록 합니다. 예를 들어, 레이어 k에 있는 토큰은 레이어 k-1의 윈도우 내 토큰에 주목하게 되며, 이 토큰들은 더 과거의 토큰들에 주목했습니다. 이는 모델의 어텐션 범위를 실제로 확장하는 효과를 줍니다.

실제로, FlashAttention 및 xFormers의 변경 사항과 결합하면, 16k 길이의 시퀀스에 대해 4k 윈도우에서 2배의 속도 향상을 제공합니다. 또한 고정된 어텐션 범위를 통해 회전 버퍼를 사용해 캐시 크기를 슬라이딩 윈도우 크기로 제한할 수 있어, 8,192 길이의 시퀀스에 대한 추론 시 캐시 메모리를 절반으로 줄일 수 있으며, 품질에 영향을 주지 않습니다.

피니팅 및 지시어 따르기

기본 모델의 일반화 능력을 보여주기 위해, Mistral AI는 HuggingFace에서 공개된 지시어 데이터셋을 기반으로 피니팅한 Mistral 7B Instruct 버전을 공개했습니다.

Mistral 7B Instruct는 MT-Bench 벤치마크에서 모든 7B 모델보다 뛰어나며, 13B 채팅 모델과 유사한 성능을 보입니다. 이 모델은 특수한 '기교'나 독점 데이터를 사용하지 않고 피니팅되었습니다.

Mistral AI는 Instruct 모델이 현재 모니터링 메커니즘이 없으며, 제한된 출력이 필요한 환경에서의 배포를 위해 커뮤니티의 참여를 통해 보호 장치를 개발하고자 한다고 밝혔습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch