Codestral Mamba 릴리스 노트

Mistral AI는 전통적인 Transformer 아키텍처의 확장 제한을 극복하기 위해 설계된 코드 및 추론 전용 모델인 Codestral Mamba를 발표했습니다. Mamba 아키텍처를 활용함으로써 모델은 선형 시간 추론과 이론적으로 무한한 시퀀스 길이를 지원하며, 긴 컨텍스트 코드 생산성 작업에 매우 효율적입니다.

Mamba 아키텍처 및 성능 장점

Codestral Mamba는 표준 Transformer 기반 모델보다 뛰어난 효율성을 제공하기 위해 Mamba 아키텍처를 활용합니다. 주요 기술적 장점은 다음과 같습니다:

  • 선형 시간 추론: Transformer와 달리, 입력 길이에 관계없이 빠른 응답이 가능합니다.
  • 무한 시퀀스 모델링: 아키텍처는 무한 길이의 시퀀스를 모델링할 수 있는 이론적 능력을 제공합니다.
  • 최고 수준의 성능: 아키텍처의 변화에도 불구하고, Codestral Mamba는 코드 및 추론 작업에서 최첨단(SOTA) Transformer 기반 모델과 동등한 성능을 발휘하도록 훈련되었습니다.

기술 사양 및 기능

Codestral Mamba는 로컬 배포를 위한 코드 어시스턴트로 최적화된 지시형 모델입니다. 주요 사양은 다음과 같습니다:

  • 파라미터 수: 7,285,403,648개의 파라미터.
  • 컨텍스트 창: 모델은 최대 256k 토큰까지의 인-컨텍스트 검색 기능을 테스트했습니다.
  • 개발: 모델은 Albert Gu와 Tri Dao의 기여를 통해 개발되었습니다.

배포 및 가용성

Codestral Mamba는 Apache 2.0 라이선스 하에 무료로 사용, 수정, 배포가 가능합니다. 사용자는 여러 채널을 통해 모델에 접근하고 배포할 수 있습니다:

  • 가중치: 원시 가중치는 HuggingFace를 통해 다운로드할 수 있습니다.
  • SDKs: mistral-inference SDK(v1.2.0) 및 NVIDIA의 TensorRT-LLM을 통해 배포가 지원됩니다.
  • API 접근: 모델은 codestral-mamba-2407 식별자로 la Plateforme에서 테스트용으로 이용 가능합니다.
  • 로컬 추론: 향후 llama.cpp 지원이 예정되어 있습니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트