Mistral Small 4 출시 노트 / 새로운 기능

Mistral AI는 Magistral(추론), Pixtral(멀티모달), 그리고 Devstral(에이전트 코딩)의 기능을 하나의 아키텍처로 통합한 통합 모델인 Mistral Small 4의 출시를 발표했습니다. 이번 출시를 통해 사용자는 서로 다른 작업을 위해 전문화된 모델을 전환할 필요가 없으며, 구성 가능한 추론 노력(reasoning effort)과 높은 효율성을 갖춘 다재다능한 도구를 제공받게 됩니다.

Unified Model Capabilities

Mistral Small 4는 이전에 별개였던 세 가지 모델의 강점을 하나의 시스템으로 통합합니다:

  • Reasoning: Magistral에서 파생된 능력.
  • Multimodal: Pixtral에서 파생된 이미지 및 텍스트 입력 지원.
  • Agentic Coding: Devstral에서 파생된 코딩 자동화 및 에이전트 워크플로우.

이러한 통합을 통해 모델은 사용자가 작업에 따라 모델을 변경할 필요 없이 채팅 어시스턴트, 연구 파트너 또는 코딩 에이전트로 활용될 수 있습니다.

Technical Architecture and Specifications

Mistral Small 4는 Mixture of Experts (MoE) 아키텍처를 활용하는 하이브리드 모델입니다. 주요 기술 사양은 다음과 같습니다:

  • Parameter Count: 총 119B 파라미터, 토큰당 6B 활성 파라미터(임베딩 및 출력 레이어를 포함하면 8B).
  • Expert Configuration: 128명의 전문가(experts), 토큰당 4명 활성화.
  • Context Window: 256k 토큰, 장문 문서 분석 및 상호작용 지원.
  • Input Support: 텍스트와 이미지 입력을 모두 허용하는 네이티브 멀티모달리티.
  • Licensing: Apache 2.0 라이선스로 출시.

Configurable Reasoning Effort

이 모델은 사용자가 모델의 처리 깊이를 동적으로 조정할 수 있도록 하는 reasoning_effort 파라미터를 도입합니다:

  • reasoning_effort="none": Mistral Small 3.2의 채팅 스타일을 반영하여 일상적인 작업에 대해 빠르고 가벼운 응답을 제공합니다.
  • reasoning_effort="high": 이전 Magistral 모델의 상세함을 유지하며 복잡한 문제에 대해 심층적인 단계별 추론을 가능하게 합니다.

Performance and Efficiency

Mistral Small 4는 Mistral Small 3와 비교하여 처리량(throughput)과 지연 시간(latency) 측면에서 상당한 개선을 보여줍니다:

  • Latency: 지연 시간 최적화 설정에서 엔드-투-엔드 완료 시간이 40% 감소했습니다.
  • Throughput: 처리량 최적화 설정에서 초당 요청 수가 3배 증가했습니다.
  • Benchmark comparisons: 추론 기능이 포함된 Mistral Small 4는 더 짧은 출력을 생성하면서도 세 가지 벤치마크에서 GPT-OSS 120B를 대등하게 능가하거나 능가합니다. AA LCR 벤치마크에서, 1.6K 문자를 사용하여 0.72점을 기록했으며, 이는 Qwen 모델이 유사한 성능을을 위해 3.5-4배 더 많은 출력(5.8-6.1K 문자를 사용하여)이 필요한 것과 대조적입니다. LiveCodeBench에서, 20% 적은 출력을 생성하면서도 GPT-OSS 120B를 능가합니다.

Deployment and Infrastructure Requirements

Mistral Small 4는 NVIDIA 하드웨어에 최적화되어 있으며 NVIDIA Nemotron Coalition의 창립 멤버입니다. 배포 옵션은 다음과 같습니다:

Infrastructure Tiers

  • Minimum Infrastructure: 4x NVIDIA HGX H100, 2x NVIDIA HGX H200, 또는 프로토타입을 위해 1x NVIDIA DGX B200.
  • Recommended Setup: 최적의 성능을 위한 4x NVIDIA HGX H100, 4x NVIDIA HGX H200, 또는 2x NVIDIA DGX B200.

Availability and Integration

  • Platforms: Mistral API, AI Studio, 및 Hugging Face를 통해 이용 가능합니다.
  • Frameworks: vLLM, llama.cpp, SGLang, 및 Transformers를 지원합니다.
  • NVIDIA Integration: 컨테이너화된 추론을 위한 NVIDIA NIM으로 제공되며, 도메인 특화 파인튜닝을 위한 NVIDIA NeMo를 통해 커스터마이징할 수 있습니다.
  • Prototyping: build.nvidia.com에서 무료 프로토타입 제작이 가능합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch