Falcon Mamba 7B 릴리스 노트

Falcon Mamba는 원래 Mamba 아키텍처를 기반으로 하며, 선택적 상태 공간을 활용해 트랜스포머의 시퀀스 스케일링 제한을 극복합니다. 대규모에서 안정적인 학습을 보장하기 위해 TII는 기본 Mamba 설계에 추가 RMS 정규화 레이어를 도입했습니다.

이 아키텍처는 어텐션 기반 모델에 비해 두 가지 주요 기술적 장점을 제공합니다:

  • 임의의 시퀀스 길이: 모델은 메모리 저장량이 증가하지 않고도 어떤 길이의 시퀀스든 처리할 수 있어 단일 A10 24GB GPU에 맞출 수 있습니다.
  • 일정한 생성 시간: 새로운 토큰을 생성하는 데 걸리는 시간은 컨텍스트 크기에 관계없이 일정합니다.

모델 학습 및 데이터

Falcon Mamba는 약 5,500GT의 데이터로 학습되었습니다. 데이터셋은 주로 RefinedWeb 데이터로 구성되며, 공개 소스의 고품질 기술 데이터와 코드를 보완했습니다. 학습 과정은 대부분 일정한 학습률을 사용했으며, 이후 짧은 학습률 감소 단계에서 고품질 큐레이션 데이터를 소량 포함시켜 최종 성능을 향상시켰습니다.

성능 벤치마크

lm-evaluation-harness(Hugging Face 점수 정규화 포함)와 lighteval을 통해 수행된 평가 결과, Falcon Mamba-7B는 현재까지 가장 강력한 순수 SSM 모델이며, 종종 하이브리드 SSM-어텐션 모델 및 여러 트랜스포머 기반 모델의 성능과 경쟁하거나 이를 능가합니다.

새로운 리더보드 버전 결과

모델 이름 IFEval BBH MATH LvL5 GPQA MUSR MMLU-PRO 평균
Falcon Mamba-7B 33.36 19.88 3.63 8.05 10.86 14.47 15.04
recurrentgemma-9b 30.76 14.80 4.83 4.70 6.60 17.88 13.20
Falcon2-11B 32.61 21.94 2.34 2.80 7.53 15.44 13.78
Meta-Llama-3.1-8B 12.70 25.29 4.61 6.15 8.98 24.95 13.78
gemma-7B 26.59 21.12 6.42 4.92 10.98 21.64 15.28

LLM 리더보드 (첫 번째 버전) 결과

모델 이름 ARC HellaSwag MMLU Winogrande TruthfulQA GSM8K 평균
Falcon Mamba-7B 62.03 80.82 62.11 73.64 53.42 52.54 64.09
recurrentgemma-9b 52.00 80.40 60.50 73.60 38.60 42.60 57.95
Falcon2-11B 59.73 82.91 58.37 78.30 52.56 53.83 64.28
Meta-Llama-3-8B 60.24 82.23 66.70 78.45 42.93 45.19 62.62

메모리 및 처리량 분석

Falcon Mamba는 시퀀스 처리의 프리필(prefill) 및 디코드 단계 모두에서 트랜스포머 모델에 비해 상당한 효율성 향상을 보여줍니다.

프리필 효율성

프롬프트(프리필)를 처리하는 주요 방법은 두 가지입니다:

  1. 병렬 프리필: 전체 프롬프트를 병렬로 처리하여 GPU 활용도를 최대화합니다. 이 모드에서는 은닉 상태를 저장해야 하므로 메모리 요구량이 프롬프트 길이에 따라 증가합니다. 그럼에도 불구하고 Falcon Mamba는 트랜스포머보다 더 긴 시퀀스를 수용합니다.
  2. 순차 프리필: 프롬프트를 토큰 단위 또는 청크 단위로 처리합니다. 이 방법을 통해 SSM은 트랜스포머에서 발생하는 메모리 스케일링 문제 없이 임의의 긴 프롬프트를 처리할 수 있습니다.

생성 처리량

프롬프트 길이가 1이고 최대 130k 토큰을 생성하는 H100 GPU 테스트에서 Falcon Mamba는 일정한 처리량과 안정적인 CUDA 피크 메모리를 유지했습니다. 반면 트랜스포머 모델은 시퀀스 길이가 증가함에 따라 피크 메모리 사용량이 늘고 생성 속도가 감소했습니다.

구현 및 제공

Falcon Mamba는 Hugging Face transformers 라이브러리(버전 >4.45.0)에 통합되어 있으며 AutoModelForCausalLMpipeline API와 호환됩니다.

모델 변형

  • Base Model: 표준 사전 학습 모델.
  • Instruct Model: 50억 토큰의 감독 미세조정(SFT) 데이터를 사용해 향상된 지시 작업 성능을 위해 미세조정된 버전.
  • Quantized Versions: base와 instruct 모델 모두에 대해 4비트 변환 버전이 제공되며, bitsandbytes 호환 GPU 사용자가 이용할 수 있습니다.

최적화

사용자는 모델을 로드한 후 torch.compile(model)을 적용하여 추론 속도를 높일 수 있습니다.

SUMMARY: Technology Innovation Institute (TII)는 Falcon Mamba 7B를 출시했습니다. 이는 대규모 순수 상태 공간 언어 모델(SSLM) 최초로, 최첨단 트랜스포머 모델의 성능에 필적하면서 어텐션 기반 메모리 스케일링 문제를 제거합니다.

TITLE: Falcon Mamba 7B 릴리스 노트

Sources