Falcon 3 릴리스 노트 / 새로운 기능

요약 (TL;DR)

Technology Innovation Institute (TII)가 100억 파라미터 미만의 디코더 전용(decoder-only) 대규모 언어 모델 제품군인 Falcon 3를 출시했습니다. 이 모델들은 학습 효율성과 과학, 수학, 코딩 분야에서의 높은 성능을 우선시하며, 특히 Falcon3-10B-Base 모델은 13B 파라미터 미만 모델 중 최고 수준(state-of-the-art)의 성능을 달성했습니다.

모델 제품군 및 변체

Falcon 3 제품군은 다음과 같은 다양한 형식(Instruct, GGUF, GPTQ-Int4, GPTQ-Int8, AWQ, 1.58-bit 변체 포함)으로 제공되는 5개의 베이스 모델로 구성됩니다:

  • Falcon3-1B-Base: 프루닝(pruning) 및 지식 증류(knowledge distillation)를 통해 개발된 컴팩트 모델.
  • Falcon3-3B-Base: 프루닝(pruning) 및 지식 증류(knowledge distillation)를 통해 개발된 컴팩트 모델.
  • Falcon3-7B-Base: 14조 개의 토큰으로 학습된 주요 트랜스포머 기반 모델.
  • Falcon3-10B-Base: 7B 모델의 중복 레이어를 복제하고 사전 학습을 지속하여 생성된 업스케일 버전.
  • Falcon3-Mamba-7B-Base: 추가로 1.5조 개의 토큰을 학습한 강화된 상태 공간 언어 모델(SSLM).

기술 혁신 및 학습 방법론

Falcon 3는 학습 비용을 절감하면서 성능을 최적화하기 위해 여러 전략을 채택했습니다:

트랜스포머 기반 학습

7B 모델은 웹, 코드, STEM 및 다국어 데이터를 포함한 14조 개의 토큰을 1,024개의 H100 GPU 칩을 사용하여 학습했습니다. 10B 모델을 만들기 위해 TII는 7B 모델의 중복 레이어를 복제하는 depth up-scaling 방식을 사용하고, 2조 개의 고품질 데이터로 사전 학습을 지속했습니다.

소형 모델의 효율성

1B 및 3B 모델은 지식 증류 및 프루닝 기술을 사용하여 100GT 미만의 정제된 데이터로 개발되었습니다.

상태 공간 모델 (SSM) 통합

Falcon3-Mamba-7B-Base는 7B 규모에서 선도적인 트랜스포머 기반 LLM과 대등하거나 이를 능가하는 순수 SSM입니다. 이 모델은 32K 컨텍스트 길이를 지원하며, 원본 Falcon Mamba 7B와 동일한 아키텍처를 유지하여 원활한 통합이 가능합니다.

성능 벤치마크

일반 및 전문 역량

Falcon 3 모델은 여러 영역에서 경쟁력 있는 성능을 보여줍니다:

  • 수학 (Mathematics): Falcon3-10B-Base는 MATH-Lvl5에서 22.9, GSM8K에서 83.0을 기록했습니다.
  • 코딩 (Coding): Falcon3-10B-Base는 MBPP에서 73.8을 달성했으며, Falcon3-10B-Instruct는 Multipl-E에서 45.8을 기록했습니다.
  • 추론 (Reasoning): Falcon3-7B-Base와 Falcon3-10B-Base는 BBH에서 각각 51.0과 59.7을 기록했습니다.
  • 과학 지식 (Scientific Knowledge): Falcon3-10B-Base는 MMLU에서 73.1, MMLU-PRO에서 42.5를 달성했습니다.

비교 성능

  • Falcon3-1B-Base는 gemma-2-2b와 대등하며 SmolLM2-1.7B를 능가합니다.
  • Falcon3-3B-Base는 Llama-3.1-8B 및 Minitron-4B-Base보다 뛰어난 성능을 보입니다.
  • Falcon3-7B-Base는 Qwen2.5-7B와 대등합니다.
  • Falcon3-10B-Base는 13B 미만 카테고리에서 최고 수준(state-of-the-art)입니다.
  • Instruct 모델: Falcon3-7B-Instruct 및 Falcon3-10B-Instruct는 오픈 리더보드에서 13B 규모 미만의 모든 instruct 모델보다 뛰어난 성능을 보입니다.

아키텍처 사양

  • 컨텍스트 길이 (Context Length): 1B 모델(최대 8k 지원)을 제외한 대부분의 모델은 최대 32k 토큰을 지원합니다.
  • 아키텍처: 트랜스포머 기반 모델은 Llama 아키텍처와 호환됩니다. 트랜스포머 모델은 18~40개 레이어로 구성되며, Mamba 모델은 64개 레이어를 가집니다.
  • 활성화 및 어휘집 (Activation and Vocabulary): 모든 모델은 SwiGLU 활성화 함수를 사용합니다. 어휘집 크기는 트랜스포머 모델의 경우 131K 토큰이며, Mamba-7B의 경우 65K입니다.
  • 최적화: Falcon3-7B-Base는 256의 head dimension을 사용하여 FlashAttention-3를 통한 높은 처리량(throughput)을 최적화합니다.

향후 로드맵 및 라이선스

모든 Falcon 3 모델은 Falcon LLM 라이선스 하에 출시됩니다. TII는 2025년 1월에 멀티모달 기능(이미지, 비디오, 오디오 지원)을 갖춘 추가 Falcon 3 제품군 모델과 전체 기술 보고서를 공개할 예정이라고 발표했습니다.

Sources