Falcon-H1: 효율성과 성능을 위한 하이브리드 헤드 언어 모델
Hugging Face와 TII UAE는 0.5B에서 34B 파라미터까지의 6가지 오픈소스 언어 모델군인 Falcon-H1 시리즈를 출시했습니다. 클래식한 Transformer 기반 어텐션과 Mamba-2 상태 공간 모델(SSM)을 하이브리드 아키텍처로 결합함으로써 Falcon-H1은 더 큰 Transformer 기반 모델에 필적하는 성능을 달성하면서, 특히 긴 컨텍스트 길이에서 추론 속도와 메모리 효율성을 크게 향상시킵니다.
하이브리드 아키텍처: 어텐션과 SSM 결합
Falcon-H1은 어텐션과 Mamba-2 헤드를 통합하는 병렬 하이브리드 믹서 블록을 활용합니다. 이 설계는 어텐션과 SSM 헤드의 비율을 독립적으로 조정할 수 있게 하여, 상대적으로 적은 양의 어텐션만으로도 높은 성능을 달성할 수 있는 구성을 가능하게 합니다.
Key architectural optimizations include:
- SSM 파라미터: Mamba-2 아키텍처를 기반으로 모델은 더 큰 메모리 크기를 활용하여 최소한의 효율성 비용으로 성능을 향상시킵니다.
- Attention 파라미터: 모델은 표준 전체 어텐션 레이어를 사용하지만, 회전 위치 임베딩(RoPE)에서 매우 대규모 파라미터를 사용하여 성능을 개선합니다. 이는 SSM 구성 요소가 일부 위치 정보를 자체적으로 처리하기 때문입니다.
- Depth vs. Width: 모델 깊이를 늘리는 것이 성능에 가장 큰 영향을 미치는 것으로 밝혀졌습니다. 이로 인해 Falcon-H1-1.5B-Deep 변형이 만들어졌으며, 이는 작은 파라미터 수에서도 최대 성능을 최적화합니다.
모델 규모와 기능
Falcon-H1은 6가지 크기로 제공되며, 각각 기본 및 instruction-tuned 변형이 있으며, 관용적인 Apache 2.0 기반 라이선스로 출시됩니다:
- 0.5B
- 1.5B
- 1.5B-Deep
- 3B
- 7B
- 34B
성능 벤치마크
Falcon-H1 모델은 최소 두 배 크기의 모델 성능에 맞추거나 이를 초과하도록 설계되었습니다. 구체적으로 Falcon-H1-0.5B는 2024년 일반적인 7B 모델과 동등한 성능을 보이며, Falcon-H1-1.5B-Deep는 선도적인 7B–10B 모델과 경쟁합니다.
다국어 및 STEM 지원
- 다국어 지원: 모델은 아랍어, 중국어, 영어, 프랑스어, 독일어, 일본어, 한국어, 러시아어, 스페인어 등을 포함한 18개 언어를 기본적으로 지원하며, 다양한 다국어 토크나이저를 통해 100개 이상의 언어로 확장할 수 있습니다.
- STEM: 훈련 과정에서 고품질 STEM 데이터를 우선시하여 수학 및 과학 분야에서 강력한 역량을 확보했습니다.
- 컨텍스트 윈도우: 이 시리즈는 최대 256K 토큰의 컨텍스트 길이를 지원하여 장문 문서 처리와 다중 턴 대화를 용이하게 합니다.
훈련 전략 및 역학
Falcon-H1 개발은 하이브리드 아키텍처를 최적화하기 위해 기존 Transformer 훈련 관행에서 벗어나는 것을 포함했습니다.
데이터 전략
전통적인 커리큘럼 학습과 달리, Falcon-H1은 복잡한 데이터(예: 고급 수학 및 긴 컨텍스트 샘플)를 훈련 초기에 도입하는 전략으로 학습되어 모델이 복잡한 작업에 필요한 핵심 특징을 더 오래 학습할 수 있도록 했습니다. 또한 팀은 '기억 윈도우' 추정을 활용해 고품질 샘플을 더 자주 재사용하면서 일반화에 해를 끼치지 않도록 했습니다.
맞춤형 최대 업데이트 파라미터화 (μP)
6가지 모델 크기에 걸쳐 효율적인 스케일링을 가능하게 하기 위해 팀은 μP 하이퍼파라미터 전이를 사용했습니다. 기존 μP를 개선하여 모델 파라미터를 35개의 세분화된 그룹으로 나누고, 기본 모델 크기에서 각각의 배수를 공동 최적화했으며, 단순히 배수를 1로 가정하지 않았습니다.
안정성 및 노이즈 제어
SSM 기반 모델에서 흔히 발생하는 훈련 스파이크를 해결하기 위해 팀은 SSM 블록 내에서 μP 배수를 감쇠시키는 방식을 구현했습니다. 또한 파라미터 노름을 보다 잘 제어하기 위해 훈련 스케줄과 μP 배수 모두에 가중치 감쇠를 통합했습니다.
추론 효율성 및 처리량
Falcon-H1은 컨텍스트 길이가 증가함에 따라 순수 Transformer 모델에 비해 상당한 확장성 이점을 보여줍니다. Qwen2.5-32B와 비교했을 때, Falcon-H1은 긴 시퀀스 길이에서 입력 처리량(프리필)에서 최대 4배 속도 향상과 출력 처리량(생성)에서 최대 8배 속도 향상을 달성합니다.
현재 추론 파이프라인에서 보다 성숙한 어텐션 최적화 덕분에 순수 Transformer는 매우 짧은 컨텍스트 길이에서는 약간 더 빠를 수 있지만, 시퀀스 길이가 증가함에 따라 하이브리드 아키텍처의 효율성이 우세해집니다.