Falcon 모델 출시 및 Hugging Face 생태계 통합
Falcon 모델
Falcon은 아부다비의 Technology Innovation Institute에서 만든 최첨단 언어 모델 제품군으로, Apache 2.0 라이선스 하에 출시되었습니다. 이 제품군은 Falcon‑40B와 그보다 작은 형제 모델인 Falcon‑7B로 구성됩니다. 출시 당시 Falcon‑40B는 Open LLM Leaderboard에서 1위를 차지했으며, Falcon‑7B는 자신의 무게 클래스에서 최고의 모델이었습니다. Falcon‑7B는 1.5조 토큰으로, Falcon‑40B는 1조 토큰으로 훈련되었으며, 데이터의 80 % 이상이 RefinedWeb 웹 코퍼스에서 나왔습니다. 두 모델 모두 멀티쿼리 어텐션을 사용하여 자기회귀 디코딩 중 키‑값 캐시 크기를 크게 줄입니다. Falcon‑40B는 완전 정밀도 추론에 약 90 GB의 GPU 메모리가 필요하며, Falcon‑7B는 약 15 GB만 필요합니다. Instruct 버전인 Falcon‑7B‑Instruct와 Falcon‑40B‑Instruct도 제공되며, 빠른 실험을 위해 권장됩니다.
데모
Falcon‑40B 모델은 Hugging Face Space에서 즉시 사용해 볼 수 있거나 내장된 playground를 통해 시도할 수 있습니다. 이 Space는 HuggingChat을 구동하는 동일한 기술인 Hugging Face의 Text Generation Inference 백엔드를 사용합니다. Falcon‑7B‑Instruct 모델의 Core ML 버전이 구축되어 M1 MacBook Pro에서 실행 시연되었으며, 가벼운 앱을 보여주는 비디오와 추가 탐색을 위한 Core ML 가중치 다운로드 링크가 제공됩니다.
추론
Falcon 모델은 표준 transformers 라이브러리로 실행할 수 있지만, bfloat16 데이터 타입을 사용하고 모델링 코드가 모델 저장소에 있기 때문에 원격 코드 실행을 활성화해야 합니다. 7B instruct 모델에 대해서는 AutoTokenizer, transformers.pipeline, torch_dtype=torch.bfloat16, trust_remote_code=True, 그리고 device_map="auto"를 사용하여 간단한 파이프라인을 구성할 수 있습니다. 40B 모델을 실행하려면 더 많은 메모리가 필요하지만, 8‑bit 모드로 로드하면 footprint가 약 45 GB로 줄어들어 A6000(48 GB)에는 맞지만 40 GB A100에는 맞지 않습니다. 여러 GPU와 accelerate를 사용하면 device_map="auto"가 레이어를 카드 간에 분배하거나 CPU로 오프로드할 수 있습니다. 최신 bitsandbytes, transformers, 그리고 accelerate를 사용하면 4‑bit 로드가 가능해져 40B 모델의 메모리 요구량이 약 27 GB로 줄어듭니다.
평가
Falcon‑40B 베이스 및 instruct 모델은 Open LLM Leaderboard에서 각각 평균 점수 60.4와 63.2로 1위와 2위를 차지했습니다. Falcon‑7B 베이스 모델은 48.8점을 얻어 LLaMA‑7B(47.6)와 MPT‑7B(48.6)를 앞섰습니다. 리더보드는 AI2 Reasoning Challenge, HellaSwag, MMLU, TruthfulQA를 통해 추론과 진실성을 평가합니다. 특히, Falcon‑40B는 단지 2 800 PF‑일의 사전 학습 컴퓨팅으로 이 성능을 달성했으며, 이는 LLaMA‑65B에 필요한 6 300 PF‑일의 약 절반에 해당하며, LLM 사전 학습에서의 추가 효율 향상이 여전히 가능함을 시사합니다.
PEFT를 사용한 미세 조정
매개변수 효율적인 방법을 사용하면 대형 Falcon 모델의 미세 조정이 가능해집니다. PEFT 라이브러리와 QLoRA를 사용하여 Falcon‑7B 모델은 단일 NVIDIA T4 GPU(16 GB)에서 Guanaco 데이터셋으로 미세 조정되었고, Falcon‑40B 모델은 단일 NVIDIA A100 GPU(80 GB)에서 미세 조정되었습니다. 4‑bit 양자화된 베이스 모델과 TRL 라이브러리의 SFTTrainer로 훈련하면 어댑터 파일이 몇 메가바이트 크기로만 생성됩니다—for example, 미세 조정된 Falcon‑7B 어댑터는 약 65 MB이며, 원래의 15 GB 반정밀도 모델과 비교됩니다. frozen 모델의 숨은 상태는 쿼리와 키 투영 레이어에 적용된 저순위 어댑터로 보강되어, 전체 가중치를 저장하지 않고도 결과 모델을 추론에 사용할 수 있습니다.
결론
Falcon 모델은 허용적인 라이선스로 상업적 사용이 가능하며, Hugging Face의 추론 도구로 간단히 실행할 수 있고, 소규모 하드웨어에서 PEFT 기반 미세 조정을 통해 쉽게 적응할 수 있습니다. 이번 출시는 커뮤니티가 이러한 공개된 대형 언어 모델 위에 애플리케이션, 실험, 추가 개선을 구축하도록 초대합니다.