Falcon 2 11B 릴리즈 노트

TII는 11B 파라미터 대형 언어 모델(LLM)과 이에 대응하는 비전‑언어 모델(VLM)을 갖춘 새로운 세대 오픈소스 모델인 Falcon 2를 출시했습니다. 이 모델들은 커뮤니티에 더 작고 효율적인 모델을 제공하여 추론 비용을 낮추면서도 다중 언어 및 다중 모달리티에서 높은 성능을 유지하도록 설계되었습니다.

Falcon2-11B LLM 기술 사양

Falcon2-11B는 RefinedWeb 데이터 5,000조 토큰 이상으로 사전 학습된 언어 모델이며, 기술 데이터, 코드, 대화 데이터 등을 포함한 선별된 코퍼스로 보강되었습니다.

학습 전략 및 데이터

모델은 컨텍스트 길이를 단계적으로 늘리고 성능을 정제하기 위해 네 단계 전략으로 학습되었습니다:

단계 컨텍스트 길이 토큰 (GT)
단계 1 2048 4500
단계 2 4096 250
단계 3 8192 250
단계 4 8192 500

데이터 소스에는 RefinedWeb-English와 RefinedWeb-Europe이 포함되며, 다음 열 개 언어를 포괄합니다: 체코어(cs), 독일어(de), 스페인어(es), 프랑스어(fr), 이탈리아어(it), 네덜란드어(nl), 폴란드어(pl), 포르투갈어(pt), 루마니아어(ro), 스웨덴어(sv).

모델 아키텍처 및 학습 절차

Falcon2-11B는 다음 사양을 갖는 Transformer 기반 아키텍처를 사용합니다:

  • Transformer 블록: 60
  • 쿼리 헤드: 32
  • 키/값 헤드: 8
  • 헤드 차원: 128
  • 병렬 어텐션: Yes
  • MLP 업스케일 팩터: 4

학습은 1,024개의 A100 40GB GPU에서 3D 병렬 전략(TP=8, PP=1, DP=128), ZeRO, Flash‑Attention 2를 이용해 수행되었습니다. 모델은 bfloat16 정밀도와 AdamW 옵티마이저를 사용했으며, 첫 번째 단계에서는 코사인 감쇠 학습률 스케줄을 적용했습니다.

Falcon2-11B LLM 성능 평가

Falcon2-11B는 더 큰 모델 및 기타 7B‑11B 클래스 모델과 경쟁력 있는 성능을 보여줍니다.

영어 및 일반 벤치마크

Open LLM Leaderboard 과제에서 Falcon2-11B는 평균 점수 64.28을 기록해 Gemma-7B(64.29)와 동등한 수준이며, Llama3-8B(62.38)와 Mistral-7B(60.97)보다 우수합니다. 특히 제로샷 평가에서 Falcon2-11B는 규모가 훨씬 큰 Falcon-40B와 비슷한 성능을 제공하지만 모델 크기는 네 배 더 작습니다.

다국어 및 코딩 능력

Falcon2-11B는 독일어, 스페인어, 프랑스어, 이탈리아어, 네덜란드어, 루마니아어 등 6개 언어에 대해 Falcon-40B 및 여러 다국어 모델을 능가합니다. 코드 생성에서는 HumanEval 벤치마크에서 Python에 대해 pass@1 29.59%를 달성했으며, 이는 BigCode Leaderboard 결과와 일치합니다.

Falcon2-11B 비전‑언어 모델(VLM)

Falcon2-11B VLM은 LLM의 기능을 이미지 이해까지 확장하여 사용자가 시각 콘텐츠에 대해 텍스트 기반 대화를 할 수 있게 합니다.

아키텍처 및 학습

VLM은 사전 학습된 CLIP ViT‑L/14 비전 인코더와 챗‑파인튜닝된 Falcon2-11B 모델을 결합합니다. 작은 객체와 미세한 디테일 인식을 개선하기 위해 LLaVA‑Next와 유사한 동적 고해상도 인코딩 메커니즘을 사용합니다.

학습은 두 단계로 진행되었습니다:

  1. 프리트레이닝: LLM과 비전 인코더는 고정된 상태로 두고, 멀티모달 프로젝터를 558K 이미지‑캡션 쌍에 대해 학습시켜 시각 임베딩을 텍스트 공간에 매핑했습니다.
  2. 파인튜닝: 프로젝터와 LLM 가중치를 1.2M 이미지‑텍스트 지시 데이터(다중 라운드 대화 포함)로 학습했습니다.

VLM 평가

Falcon2-11B VLM은 여러 비전 벤치마크에서 강력한 성능을 보이며 평균 점수 74.4를 기록, LLaVA‑1.6(Vicuna‑7B)의 72.1 및 LLaVA‑1.6(Mistral‑7B)의 73.3을 능가합니다.

모델 MME GQA SQA POPE VQAv2 TextVQA MM‑Bench SEED‑IMG 평균
Falcon2-11B VLM 1589/343 64.5 74.9 88.4 82.1 66.7 72.0 72.3 74.4
LLaVA-1.6 (Vicuna-7B) 1519/332 64.2 70.1 86.5 81.8 64.9 67.4 70.2 72.1
LLaVA-1.6 (Vicuna-13B) 1575/326 65.4 73.6 86.2 82.8 67.1 70.0 71.9 73.8

라이선스

Falcon 2 모델은 TII Falcon 2 License 하에 공개되며, 이는 Apache 2.0 기반의 관용적 라이선스로 책임 있는 AI 배포를 위한 허용 사용 정책을 포함합니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch