Falcon 180B 출시 노트

TII는 1800억 파라미터 오픈 액세스 언어 모델인 Falcon 180B를 출시했습니다. 이 모델은 3.5조 토큰으로 훈련되었으며, 오픈 모델에 대한 새로운 최첨단 성능을 확립했으며, Google의 PaLM-2 Large와 같은 독점 시스템의 성능에 맞먹습니다.

모델 아키텍처 및 훈련

Falcon 180B는 Falcon 40B의 확장된 버전으로, 확장성을 높이기 위해 멀티쿼리 어텐션과 같은 혁신을 포함합니다. 이 모델은 최대 4,096개의 GPU에서 동시에 Amazon SageMaker를 사용하여 훈련되었으며, 총 약 7백만 GPU 시간이 소요되었습니다.

주요 훈련 사양은 다음과 같습니다:

  • 데이터셋: Predominantly web data from RefinedWeb (85%), supplemented by curated conversations, technical papers, and a small fraction of code (3%).
  • 규모: 3.5조 토큰, 이는 사전 훈련 데이터셋의 한 에포크 미만을 구성합니다.
  • 컴퓨팅: Llama 2보다 2.5배 더 크며, 네 배 더 많은 컴퓨팅으로 훈련되었습니다.

성능 및 벤치마크

출시 당시, Falcon 180B는 Hugging Face 리더보드에서 공개적으로 출시된 사전 훈련된 LLM 중 최고 점수인 67.85를 기록했습니다(후에 방법론이 업데이트되면서 67.85로 유지되어 Llama 2 70B와 동등한 수준에 놓였습니다).

기술적 성능 하이라이트는 다음과 같습니다:

  • 경쟁력: MMLU에서 Llama 2 70B 및 OpenAI의 GPT-3.5보다 성능이 뛰어납니다.
  • 독점적 동등성: HellaSwag, LAMBADA, WebQuestions, Winogrande, PIQA, ARC, BoolQ, CB, COPA, RTE, WiC, WSC, ReCoRD 등 여러 벤치마크에서 PaLM 2-Large와 동등한 성능을 보입니다.
  • 양자화 안정성: torch.float16, 8bit, 4bit 버전 전반에서 평가 지표가 유사하게 유지되지만, 8-bit 추론이 4-bit보다 znacz하게 빠르다는 점이 지적되었습니다.

배포를 위한 하드웨어 요구 사항

Falcon 180B를 실행하는 작업에 따라 상당한 계산 자원이 필요합니다. 특정 구성에 대한 다음과 같은 메모리 요구 사항이 확인되었습니다:

사용 사례 방법 필요한 메모리 예시 하드웨어
훈련 전체 파인튜닝 5120GB 8x 8x A100 80GB
훈련 ZeRO-3와 함께 LoRA 1280GB 2x 8x A100 80GB
훈련 QLoRA 160GB 2x A100 80GB
추론 BF16/FP16 640GB 8x A100 80GB
추론 GPTQ/int4 320GB 8x A100 40GB

구현 및 사용

Falcon 180B는 Transformers 버전 4.33을 통해 Hugging Face 생태계에 통합됩니다. 사용자는 호스팅 사용을 제한하는 조건 하에서 상업적 사용을 허용하는 모델의 라이선스를 받아들여야 합니다.

기본 모델 vs. 채팅 모델

  • 기본 모델: 추가 파인튜닝을 위한 사전 훈련된 플랫폼이며, 특정 프롬프트 형식을 따르지 않고 상자 밖에서 대화형 응답을 위해 설계되지 않았습니다.
  • 채팅 모델: 대규모 대화형 및 지시 데이터세트에 대해 파인튜닝되었습니다. 특정 프롬프트 구조를 사용합니다:
    • System: [optional system prompt]
    • User: [user input]
    • Falcon: [model response]

기술적 통합

통합은 transformers 라이브러리의 AutoModelForCausalLM 클래스를 통해 이루어집니다. 모델은 높은 정밀도를 위해 bfloat16를 지원하고, 하드웨어 오버헤드를 줄이기 위해 8비트 및 4비트 양자화를 위해 bitsandbytes를 지원합니다.

Sources