Falcon-Edge: 강력하고, 범용적이며, 미세조정 가능한 1.58비트 LLMs
Falcon-Edge는 BitNet 아키텍처를 기반으로 한 삼진 언어 모델 시리즈로, 엣지 디바이스에서 극한의 효율성을 위해 설계되었습니다. 삼진 가중치({-1, 0, 1})를 활용함으로써, 이 모델들은 전통적인 부동소수점 모델에 비해 메모리 사용량을 크게 줄이고 추론 속도를 높이는 "matmul-free" 설계를 가능하게 합니다.
주요 모델 변형 및 제공 여부
Falcon-Edge는 1억 및 30억 파라미터 두 가지 크기로 제공되며, 각 크기는 기본(base) 버전과 instruction-tuned 버전으로 제공됩니다. 다양한 배포 및 개발 요구를 지원하기 위해 팀은 하나의 학습 과정에서 세 가지 서로 다른 변형을 생성하는 사전 학습 패러다임을 도입했습니다:
- Native BitNet Model: 초고효율 추론을 위해 최적화된 표준 삼진 형식 모델.
- bfloat16 Variant: 가중치 스케일을 주입하여 BitNet 모델을 근사화한 비양자화 버전으로, 표준 Hugging Face transformers를 통해 로드할 수 있습니다.
- Pre-quantized Variant: 손쉬운 미세조정 및 지속적인 사전 학습을 위해 특별히 설계된 가중치.
기술 아키텍처 및 성능
Falcon-Edge 모델은 WSD 학습률 스케줄러를 사용하여 약 1.5 테라 토큰 규모의 내부 데이터 혼합으로 사전 학습되었습니다.
Hugging Face leaderboard v2 벤치마크를 사용한 평가에서 Falcon-Edge는 동등하거나 그보다 우수한 성능을 보였으며, 동일 규모의 다른 모델들과 비교해도 경쟁력을 나타냈습니다. 또한 모델은 leaderboard v1 과제에서 Microsoft의 BitNet 모델과도 경쟁력을 보여, BitNet 아키텍처가 다양한 분야에서 강력하게 학습될 수 있음을 증명했습니다.
범용성 근사
팀은 가중치를 양자화한 후 가중치 스케일을 주입하면 BitNet 모델의 bfloat16 대응 모델을 만들 수 있음을 발견했습니다. 이 근사는 모델이 비-BitNet 모델처럼 동작하면서도 높은 성능을 유지하도록 하며, 1B 및 3B 기본 모델에 대한 엔드투엔드 평가를 통해 확인되었습니다.
onebitllms를 사용한 미세조정
추론 전용 릴리스를 넘어가기 위해 Falcon-LLM 팀은 onebitllms Python 패키지를 출시했습니다. 이 툴킷은 사전 양자화된 BitNet 모델을 미세조정하기 위한 필수 유틸리티를 제공하며, 이를 표준 nn.Linear 레이어를 통해 실행하면 무의미한 출력이 발생하는 문제를 해결합니다.
onebitllms는 다음과 같은 핵심 기능을 제공합니다:
- Checkpoint Conversion: 사전 양자화된 모델 체크포인트를 BitNet 학습 형식으로 변환하여 Hugging Face의
trl라이브러리와 같은 미세조정 프레임워크에서 사용할 수 있게 합니다. - Quantization Utilities: 학습된 체크포인트를 BitNet 및
bfloat16형식으로 양자화하는 도구. - Low-level Components: 커스텀 사전 학습 프레임워크에 통합하기 위한 순수
BitnetLinear레이어와 Triton 커널.
현재 이 패키지는 전체 미세조정을 지원하며, BitNet 모델에 대한 파라미터 효율적 미세조정(PEFT)은 아직 해결되지 않은 연구 과제입니다.
향후 연구 방향
Falcon-Edge와 onebitllms의 출시를 통해 삼진 LLM의 향후 개발을 위한 몇 가지 핵심 영역이 확인되었습니다:
- GPU Inference Kernels:
bitnet.cpp와 유사하게 GPU에서 BitNet 모델을 네이티브 부동소수점 모델보다 빠르게 만들기 위한 특수 커널 개발. - PEFT Support: 1비트 모델에 파라미터 효율적 미세조정을 적용할 가능성 탐색.
- Universality Optimization: BitNet 체크포인트와 그
bfloat16대응 모델 간의 성능 격차를 더욱 줄이는 작업. - Multi-modal Expansion: 이러한 기본 모델을 활용해 최초의 다중모달 BitNet 비전 언어 모델(VLMs)을 만드는 것.
- Training Efficiency: 비- BitNet 모델에 비해 사전 학습 시 발생하는 현재 약 20%의 오버헤드를 줄이기 위해 BitNet 학습 커널을 최적화합니다.