3진법 LLM을 위한 1.58비트 장벽 돌파

연구진은 3진법(ternary) 거대언어모델(LLM)을 가중치당 1.585비트라는 이론적 정보 이론 한계보다 더 작게 저장할 수 있는 BITCOS라는 새로운 가중치 저장 레이아웃을 개발했습니다. BITCOS는 3진법 가중치에서 0이 불균형적으로 많이 나타난다는 점을 활용하여, 가장 희소한 모델의 경우 가중치당 유효 비트 폭을 1.485비트까지 줄입니다.

1.58비트 장벽과 현재의 한계

3진법 LLM은 가중치를 $\text{−1}, 0, +1$ 중 하나의 기호로 저장합니다. 이론적인 최소 저장 비용은 가중치당 $\log_2 3 \approx 1.585$비트입니다. 현재 프로덕션 환경에서 널리 사용되는 형식은 5개의 3진법 가중치를 1바이트에 담는 "5-trit 패킹"입니다. 2의 거듭제곱 그룹 크기 때문에, 이는 가중치당 1.625비트라는 유효 저장 비트 폭을 초래합니다.

기존 방식은 세 기호가 각각 약 33.3%의 분포를 가진다고 가정하여 동일한 확률을 가진 것으로 취급합니다. 그러나 연구진이 29개의 서로 다른 3진법 LLM 모델의 실제 기호 분포를 측정한 결과, 0이 전체 가중치의 최대 51.5%를 차지한다는 사실을 발견했습니다.

BITCOS: 분포 적응형 레이아웃

이러한 높은 0 밀도를 활용하기 위해 연구진은 분포 적응형 레이아웃인 BITCOS를 도입했습니다. 고정 비트 패킹 방식 대신 BITCOS는 두 부분으로 구성된 구조를 사용합니다.

  1. 밀집 존재 비트맵(Dense Presence Bitmap): 가중치가 0인지 0이 아닌지를 나타내는 비트맵입니다.
  2. 압축된 부호 벡터(Compacted Sign Vector): 0이 아닌 가중치의 부호만 저장하는 압축 벡터입니다.

BITCOS의 저장 비용은 가중치 요소당 $2 - z$비트로 정의되며, 여기서 $z$는 모델 가중치의 0 밀도입니다. 0 밀도가 증가할수록 저장 비용은 감소합니다.

성능 및 하드웨어 최적화

// 성능 지표에 관한 단일 섹션

BITCOS는 테스트된 29개 모델 중 26개에서 5-trit 패킹보다 뛰어난 성능을 보입니다. 가장 희소한 모델에서는 가중치당 1.485비트의 저장 효율성에 도달합니다. 저자들은 AVX-512, AVX2 및 Intel Xe2 GPU를 포함한 최신 프로세서와 GPU를 위한 최적화된 압축 해제 시퀀스를 제공합니다.

최첨단 3진법 행렬-벡터 곱셈 커널과 비교했을 때, BITCOS는 다음과 같은 이점을 제공합니다:

  • 실질적 이득: 행렬-벡터 곱셈 커널에서 최대 1.28$imes$ 향상.
  • CPU 디코드 처리량: 클라이언트 및 서버 CPU에서 최대 1.18$imes$ 향상.
  • GPU 디코드 처리량: Intel Xe2 GPU에서 최대 1.27$imes$ 향상.

커뮤니티 통찰 및 반론

Hacker News의 기술 사용자들 사이의 논의에 따르면, 이 연구는 VRAM 및 RAM 제한이 엄격한 엣지 컴퓨팅 및 임베디드 시스템에 특히 유의미하다고 합니다.

한 사용자는 효율성 향상은 상당하지만, 이 영역에서는 PTQ(Post-Training Quantization)를 위한 벡터 양자화나 격자 기반 방법이 더 효과적일 수 있다고 지적했습니다. 다른 사용자는 산술 코딩이 더 많은 비트를 짜낼 수 있을지도 모르지만, 그 대가로 더 높은 압축 해제 오버헤드가 발생할 수 있다고 제안했습니다.

"만약 3진법 LLM이 성공해서 커스텀 실리콘 하드웨어에 내장된다면, 놀라울 정도로 효율적일 것이라고 확신합니다." — @handle

"이 기술은 임베디드 시스템을 위한 LLM 크기를 획기적으로 줄여, 진정한 휴대성을 가능하게 할 수 있습니다." — @handle

구현 세부 사항

연구진의 발견에 따르면 1.58비트 제한은 기호가 동일한 확률을 가질 때만 적용되는 한계입니다. 가중치 분포를 분포 적응형 레이아웃으로 처리함으로써, BITCOS는 모델을 단순한 저장 또는 전송 형식이 아닌 메모리 내에서 직접 사용할 수 있는 형식으로 저장할 수 있게 합니다.

Sources

관련