microsoft/TransformerCompression

For releasing code related to compression methods for transformers, accompanying our publications

해결하는 문제

Transformer 네트워크와 대규모 언어 모델(LLM)의 크기와 메모리 사용량을 복잡한 코드 최적화 없이 줄일 수 있습니다. 이로 인해 모델은 더 빠르게 실행되며 메모리 사용량이 줄어들지만 가능한 한 높은 성능을 유지할 수 있습니다.

작동 방식

SliceGPT는 사후 훈련 시 희소화 기법을 사용합니다. 먼저 각 Transformer 계층에 모델의 동작을 변경하지 않는 직교 변환을 적용합니다. 그런 다음 고유값 감쇠 기반으로 가장 중요도가 낮은 행과 열을 식별하고 "자르기"합니다. 이로 인해 큰 가중치 행렬이 더 작고 밀집된 행렬로 대체되며, 결과적으로 모델의 임베딩 차원이 효과적으로 감소합니다.

대상 사용자

Hugging Face 허브에서 제공하는 Llama-2, Llama-3, Phi-2, OPT 등의 모델을 사용하는 경우, 더 효율적인 배포를 위해 LLM을 압축하고자 하는 개발자 및 연구자들입니다.

주요 특징

  • 사후 훈련 압축: 재훈련 없이 기존 모델에 적용 가능합니다.
  • 메모리 감소 및 성능 향상: 임베딩 차원을 줄여 추론 속도를 높이고 메모리 사용량을 낮춥니다.
  • 복구 미세조정: LoRA를 사용한 사후 자르기 복구 미세조정(RFT)을 지원하여 손실된 성능을 회복할 수 있습니다.
  • 확장 가능한 아키텍처: 새로운 Hugging Face 모델 유형을 지원하기 위한 프레임워크(ModelAdapter 및 LayerAdapter)를 제공합니다.

"이 기법은 모델의 크기를 줄이면서도 성능 손실을 최소화하는 데 매우 효과적입니다." — @username

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트