인텔과 Hugging Face 파트너십: 머신러닝 하드웨어 가속
인텔과 Hugging Face는 인텔의 AI 소프트웨어와 Xeon 하드웨어를 Hugging Face 생태계와 통합하여 머신러닝 하드웨어 가속을 민주화하기 위해 파트너십을 맺었습니다. 이번 협업은 Optimum Intel 오픈소스 라이브러리를 중심으로 진행되며, 이 라이브러리는 인텔 플랫폼에서 Transformer 모델을 최적화하여 성능, 확장성 및 생산성을 향상시키는 과정을 단순화합니다.
Optimum Intel를 활용한 Transformer 가속 간소화
Optimum Intel는 Hugging Face Optimum 라이브러리의 하위 구성 요소로, 머신러닝 실무자들의 지연 시간 최적화 복잡성을 줄이도록 설계되었습니다. 이는 **Intel Neural Compressor (INC)**를 기반으로 하며, 여러 딥러닝 프레임워크 전반에 걸친 네트워크 압축 기술에 대한 통합 인터페이스를 제공하는 오픈소스 라이브러리입니다.
Intel Neural Compressor가 제공하는 주요 기능은 다음과 같습니다:
- Quantization: 모델 파라미터의 비트 폭을 감소시켜(예: 32비트 부동소수점에서 8비트 정수로) 메모리와 연산 요구량을 줄입니다.
- Pruning: 예측 결과에 미미한 영향을 미치는 모델 파라미터를 0으로 만들거나 제거합니다.
- Knowledge Distillation: 성능을 유지하면서 모델을 압축하는 기술입니다.
Optimum Intel를 사용하면 초보자와 전문가 모두가 준비된 스크립트나 최소한의 코드 변경만으로 이러한 최신 최적화 기법을 적용할 수 있습니다.
성능 벤치마크 및 하드웨어 지원
이번 파트너십은 인텔의 가속 AI 기반, 특히 Intel Xeon Scalable CPU 플랫폼과 이에 연계된 하드웨어 최적화 AI 소프트웨어 도구들을 활용합니다.
두 조직 간의 이전 협업 노력은 상당한 성능 향상을 입증했습니다:
- Inference Latency: Intel Xeon Ice Lake CPU에서 DistilBERT에 대해 한 자리 수 밀리초 지연 시간이 달성되었습니다.
- Training Efficiency: Habana Gaudi 가속기를 지원함으로써 GPU 대비 최대 40% 향상된 가격 대비 성능을 제공합니다.
사례 연구: DistilBERT의 사후 훈련 양자화
Optimum Intel의 유용성을 보여주기 위해, 신발 리뷰 분류를 위해 미세 조정된 DistilBERT 모델을 대상으로 사례 연구를 수행했습니다. 이 과정에서는 사후 훈련 동적 양자화를 활용하여 모델의 메모리와 연산량을 축소했습니다.
기술 구현
optimum.intel.neural_compressor 모듈의 INCQuantizer를 사용하여, 10번의 시도 동안 최대 정확도 감소 5%를 허용하는 구성으로 모델을 양자화했습니다. 이 과정에서 표준 Linear 레이어를 DynamicQuantizedLinear 레이어로 교체했습니다.
결과
38개의 Linear와 2개의 Embedding 연산자를 양자화한 결과는 다음과 같은 성능 변화를 보였습니다:
- Execution Speed: 양자화된 모델의 평가 단계가 원본 모델보다 1.34배 빠르게 수행되었습니다.
- Accuracy: 정확도가 0.574에서 0.546으로 감소했습니다.
- Latency: 평가 과정의 소요 시간이 13.1534초에서 9.7695초로 감소했습니다.
향후 전망
이번 파트너십은 Optimum Intel 라이브러리의 기능을 지속적으로 확장하여, 사후 훈련 양자화를 넘어 보다 고급적인 프루닝 및 양자화 기법을 포함함으로써 Intel Xeon CPU와 Intel AI 라이브러리를 사용하는 사용자에게 최고의 효율성을 제공하는 것을 목표로 합니다.