Intel Meteor Lake에서 Phi-2: 로컬 LLM 추론

Hugging Face는 최첨단 소형 언어 모델을 최적화된 하드웨어, 효율적인 모델 아키텍처 및 양자화를 결합함으로써 중급 노트북에서 로컬로 실행할 수 있음을 입증했습니다. 특히 Microsoft Phi-2 모델은 4비트 양자화를 사용하여 Intel Meteor Lake (Core Ultra) 프로세서에 배포할 수 있으며, 클라우드 기반 AI 서버 없이도 충분한 성능을 달성합니다.

로컬 LLM 추론 활성화

로컬 추론은 외부 API에 대한 의존성을 없애며 여러 주요 장점을 제공합니다:

  • 프라이버시: 데이터가 로컬 장치에 남아 외부 서버로 전송되지 않습니다.
  • 지연 시간: 네트워크 왕복이 사라져 응답 시간이 감소합니다.
  • 연결성: 모델을 완전히 오프라인으로 운영할 수 있습니다.
  • 비용: 사용자는 API 호출 및 모델 호스팅과 관련된 비용을 피할 수 있습니다.
  • 맞춤화 가능성: 사용자는 모델을 미세 조정하거나 특정 작업을 위해 로컬 Retrieval-Augmented Generation (RAG)을 구현할 수 있습니다.

Intel Meteor Lake 아키텍처

2023년 12월에 출시되어 Core Ultra로 이름이 바뀐 Intel Meteor Lake는 고성능 노트북에 최적화된 칩렛 기반 아키텍처입니다. 세 가지 주요 연산 구성 요소를 갖추고 있습니다:

  • CPU: 최대 16코어의 전력 효율적인 프로세서.
  • 통합 GPU (iGPU): 최대 8개의 Xe 코어를 포함합니다. 각 코어는 256비트 벡터 연산이 가능한 16개의 Xe Vector Engine (XVE)을 가지고 있으며, 효율적인 내적 계산을 위한 DP4a 명령을 구현합니다.
  • 신경 처리 장치 (NPU): 전력 효율적인 클라이언트 AI 연산을 위해 설계된 전용 AI 엔진으로, CPU와 iGPU의 부하를 줄입니다.

Microsoft Phi-2 모델

Phi-2는 2023년 12월에 출시된 27억 파라미터 모델입니다. 규모에도 불구하고 Phi-2는 보고된 벤치마크에서 여러 70억 및 130억 파라미터 모델을 능가하고, 훨씬 큰 Llama-2 70B 모델과도 경쟁력 있게 성능을 보여 자원 제한이 있는 노트북 환경에 이상적인 후보입니다.

OpenVINO와 Optimum Intel을 통한 양자화

Phi-2를 노트북 하드웨어에 적용 가능하도록 만들기 위해 Hugging Face는 Intel OpenVINO(AI 추론 최적화를 위한 오픈소스 툴킷)를 활용하며, 이를 optimum-intel 라이브러리에 통합합니다.

4비트 가중치 양자화

이 구현은 메모리와 연산 요구량을 줄이기 위해 4비트 가중치 양자화를 사용합니다. 주요 구성 파라미터는 다음과 같습니다:

  • 비율: 가중치 중 4비트로 양자화되는 비율을 제어합니다(예: 80%). 나머지는 8비트로 유지됩니다.
  • 그룹 크기: 가중치 양자화 그룹의 크기를 정의합니다(예: 128). 각 그룹은 스케일링 팩터를 공유합니다.

이 값들을 낮추면 일반적으로 모델 정확도가 향상되지만 모델 크기와 추론 지연 시간이 증가합니다.

구현 워크플로우

개발자는 다음 절차를 통해 모델을 배포할 수 있습니다:

  1. optimum[openvino,nncf]를 설치합니다.
  2. 비트 수, 그룹 크기 및 비율을 지정하는 OVWeightQuantizationConfig를 정의합니다.
  3. export=True 옵션으로 OVModelForCausalLM을 사용해 모델을 로드하여 OpenVINO 형식으로 변환합니다.
  4. 모델을 컴파일하고 표준 Hugging Face 파이프라인을 통해 추론을 실행합니다.

성능 결과

Core Ultra 7 155H CPU를 탑재한 중급 노트북에서 테스트한 결과, 4비트 양자화된 Phi-2 모델은 고등학교 물리 문제 해결 및 NumPy를 사용한 완전 연결 레이어용 Python 클래스 작성 등 복잡한 작업에서도 높은 출력 품질을 유지함을 보여주었습니다. 생성 속도는 일상적인 로컬 사용에 충분하다고 평가되었습니다.

Sources