lucienhuangfu/eLLM

eLLM: Run Long-Horizon Inference Faster on CPUs Than on GPUs

해결하는 문제

eLLM은 대규모 언어 모델(LLM)을 실행할 때 CPU의 메모리 대역폭 제약을 극복하기 위해 설계되었습니다. 특히 장기적인 작업에 특화되어 있으며, 수백만 토큰의 컨텍스트 창과 다중 턴 상호작용이 필요한 상황에서 CPU 서버가 GPU보다 빠른 추론을 수행할 수 있게 해줍니다. 이로 인해 고가이고 전력 소모가 큰 GPU 하드웨어의 필요성을 줄일 수 있습니다.

작동 방식

이 프레임워크는 "저장소를 계산으로 바꾸는" 전략을 채택하여 DDR 메모리의 큰 용량을 활용해 반복 계산을 최소화합니다. 주요 기술적 구현은 다음과 같습니다:

  • 유연한 정적 계산 그래프: 차원 우선 레이아웃을 사용해 입력 길이의 변화에 대응할 수 있는 동일한 실행 그래프를 유지하며, 재구성할 필요가 없습니다.
  • 정적 크기의 KV 캐시: 페이지 기반 블록 관리를 사전에 할당된 고정 크기 텐서로 대체하여 메타데이터 오버헤드를 줄이고 캐시 미스를 방지합니다.
  • 대규모 차원 텐서: 큰 시퀀스 차원을 미리 확보해 전체 프리필(pre-fill)을 지원하고, 초장문 프롬프트에 대한 파라미터 반복 로딩을 피합니다.
  • 세션 캐시: 다중 턴 상호작용 간에 KV 상태를 유지하여, 새로운 입력만 단계적으로 프리필할 뿐 전체 이력을 재계산할 필요가 없습니다.

대상 사용자

컴퓨터 사용 에이전트, 대규모 리포지토리용 코드 코파일럿, 기업 지식 기반용 RAG 시스템, 수시간에서 수일에 걸쳐 상태를 유지하는 심층 연구 에이전트와 같은 장기적인 AI 에이전트 개발에 종사하는 개발자 및 연구자를 주요 대상으로 합니다.

주요 특징

  • GPU를 능가하는 성능: 장문 컨텍스트 추론 및 장기적인 작업에서 GPU를 능가한다고 주장합니다.
  • vLLM API 호환성: 기존 LLM 생태계에 직접 연결 가능합니다.
  • 초장문 컨텍스트 지원: TB 규모의 메모리를 사용해 수백만 토큰, 거의 무제한의 컨텍스트 창을 지원합니다.
  • 순수 CPU 추론: GPU/NPU가 필요 없어 인프라 비용과 에너지 소비를 줄입니다.
  • 일관된 결과: 추론 결과가 GPU 기반 결과와 일치합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트