SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
해결하는 문제
APEX는 엣지에서 LLM 추론의 두 가지 주요 병목을 해결하도록 설계되었습니다: 모델 가중치 이동 비용(대역폭)과 KV 캐시의 증가하는 메모리 오버헤드(컨텍스트 메모리). 전통적인 가속기들이 소프트웨어에서 KV 캐시 양자화를 처리하는 반면, APEX는 하드웨어 데이터패스에 직접 압축 코덱을 통합하여 컨텍스트가 커져도 일관된 읽기 속도를 유지합니다.
작동 방식
이 프로젝트는 하드웨어 타일로서 단일 트랜스포머 디코더 레이어를 구현합니다. 레이어 내의 모든 행렬 연산을 처리하기 위해 시간 다중화된 INT8 시스토리컬 GEMM 엔진(MXE)을 사용합니다. 주요 아키텍처적 특징은 다음과 같습니다:
- 비행 중 KV 압축: 키와 값은 생성된 순간부터 압축되고 소비될 때 복원되며, 토큰의 중요도에 따라 적응형 정밀도(INT4 + fp16 아웃라이어 레인)를 사용합니다.
- 레이어 워커: 타일 내 시퀀서로, 디스크립터를 가져와 루팅 패브릭(XBR)을 통해 텐서를 라우팅하여 하나의 호스트 명령으로 전체 레이어를 실행할 수 있게 하며, 여러 라운드트립이 필요하지 않습니다.
- 온라인 소프트맥스: 스트림 형식으로 점수를 처리하는 수치적으로 안정적인 구현으로, 대용량 버퍼가 필요하지 않습니다.
- 웨이트 스트리밍: 웨이트는 전용 연료 라인을 통해 DDR에서 스트리밍되며, 피더에서 4비트 웨이트가 INT8로 언패킹되어 트래픽을 줄입니다.
대상 사용자
효율적인 LLM 추론, 커스텀 실리콘 설계, 하드웨어 수준의 KV 캐시 최적화에 집중하는 하드웨어 엔지니어, FPGA 개발자, AI 연구자.
주요 특징
- 비트 정확한 검증: 모든 RTL 블록이 실행 가능한 NumPy 골든 모델과 비교되어, 허용되는 불일치가 없습니다.
- 하드웨어 검증: Lattice ECP5 및 AWS F2(VU47P) FPGA 하드웨어에서 Qwen2.5 모델을 사용하여 검증 완료.
- 적응형 정밀도: 토큰의 중요도를 추적하는 TIP 유닛을 사용하여 정밀도 계층(KVQ8/KVQ4/KVQ4+)을 제어합니다.
- 변이 테스트: 변이 테스트된 테스트 벤치를 사용하여 검증 세트가 실제로 RTL 버그를 포착할 수 있도록 보장합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch