SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
解決的問題
APEX 設計用以解決邊緣 LLM 推論的兩個主要瓶頸:模型權重移動成本(頻寬)以及 KV 快取不斷增加的記憶體開銷(上下文記憶體)。與傳統加速器在軟體中處理 KV 快取量化不同,APEX 將壓縮編解碼器直接整合至硬體資料路徑中,以在上下文擴增時維持一致的讀取速度。
工作原理
此專案以硬體晶片(tile)形式實作單一 Transformer 解碼器層。它使用時間多工的 INT8 systolic GEMM 引擎(MXE)來處理層內的所有矩陣運算。關鍵架構特性包括:
- 飛行中 KV 壓縮: 關鍵字與值在產生的瞬間即被壓縮,並在使用時解壓,根據標記重要性採用自適應精度(INT4 加上 fp16 外部通道)。
- 層遍歷器(Layer Walker): 晶片內的序列器,負責取得描述符並透過路由結構(XBR)將張量導向,使整個層僅需一次主機指令即可執行,無需多次往返通訊。
- 線上 Softmax: 一種數值穩定的實作方式,以串流方式處理分數,無需大型緩衝區。
- 權重串流傳輸: 權重透過專用燃料線從 DDR 串流傳輸,4 位元權重在供料器處解包為 INT8,以減少通訊流量。
適用對象
專注於高效 LLM 推論、客製化矽晶設計與硬體層級 KV 快取最佳化的硬體工程師、FPGA 開發者與 AI 研究人員。
主要亮點
- 位元精確驗證: 每個 RTL 模組均與可執行的 NumPy 金模型比對,確保零容忍不一致。
- 硬體已驗證: 已於 Lattice ECP5 與 AWS F2(VU47P)FPGA 硬體上使用 Qwen2.5 模型完成示範。
- 自適應精度: 使用 TIP 單元追蹤標記重要性,並驅動精度層級(KVQ8/KVQ4/KVQ4+)。
- 變異測試: 採用變異測試的測試平台,確保驗證套件確實能捕捉到 RTL 錯誤。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch