SigmanticAI/apex-inference-chip
An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.
解决的问题
APEX 旨在解决边缘 LLM 推理的两个主要瓶颈:模型权重的高移动成本(带宽)以及 KV 缓存不断增长的内存开销(上下文内存)。与传统加速器在软件中处理 KV 缓存量化不同,APEX 将压缩编解码器直接集成到硬件数据通路中,以在上下文增长时保持一致的读取速度。
工作原理
该项目实现了一个硬件单元(tile)形式的单个 Transformer 解码器层。它使用时间复用的 INT8 systolic GEMM 引擎(MXE)来处理层内的所有矩阵运算。关键架构特性包括:
- 飞行中 KV 压缩: 键和值在生成的瞬间即被压缩,并在使用时解压,基于标记重要性采用自适应精度(INT4 加上 fp16 异常值通道)。
- 层遍历器(Layer Walker): 位于芯片上的序列器,负责获取描述符并通过路由结构(XBR)将张量路由,使得整个层仅需一次主机命令即可执行,无需多次往返通信。
- 在线 Softmax: 一种数值稳定的实现方式,以流式处理分数,无需大型缓冲区。
- 权重流式传输: 权重通过专用燃料线从 DDR 流式传输,4 位权重在馈送器处解包为 INT8,以减少通信流量。
适用人群
专注于高效 LLM 推理、定制硅设计和硬件级 KV 缓存优化的硬件工程师、FPGA 开发者和 AI 研究人员。
主要亮点
- 比特精确验证: 每个 RTL 模块均与可执行的 NumPy 金模型进行比对,确保零容忍不匹配。
- 硬件已验证: 已在 Lattice ECP5 和 AWS F2(VU47P)FPGA 硬件上使用 Qwen2.5 模型完成演示。
- 自适应精度: 使用 TIP 单元跟踪标记重要性,并驱动精度层级(KVQ8/KVQ4/KVQ4+)。
- 变异测试: 采用变异测试的测试平台,确保验证套件确实能捕捉到 RTL 错误。
相关
- 项目
- 项目
- 项目
- 项目
- Dispatch