SigmanticAI/apex-inference-chip

An inference chip design that runs a real LLM (Qwen2.5-0.5B) on FPGA — one transformer decoder layer in RTL, every silicon value bit-exact against a golden model. 0.56 tok/s measured, a 140× climb, full evidence trail.

何を解決するか

APEXは、エッジにおけるLLM推論の2つの主要なボトルネックに対処するように設計されています:モデル重みの移動コスト(帯域幅)とKVキャッシュの増大するメモリオーバーヘッド(コンテキストメモリ)。従来のアクセラレータがソフトウェアでKVキャッシュの量子化を処理するのに対し、APEXはハードウェアのデータパスに直接圧縮コーデックを統合し、コンテキストが拡大しても一貫した読み取り速度を維持します。

動作方法

このプロジェクトは、ハードウェアタイルとして単一のトランスフォーマー・デコーダ層を実装しています。層内のすべての行列演算を処理するために、時間多重化されたINT8 systolic GEMMエンジン(MXE)を使用しています。主なアーキテクチャ的特徴は以下の通りです:

  • 飛行中のKV圧縮: キーと値は生成された瞬間から圧縮され、使用時にデコードされ、トークンの重要度に基づいて適応的精度(INT4 + fp16オーバーライナー・レーン)を使用します。
  • レイヤー・ウォーカー: タイル内に搭載されたシーケンサーで、記述子をフェッチし、ルーティングファブリック(XBR)を通じてテンソルをルーティングし、ホストからの1回のコマンドで完全な層を実行可能にします(複数回のラウンドトリップ不要)。
  • オンライン・ソフトマックス: ストリーム形式でスコアを処理する数値的に安定した実装で、大容量バッファの必要性を排除します。
  • 重みストリーミング: 重みは専用の燃料ラインを介してDDRからストリーミングされ、フィーダーで4ビット重みがINT8にアンパックされ、トラフィックを削減します。

対象ユーザー

効率的なLLM推論、カスタムシリコン設計、ハードウェアレベルのKVキャッシュ最適化に注力するハードウェアエンジニア、FPGA開発者、AI研究者。

主な特徴

  • ビット正確な検証: すべてのRTLブロックが実行可能なNumPyゴールデンモデルと照合され、許容される不一致はゼロです。
  • ハードウェア実証: Lattice ECP5およびAWS F2(VU47P)FPGAハードウェア上でQwen2.5モデルを使用して実証済み。
  • 適応的精度: トークンの重要度を追跡するTIPユニットを用いて、精度階層(KVQ8/KVQ4/KVQ4+)を駆動します。
  • ミューテーションテスト: ミューテーションテストされたテストベンチを採用し、検証スイートが実際にRTLバグを検出できることを保証します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch