flashrt-project/FlashRT

FlashRT is a high-performance realtime inference engine for small-batch, latency-sensitive AI workloads. The flagship integration is production VLA control for Pi0, Pi0.5, GROOT N1.6, and Pi0-FAST. Also support llm e.g, qwen3.6-27B

FlashRT – 面向低批量、延遲敏感型 AI 的即時推理引擎

是什麼 – FlashRT 是一個 C++/CUDA 庫,將手寫內核(歸一化、激活函數、融合殘差-歸一化-量化、RoPE、FP8/NVFP4 GEMM、Flash-Attention 等)打包為一個 靜態 CUDA 圖,可幾乎無 Python 開銷地重放。它針對的是單一請求必須盡可能快速回應的場景(機器人控制、視覺-語言模型、影片生成、長上下文 LLM 服務),而非 TensorRT、vLLM 或 SGLang 等高吞吐量批量導向的伺服器架構。

核心理念

  • 無需編譯步驟 – 模型直接從 safetensors/Orbax 加載,首次呼叫即可將整個前向傳播捕獲為靜態圖。後續呼叫僅為圖重放(約 3 秒預熱,之後 Python 開銷低於毫秒級)。
  • 硬體無關內核庫 – 相同的內核二進位檔可在 Jetson AGX Thor(邊緣)到 RTX 5090/4090/A100(伺服器)上運作。NVIDIA 特定實作開箱即用。
  • FlashRT Structures – 一個輕量級插件層,可將內核庫與未修改的 PyTorch、JAX 或 Hugging-Face 模型「連接」起來。無需分叉或原始碼修改;宿主模型保持不變,執行時僅透過快速內核路由張量。
  • 支援 FP8 / NVFP4 – 自動按張量校準(快取為 JSON),使 8 位浮點格式可用於權重和激活,大幅減少記憶體與運算量,同時保持與 FP16/BF16 基準 >0.999 的餘弦相似度。
  • 統一服務 API – 三行 Python 接口(flash_rt.load_model(...).predict(...))適用於圖像-文字-影片生成、VLA 機器人控制,以及 OpenAI 兼容的 LLM/音訊端點。

可實現的功能(如倉儲所示)

領域 模型 硬體 延遲 / 吞吐量
VLA 機器人控制 Pi0.5, GROOT N1.6/N1.7 Jetson AGX Thor, RTX 5090 每次決策 8ms → 29ms(3.8Hz → 34Hz)
視覺-語言 Qwen-3-VL-8B RTX 5090 65 → 146 詞元/秒(約 1.8 倍加速)
LLM(混合專家) Qwen-3.6-35B-A3B(NVFP4) RTX 5090 52 → 285 詞元/秒,支援 256K 上下文
影片生成 Wan2.2-TI2V-5B RTX 5090 總耗時 6.48s → 1.68s(約 4 倍更快)

為何重要 – 許多現實世界 AI 系統(自動駕駛機器人、互動式助手、設備端影片工具)無法承受批量伺服器的延遲。FlashRT 的靜態圖重放與低精度內核可在邊緣 GPU 上實現 <30ms 的端到端回應,同時仍可擴展至伺服器級 GPU 上的大規模 LLM。

快速上手

from flash_rt import structures

# 加載任意 Hugging-Face / PyTorch 模型(無需程式碼變更)
model = flash_rt.load_model("Qwen3.6-35B-A3B", precision="nvfp4")

# 附加快速內核流水線
plan = structures.attach(model, model.forward)
print(structures.explain(plan))   # 顯示哪些操作被保留、融合或拒絕

# 簡單推理迴圈
loop = structures.decode_loop(model, max_len=4096)
output = loop.generate(input_ids, max_new_tokens=256)

倉儲還包含可直接執行的範例(examples/structure_pipeline/)、基準測試腳本,以及一組用於暴露 OpenAI 兼容 HTTP 端點的 服務 容器(適用於 LLM 或音訊生成)。

在生態系統中的定位

  • 補足於 TensorRT(擅長高批量、編譯型引擎)和 vLLM/SGLang(擅長大規模併發 LLM 服務)。FlashRT 填補了 單串流、低批量、即時 推理的空白。
  • 整合於 現有 Python 生態系統(PyTorch、JAX、Hugging-Face Transformers、Diffusers)透過 Structures 插件,因此可保留熟悉的訓練程式碼,僅替換執行時。
  • 開源 – 核心引擎位於 flashrt-project/FlashRT;相關內核套件在 FlashRT-HF-kernels;嵌入式機器人用 C++ 執行時在 FlashRT-Nexus

文件與社群


總結 – FlashRT 是一個真正高性能量產的推理引擎,專注於延遲敏感、小批量 AI 工作負載。它提供手寫 CUDA 內核、靜態圖重放與插件系統,使你無需重寫即可加速現有 PyTorch/JAX 模型,特別適用於機器人、即時視覺-語言代理,以及邊緣與伺服器 GPU 上的低延遲 LLM 服務。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • Dispatch