flashrt-project/FlashRT
FlashRT is a high-performance realtime inference engine for small-batch, latency-sensitive AI workloads. The flagship integration is production VLA control for Pi0, Pi0.5, GROOT N1.6, and Pi0-FAST. Also support llm e.g, qwen3.6-27B
FlashRT – 面向低批量、延遲敏感型 AI 的即時推理引擎
是什麼 – FlashRT 是一個 C++/CUDA 庫,將手寫內核(歸一化、激活函數、融合殘差-歸一化-量化、RoPE、FP8/NVFP4 GEMM、Flash-Attention 等)打包為一個 靜態 CUDA 圖,可幾乎無 Python 開銷地重放。它針對的是單一請求必須盡可能快速回應的場景(機器人控制、視覺-語言模型、影片生成、長上下文 LLM 服務),而非 TensorRT、vLLM 或 SGLang 等高吞吐量批量導向的伺服器架構。
核心理念
- 無需編譯步驟 – 模型直接從 safetensors/Orbax 加載,首次呼叫即可將整個前向傳播捕獲為靜態圖。後續呼叫僅為圖重放(約 3 秒預熱,之後 Python 開銷低於毫秒級)。
- 硬體無關內核庫 – 相同的內核二進位檔可在 Jetson AGX Thor(邊緣)到 RTX 5090/4090/A100(伺服器)上運作。NVIDIA 特定實作開箱即用。
- FlashRT Structures – 一個輕量級插件層,可將內核庫與未修改的 PyTorch、JAX 或 Hugging-Face 模型「連接」起來。無需分叉或原始碼修改;宿主模型保持不變,執行時僅透過快速內核路由張量。
- 支援 FP8 / NVFP4 – 自動按張量校準(快取為 JSON),使 8 位浮點格式可用於權重和激活,大幅減少記憶體與運算量,同時保持與 FP16/BF16 基準 >0.999 的餘弦相似度。
- 統一服務 API – 三行 Python 接口(
flash_rt.load_model(...).predict(...))適用於圖像-文字-影片生成、VLA 機器人控制,以及 OpenAI 兼容的 LLM/音訊端點。
可實現的功能(如倉儲所示)
| 領域 | 模型 | 硬體 | 延遲 / 吞吐量 |
|---|---|---|---|
| VLA 機器人控制 | Pi0.5, GROOT N1.6/N1.7 | Jetson AGX Thor, RTX 5090 | 每次決策 8ms → 29ms(3.8Hz → 34Hz) |
| 視覺-語言 | Qwen-3-VL-8B | RTX 5090 | 65 → 146 詞元/秒(約 1.8 倍加速) |
| LLM(混合專家) | Qwen-3.6-35B-A3B(NVFP4) | RTX 5090 | 52 → 285 詞元/秒,支援 256K 上下文 |
| 影片生成 | Wan2.2-TI2V-5B | RTX 5090 | 總耗時 6.48s → 1.68s(約 4 倍更快) |
為何重要 – 許多現實世界 AI 系統(自動駕駛機器人、互動式助手、設備端影片工具)無法承受批量伺服器的延遲。FlashRT 的靜態圖重放與低精度內核可在邊緣 GPU 上實現 <30ms 的端到端回應,同時仍可擴展至伺服器級 GPU 上的大規模 LLM。
快速上手
from flash_rt import structures
# 加載任意 Hugging-Face / PyTorch 模型(無需程式碼變更)
model = flash_rt.load_model("Qwen3.6-35B-A3B", precision="nvfp4")
# 附加快速內核流水線
plan = structures.attach(model, model.forward)
print(structures.explain(plan)) # 顯示哪些操作被保留、融合或拒絕
# 簡單推理迴圈
loop = structures.decode_loop(model, max_len=4096)
output = loop.generate(input_ids, max_new_tokens=256)
倉儲還包含可直接執行的範例(examples/structure_pipeline/)、基準測試腳本,以及一組用於暴露 OpenAI 兼容 HTTP 端點的 服務 容器(適用於 LLM 或音訊生成)。
在生態系統中的定位
- 補足於 TensorRT(擅長高批量、編譯型引擎)和 vLLM/SGLang(擅長大規模併發 LLM 服務)。FlashRT 填補了 單串流、低批量、即時 推理的空白。
- 整合於 現有 Python 生態系統(PyTorch、JAX、Hugging-Face Transformers、Diffusers)透過 Structures 插件,因此可保留熟悉的訓練程式碼,僅替換執行時。
- 開源 – 核心引擎位於
flashrt-project/FlashRT;相關內核套件在FlashRT-HF-kernels;嵌入式機器人用 C++ 執行時在FlashRT-Nexus。
文件與社群
- 論文:https://arxiv.org/abs/2606.20537
- 內核庫:https://github.com/flashrt-project/FlashRT-HF-kernels 與 https://huggingface.co/flashrt
- 示範影片與教學:https://github.com/flashrt-project/FlashRT-assets 以及 README 中連結的 Hugging-Face Space。
- 活躍的變更日誌(2026年7月–8月):快速新增 Qwen-3-VL、Cosmos3-Edge、Higgs Audio、OmniVoice 等模型,以及 Jetson Orin、RTX 5090 等硬體支援。
總結 – FlashRT 是一個真正高性能量產的推理引擎,專注於延遲敏感、小批量 AI 工作負載。它提供手寫 CUDA 內核、靜態圖重放與插件系統,使你無需重寫即可加速現有 PyTorch/JAX 模型,特別適用於機器人、即時視覺-語言代理,以及邊緣與伺服器 GPU 上的低延遲 LLM 服務。
相關
- 專案
- Dispatch
- 專案
- 專案
- Dispatch