flashrt-project/FlashRT

FlashRT is a high-performance realtime inference engine for small-batch, latency-sensitive AI workloads. The flagship integration is production VLA control for Pi0, Pi0.5, GROOT N1.6, and Pi0-FAST. Also support llm e.g, qwen3.6-27B

FlashRT – 面向低批量、延迟敏感型AI的实时推理引擎

是什么 – FlashRT 是一个 C++/CUDA 库,将手写内核(归一化、激活函数、融合残差-归一化-量化、RoPE、FP8/NVFP4 GEMM、Flash-Attention 等)打包为一个 静态 CUDA 图,可几乎无 Python 开销地重放。它针对的是单个请求必须尽可能快速响应的场景(机器人控制、视觉-语言模型、视频生成、长上下文 LLM 服务),而非 TensorRT、vLLM 或 SGLang 等高吞吐批量导向的服务器架构。

核心理念

  • 无需编译步骤 – 模型直接从 safetensors/Orbax 加载,首次调用即可将整个前向传播捕获为静态图。后续调用仅为图重放(约 3 秒预热,之后 Python 开销低于毫秒级)。
  • 硬件无关内核库 – 相同的内核二进制文件可在 Jetson AGX Thor(边缘)到 RTX 5090/4090/A100(服务器)上运行。NVIDIA 特定实现开箱即用。
  • FlashRT Structures – 一个轻量级插件层,可将内核库与未经修改的 PyTorch、JAX 或 Hugging-Face 模型“连接”起来。无需分叉或源码修改;宿主模型保持不变,运行时仅通过快速内核路由张量。
  • 支持 FP8 / NVFP4 – 自动按张量校准(缓存为 JSON),使 8 位浮点格式可用于权重和激活,大幅减少内存与计算量,同时保持与 FP16/BF16 基线 >0.999 的余弦相似度。
  • 统一服务 API – 三行 Python 接口(flash_rt.load_model(...).predict(...))适用于图像-文本-视频生成、VLA 机器人控制,以及 OpenAI 兼容的 LLM/音频端点。

可实现的功能(如仓库所示)

领域 模型 硬件 延迟 / 吞吐量
VLA 机器人控制 Pi0.5, GROOT N1.6/N1.7 Jetson AGX Thor, RTX 5090 每次决策 8ms → 29ms(3.8Hz → 34Hz)
视觉-语言 Qwen-3-VL-8B RTX 5090 65 → 146 词元/秒(约 1.8 倍加速)
LLM(混合专家) Qwen-3.6-35B-A3B(NVFP4) RTX 5090 52 → 285 词元/秒,支持 256K 上下文
视频生成 Wan2.2-TI2V-5B RTX 5090 总耗时 6.48s → 1.68s(约 4 倍更快)

为何重要 – 许多现实世界 AI 系统(自动驾驶机器人、交互式助手、设备端视频工具)无法承受批量服务器的延迟。FlashRT 的静态图重放与低精度内核可在边缘 GPU 上实现 <30ms 的端到端响应,同时仍可扩展至服务器级 GPU 上的大规模 LLM。

快速上手

from flash_rt import structures

# 加载任意 Hugging-Face / PyTorch 模型(无需代码变更)
model = flash_rt.load_model("Qwen3.6-35B-A3B", precision="nvfp4")

# 附加快速内核流水线
plan = structures.attach(model, model.forward)
print(structures.explain(plan))   # 显示哪些操作被保留、融合或拒绝

# 简单推理循环
loop = structures.decode_loop(model, max_len=4096)
output = loop.generate(input_ids, max_new_tokens=256)

仓库还包含可直接运行的示例(examples/structure_pipeline/)、基准测试脚本,以及一组用于暴露 OpenAI 兼容 HTTP 端点的 服务 容器(适用于 LLM 或音频生成)。

在生态系统中的定位

  • 互补于 TensorRT(擅长高批量、编译型引擎)和 vLLM/SGLang(擅长大规模并发 LLM 服务)。FlashRT 填补了 单流、低批量、实时 推理的空白。
  • 集成于 现有 Python 生态系统(PyTorch、JAX、Hugging-Face Transformers、Diffusers)通过 Structures 插件,因此可保留熟悉的训练代码,仅替换运行时。
  • 开源 – 核心引擎位于 flashrt-project/FlashRT;相关内核包在 FlashRT-HF-kernels;嵌入式机器人用 C++ 运行时在 FlashRT-Nexus

文档与社区


总结 – FlashRT 是一个真正高性能的推理引擎,专注于延迟敏感、小批量 AI 工作负载。它提供手写 CUDA 内核、静态图重放和插件系统,使你无需重写即可加速现有 PyTorch/JAX 模型,特别适用于机器人、实时视觉-语言代理,以及边缘和服务器 GPU 上的低延迟 LLM 服务。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • Dispatch