tenstorrent/tt-forge
Tenstorrent's MLIR Based Compiler. We aim to enable developers to run AI on all configurations of Tenstorrent hardware, through an open-source, general, and performant compiler.
解决的问题
TT-Forge 是一个开源的 AI 编译器栈,旨在使在 Tenstorrent 硬件上运行 AI 工作负载(包括推理和训练)变得简单。它弥合了 PyTorch、JAX、ONNX 等高级机器学习框架与底层 Tenstorrent 硬件之间的差距,确保只要模型能装入内存,就能执行。
工作原理
TT-Forge 作为一个基于 TT-Metalium 的多层堆栈运行。它使用多种前端从不同框架中导入模型:
- TT-XLA:PyTorch 和 JAX 的主要前端,将模型编译为 StableHLO 图。
- TT-Forge-ONNX:基于 TVM 的前端,支持 ONNX、TensorFlow 和 PaddlePaddle。
- TT-MLIR:核心 MLIR 基础编译器,对图进行优化(融合、分片、布局),并降低到 TT-Metalium。
- TT-Lang:一种 Python DSL,允许开发者用 Python 而非 C++ 编写高性能自定义内核。
- TT-Blacksmith:为各种模型类型提供优化的训练配方和实验。
适用人群
本项目适用于希望在 Tenstorrent 硬件上部署或训练模型的 AI 研究人员和开发者,以及需要高性能自定义操作的内核开发者。
主要亮点
- 广泛的框架支持:支持 PyTorch、JAX、ONNX、TensorFlow 和 PaddlePaddle。
- 丰富的模型库:CI 中测试了超过 800 个模型变体,包括 Llama 3、Stable Diffusion XL 和 YOLOv12。
- 单芯片与多芯片支持:可跨多个芯片(N300+)运行大型模型(如 Llama 3 70B)。
- 基于 Python 的内核开发:TT-Lang 支持在 Python 中编写融合操作,并内置仿真和性能分析功能。
相关
- 项目
- 项目
- 项目
- 项目
- 项目