tenstorrent/tt-metal
:metal: TT-NN operator library, and TT-Metalium low level kernel programming model.
What is tt‑metal?
tt‑metal(亦称 TT‑Metalium)是一套开源软件堆栈,帮助开发者在 Tenstorrent 的自定义 AI 加速器(Wormhole 与 Blackhole 芯片)上编写并运行神经网络内核。它提供两层结构:
- TT‑Metalium – 低层 C++/Python 编程模型,用于构建直接在硬件上运行的内核。包括编程指南、一系列关于内存布局、数据格式、矩阵引擎的技术报告,以及调试和性能分析工具。
- TT‑NN – 高层 Python 库,基于 TT‑Metalium 实现常见的神经网络操作(矩阵乘、卷积、注意力等),让完整模型的运行更为便捷。
仓库随附:
- 示例内核(hello‑world、整数相加、矩阵乘、逐元素运算、DRAM 数据搬移)。
- 多个模型演示(Llama 3.3 70B、Qwen 2.5 7B/72B、Whisper、Mixtral 8x7B),展示在 Tenstorrent 硬件上的推理性能。
- 记录性能优化、内存分配器、张量布局、Flash‑Attention 与多芯片扩展的技术报告。
- 工具包括可视化器、低层调试器(TT‑Exalens)、系统管理 CLI(TT‑SMI)以及分析工具(Tracy、Watcher、Inspector)。
Who is it for?
- 硬件工程师:需要为 Tenstorrent 设备编写自定义内核。
- 机器学习研究员/工程师:希望在 Tenstorrent 加速器上以高吞吐量运行大型语言模型或视觉模型。
- 工具开发者:构建调试、分析或部署流水线的相关工具。
How to get started
- 按照
INSTALLING.md指南安装堆栈(提供预编译的 many‑linux wheel)。 - 运行简单的 “hello‑world” 或 “add integers” 示例,以验证内核执行。
- 在
models/demos/目录下探索模型演示,查看端到端推理(例如在 32 设备的 Galaxy 网格上运行 Llama 3.3 70B)。 - 深入编程指南和技术报告,进行更深入的性能调优。
Why it matters
Tenstorrent 的芯片专为高吞吐量张量运算设计,拥有独特的架构(矩阵引擎、SFPU、基于以太网的 Mesh)。tt‑metal 抽象硬件细节,同时为专家内核开发者保留足够的控制权,使社区能够在这款新兴 AI 加速器上推动 LLM 与视觉模型的性能极限。
以上所有细节均直接取自仓库的 README 与相关文档。