tenstorrent/tt-metal

:metal: TT-NN operator library, and TT-Metalium low level kernel programming model.

What is tt‑metal?

tt‑metal(亦稱 TT‑Metalium)是一套開源軟體堆疊,讓開發者能在 Tenstorrent 的自訂 AI 加速器(WormholeBlackhole 晶片)上編寫與執行神經網路核心。它提供兩層結構:

  • TT‑Metalium – 低階 C++/Python 程式模型,用於建構直接在硬體上執行的核心。內含程式設計指南、記憶體布局、資料格式、矩陣引擎等技術報告,以及除錯與效能分析工具。
  • TT‑NN – 高階 Python 函式庫,於 TT‑Metalium 之上實作常見的神經網路運算(矩陣乘、卷積、注意力等),讓完整模型的執行更為簡易。

此倉庫隨附:

  • 範例核心(hello‑world、整數相加、矩陣乘、逐元素運算、DRAM 資料搬移)。
  • 多個模型示例(Llama 3.3 70B、Qwen 2.5 7B/72B、Whisper、Mixtral 8x7B),展示在 Tenstorrent 硬體上的推論效能。
  • 記錄效能最佳化、記憶體配置、張量布局、Flash‑Attention 以及多晶片擴展的技術報告。
  • 工具包括視覺化器、低階除錯器(TT‑Exalens)、系統管理 CLI(TT‑SMI)與效能分析工具(Tracy、Watcher、Inspector)。

Who is it for?

  • 硬體工程師:需要為 Tenstorrent 裝置撰寫自訂核心。
  • 機器學習研究員/工程師:希望在 Tenstorrent 加速器上以高吞吐量執行大型語言模型或視覺模型。
  • 工具開發者:打造除錯、效能分析或部署管線的相關工具。

How to get started

  1. 依照 INSTALLING.md 指南安裝堆疊(提供預建的 many‑linux 輪子檔)。
  2. 執行簡單的 “hello‑world” 或 “add integers” 範例,以驗證核心執行。
  3. models/demos/ 目錄下探索模型示例,觀察端到端推論(例如在 32 裝置的 Galaxy 網格上執行 Llama 3.3 70B)。
  4. 深入程式設計指南與技術報告,進行更進階的效能調校。

Why it matters

Tenstorrent 的晶片針對高吞吐量張量運算而設計,具備獨特的架構(矩陣引擎、SFPU、以太網 Mesh)。tt‑metal 抽象化硬體細節,同時保留足夠的控制權給專業核心開發者,讓社群能在這個新興 AI 加速器上推動 LLM 與視覺模型的效能極限。


以上所有細節皆直接取自該倉庫的 README 與相關文件。