tenstorrent/tt-metal
:metal: TT-NN operator library, and TT-Metalium low level kernel programming model.
What is tt‑metal?
tt‑metal(亦稱 TT‑Metalium)是一套開源軟體堆疊,讓開發者能在 Tenstorrent 的自訂 AI 加速器(Wormhole 與 Blackhole 晶片)上編寫與執行神經網路核心。它提供兩層結構:
- TT‑Metalium – 低階 C++/Python 程式模型,用於建構直接在硬體上執行的核心。內含程式設計指南、記憶體布局、資料格式、矩陣引擎等技術報告,以及除錯與效能分析工具。
- TT‑NN – 高階 Python 函式庫,於 TT‑Metalium 之上實作常見的神經網路運算(矩陣乘、卷積、注意力等),讓完整模型的執行更為簡易。
此倉庫隨附:
- 範例核心(hello‑world、整數相加、矩陣乘、逐元素運算、DRAM 資料搬移)。
- 多個模型示例(Llama 3.3 70B、Qwen 2.5 7B/72B、Whisper、Mixtral 8x7B),展示在 Tenstorrent 硬體上的推論效能。
- 記錄效能最佳化、記憶體配置、張量布局、Flash‑Attention 以及多晶片擴展的技術報告。
- 工具包括視覺化器、低階除錯器(TT‑Exalens)、系統管理 CLI(TT‑SMI)與效能分析工具(Tracy、Watcher、Inspector)。
Who is it for?
- 硬體工程師:需要為 Tenstorrent 裝置撰寫自訂核心。
- 機器學習研究員/工程師:希望在 Tenstorrent 加速器上以高吞吐量執行大型語言模型或視覺模型。
- 工具開發者:打造除錯、效能分析或部署管線的相關工具。
How to get started
- 依照
INSTALLING.md指南安裝堆疊(提供預建的 many‑linux 輪子檔)。 - 執行簡單的 “hello‑world” 或 “add integers” 範例,以驗證核心執行。
- 在
models/demos/目錄下探索模型示例,觀察端到端推論(例如在 32 裝置的 Galaxy 網格上執行 Llama 3.3 70B)。 - 深入程式設計指南與技術報告,進行更進階的效能調校。
Why it matters
Tenstorrent 的晶片針對高吞吐量張量運算而設計,具備獨特的架構(矩陣引擎、SFPU、以太網 Mesh)。tt‑metal 抽象化硬體細節,同時保留足夠的控制權給專業核心開發者,讓社群能在這個新興 AI 加速器上推動 LLM 與視覺模型的效能極限。
以上所有細節皆直接取自該倉庫的 README 與相關文件。