tenstorrent/tt-metal

:metal: TT-NN operator library, and TT-Metalium low level kernel programming model.

What is tt‑metal?

tt‑metal(또는 TT‑Metalium)은 Tenstorrent의 맞춤형 AI 가속기(WormholeBlackhole 칩)에서 신경망 커널을 작성·실행할 수 있게 해주는 오픈소스 소프트웨어 스택입니다. 두 가지 레이어를 제공합니다.

  • TT‑Metalium – 하드웨어에서 직접 실행되는 커널을 구축하기 위한 저수준 C++/Python 프로그래밍 모델. 프로그래밍 가이드, 메모리 레이아웃·데이터 포맷·매트릭스 엔진에 관한 기술 보고서, 디버깅·프로파일링 도구가 포함됩니다.
  • TT‑NN – TT‑Metalium 위에 구현된 고수준 Python 라이브러리로, 일반적인 신경망 연산(행렬 곱, 컨볼루션, 어텐션 등)을 제공해 전체 모델 실행을 쉽게 합니다.

레포지토리에는 다음이 포함됩니다.

  • 예제 커널(hello‑world, 정수 더하기, 행렬 곱, 원소별 연산, DRAM 이동).
  • 모델 데모 컬렉션(Llama 3.3 70B, Qwen 2.5 7B/72B, Whisper, Mixtral 8x7B)으로 Tenstorrent 하드웨어에서의 추론 성능을 보여줍니다.
  • 성능 최적화, 메모리 할당자, 텐서 레이아웃, 플래시 어텐션, 멀티칩 스케일링을 문서화한 기술 보고서.
  • 비주얼라이저, 저수준 디버거(TT‑Exalens), 시스템 관리 CLI(TT‑SMI), 프로파일링 유틸리티(Tracy, Watcher, Inspector) 등 도구.

Who is it for?

  • 하드웨어 엔지니어: Tenstorrent 디바이스용 맞춤 커널을 작성해야 하는 사람.
  • ML 연구원/엔지니어: Tenstorrent 가속기에서 대규모 언어 모델이나 비전 모델을 고처리량으로 실행하고 싶은 사람.
  • 툴 개발자: 이 하드웨어용 디버깅, 프로파일링, 배포 파이프라인을 구축하는 사람.

How to get started

  1. INSTALLING.md 가이드를 따라 스택을 설치합니다(사전 빌드된 many‑linux 휠 제공).
  2. 간단한 “hello‑world” 또는 “add integers” 예제를 실행해 커널 실행을 확인합니다.
  3. models/demos/ 아래의 모델 데모를 살펴보고 엔드‑투‑엔드 추론을 확인합니다(예: 32 디바이스 Galaxy 메쉬에서 Llama 3.3 70B 실행).
  4. 프로그래밍 가이드와 기술 보고서를 깊이 있게 읽어 성능 튜닝을 진행합니다.

Why it matters

Tenstorrent 칩은 고처리량 텐서 연산을 위해 설계되었으며, 고유한 아키텍처(매트릭스 엔진, SFPU, 이더넷 기반 메쉬)를 갖추고 있습니다. tt‑metal은 하드웨어 세부 사항을 추상화하면서도 전문가 커널 개발자에게 충분한 제어 권한을 제공해, 커뮤니티가 이 신흥 AI 가속기에서 LLM 및 비전 모델 성능의 한계를 뛰어넘을 수 있게 합니다.


위 모든 내용은 레포지토리의 README와 링크된 문서에서 직접 가져온 것입니다.