tenstorrent/tt-forge
Tenstorrent's MLIR Based Compiler. We aim to enable developers to run AI on all configurations of Tenstorrent hardware, through an open-source, general, and performant compiler.
해결하는 문제
TT-Forge는 Tenstorrent 하드웨어에서 AI 워크로드(추론 및 학습 포함)를 간편하게 실행할 수 있도록 설계된 오픈소스 AI 컴파일러 스택입니다. PyTorch, JAX, ONNX 등의 고수준 ML 프레임워크와 하위 Tenstorrent 하드웨어 사이의 격차를 메우며, 모델이 메모리에 맞는 한 실행이 가능하도록 보장합니다.
작동 방식
TT-Forge는 TT-Metalium 기반의 다층 스택으로 작동합니다. 다양한 프론트엔드를 사용하여 다른 프레임워크에서 모델을 입력합니다:
- TT-XLA: PyTorch 및 JAX의 주요 프론트엔드로, 모델을 StableHLO 그래프로 컴파일합니다.
- TT-Forge-ONNX: ONNX, TensorFlow, PaddlePaddle용 TVM 기반 프론트엔드입니다.
- TT-MLIR: 핵심 MLIR 기반 컴파일러로 그래프 최적화(융합, 샤딩, 레이아웃)를 수행하고 TT-Metalium로 낮춥니다.
- TT-Lang: 개발자가 C++ 대신 Python으로 고성능 커널을 작성할 수 있도록 해주는 Python DSL입니다.
- TT-Blacksmith: 다양한 모델 유형에 대한 최적화된 학습 레시피와 실험을 제공합니다.
대상 사용자
Tenstorrent 하드웨어에서 모델을 배포하거나 학습하고 싶은 AI 연구자 및 개발자, 그리고 고성능 커스텀 연산이 필요한 커널 개발자에게 적합합니다.
주요 특징
- 광범위한 프레임워크 지원: PyTorch, JAX, ONNX, TensorFlow, PaddlePaddle를 지원합니다.
- 풍부한 모델 라이브러리: CI에서 테스트된 800개 이상의 모델 변형을 보유하고 있으며, Llama 3, Stable Diffusion XL, YOLOv12 등을 포함합니다.
- 싱글 및 멀티칩 지원: Llama 3 70B와 같은 대규모 모델을 여러 칩(N300+)에 걸쳐 실행할 수 있습니다.
- Python 기반 커널 개발: TT-Lang을 사용하면 Python으로 융합 연산을 작성하고 내장 시뮬레이션 및 프로파일링 기능을 활용할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트