NVlabs/Sana

SANA: Efficient High-Resolution Image Synthesis with Linear Diffusion Transformer

解決する課題

SANAは、高解像度な画像および動画生成のための効率重視のフレームワークを提供します。4K画像や長尺動画の生成に通常伴う高い計算コストとメモリ要件に対処し、コンシューマーグレードのハードウェア(8GB未満のVRAMを搭載したノートPCのGPUを含む)でもこれらの機能を利用可能にします。

仕組み

SANAは、ハードウェアへの負荷を軽減するためにいくつかの主要なアーキテクチャの最適化を採用しています:

  • Linear Attention: Diffusion Transformers (DiT) における標準的なAttentionを置き換え、高解像度でも効率を維持します。
  • DC-AE: 32xの画像圧縮(標準の8xと比較)を使用して、潜在トークンの数を大幅に削減します。
  • Decoder-only Text Encoder: 最新のLLMを利用して、より優れたテキストと画像の整合性とインコンテキスト学習を実現します。
  • Specialized Video Modules: 長尺動画生成には Block Causal Linear Attention と Causal Mix-FFN を、1ステップ生成(SANA-Sprint)には sCM distillation を使用します。
  • Quantization: VRAM使用量を抑えるために、4-bit および 8-bit 量子化をサポートしています。

対象ユーザー

SANAは、高解像度な生成AIアプリケーションを構築する研究者や開発者、および限られたハードウェアで高品質な画像・動画生成を実行したいユーザー向けに設計されています。

ハイライト

  • 高解像度: 最大4K解像度までのテキストから画像への生成をサポート。
  • 極めて高速: SANA-Sprintは、H100上でわずか0.1秒で1024pxの画像を生成できます。
  • 多才なモダリティ: 画像生成、動画生成 (SANA-Video)、ワールドモデリング (SANA-WM)、リアルタイムストリーミング動画編集 (SANA-Streaming) のための専用モデルが含まれています。
  • ハードウェアへのアクセシビリティ: 4-bit 量子化により、8GB未満のVRAMを持つGPUでも動作可能です。
  • RLの統合: ポストトレーニング中の強化学習の収束を早めるための Sol-RL を含んでいます。