antirez/h3.c
MiniMax H3 inference engine for Mac computers
What it solves
Apple Silicon上のMiniMax-H3モデル向けにネイティブMetalベースの推論エンジンを提供し、macOSデバイス上でテキストプロンプト、画像、またはその他のメディアリファレンスから、動画や音声を高性能に生成することを可能にします。
How it works
本プロジェクトは、GPU加速のためにAppleのMetalフレームワークを使用してMiniMax-H3アーキテクチャを実装しています。速度と品質のバランスを取るために、以下のような様々な最適化技術をサポートしています:
- Denoising Control: 計算時間を短縮するために、調整可能なデノイジング・パスと速度外挿(reuse)をサポート。
- Layer Thinning: Transformerブロックのサブセットを実行することで、メモリと計算要件を低減。
- SSD Streaming: 低メモリデバイスをサポートするため、SSDからGPUメモリへモデルブロックをオンデマンドでロード。
- Reference Conditioning: 画像から動画、または動画から動画へのタスクのために、最初/最後のフレームアンカー(FL2VA)および順序付きメディアリファレンス(Ref2VA)をサポート。
- Memory Optimizations: メモリディスパッチとグローバルな再読み込みを最小限に抑えるため、融合ゲート(fused gates)とAdaLN操作をサポート。
Who it’s for
高品質な動画および音声合成のために、MiniMax-H3生成モデルをローカルで実行したいApple Silicon(Mシリーズチップ)ユーザーの開発者およびクリエイター。
Highlights
- Native Apple Silicon Support: M3 MaxおよびM5 Maxチップに特化して最適化。
- Flexible Generation: プロンプトから動画/音声、画像から動画、および音声の保持または置換を伴う動画から動画への生成をサポート。
- H3-Specific Optimizations: トークン削減、内部キャンバスのスケーリング、および低解像度プレビュー用の特殊なRoPE適応を含む。
- Interactive Session: モデルコンポーネントをメモリに保持し、より高速な反復プロンプト生成を可能にするIris-styleのインタラクティブCLI。
- Low-Memory Mode: SSDストリーミングにより、メモリ容量の限られたデバイスでもモデルの実行が可能。
関連
- Dispatch
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト