JavisVerse/JavisDiT
[ICLR 2026] Official implementation of JavisDiT and JavisDiT++ series.
何を解決するか
JavisDiT++ は、テキストプロンプトに基づいて、音声と映像が意味的・時間的に整合している動画を生成するという課題、すなわち Joint Audio-Video Generation (JAVG) の難しさを解決することを目的としています。
動作方法
このプロジェクトは、Diffusion Transformer (DiT) アーキテクチャを使用して、音声付き動画を生成します。以下の主要な技術的革新を採用しています:
- Joint Self-Attention:生成過程において、音声と映像のモダリティ間で密な相互作用を可能にします。
- Modality-Specific MoE (MS-MoE):各モダリティ内の表現を精緻化し、品質を向上させます。
- Temporally Aligned Rotary Position Encoding (TA-RoPE):音声トークンと映像トークン間の細かい同期を保証します。
- AV-DPO:人間の好みに合わせて出力を調整するための Direct Preference Optimization 技術です。品質と同期性の向上に寄与します。
対象ユーザー
マルチモーダルAIに取り組む研究者や開発者、特にテキストから音声付き動画を生成し、異なる感覚モダリティの同期を実現したい方々に適しています。
特徴
- 統合モデル化:音声と映像の生成を1つの最適化されたフレームワークに統合しています。
- 多段階トレーニング:音声事前学習から音声付き動画のSFT、最終的なDPOによる好みの調整までをサポートするパイプラインです。
- 好みデータセット:人間の好みに合わせた改善を目的とした AV-DPO データセットを含んでいます。
- 評価スイート:音声付き動画の整合性と品質を包括的に評価するための JavisBench を提供しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト