JavisVerse/JavisDiT

[ICLR 2026] Official implementation of JavisDiT and JavisDiT++ series.

何を解決するか

JavisDiT++ は、テキストプロンプトに基づいて、音声と映像が意味的・時間的に整合している動画を生成するという課題、すなわち Joint Audio-Video Generation (JAVG) の難しさを解決することを目的としています。

動作方法

このプロジェクトは、Diffusion Transformer (DiT) アーキテクチャを使用して、音声付き動画を生成します。以下の主要な技術的革新を採用しています:

  • Joint Self-Attention:生成過程において、音声と映像のモダリティ間で密な相互作用を可能にします。
  • Modality-Specific MoE (MS-MoE):各モダリティ内の表現を精緻化し、品質を向上させます。
  • Temporally Aligned Rotary Position Encoding (TA-RoPE):音声トークンと映像トークン間の細かい同期を保証します。
  • AV-DPO:人間の好みに合わせて出力を調整するための Direct Preference Optimization 技術です。品質と同期性の向上に寄与します。

対象ユーザー

マルチモーダルAIに取り組む研究者や開発者、特にテキストから音声付き動画を生成し、異なる感覚モダリティの同期を実現したい方々に適しています。

特徴

  • 統合モデル化:音声と映像の生成を1つの最適化されたフレームワークに統合しています。
  • 多段階トレーニング:音声事前学習から音声付き動画のSFT、最終的なDPOによる好みの調整までをサポートするパイプラインです。
  • 好みデータセット:人間の好みに合わせた改善を目的とした AV-DPO データセットを含んでいます。
  • 評価スイート:音声付き動画の整合性と品質を包括的に評価するための JavisBench を提供しています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト