JavisVerse/JavisDiT

[ICLR 2026] Official implementation of JavisDiT and JavisDiT++ series.

解決的問題

JavisDiT++ 是為了解決聯合音訊-影像生成(JAVG)的挑戰而設計,特別是基於文字提示生成在語意與時間上均與音訊對齊的影片的困難。

工作原理

本專案使用擴散 Transformer(DiT)架構來生成帶音訊的影片。採用了幾項關鍵技術創新:

  • 聯合自注意力:在生成過程中,使音訊與影像模態之間能進行密集互動。
  • 模態特定的 MoE(MS-MoE):精煉各模態內的表示,以提升品質。
  • 時間對齊的旋轉位置編碼(TA-RoPE):確保音訊與影像權杖之間的細粒度同步。
  • AV-DPO:一種直接偏好優化技術,用於使生成輸出更符合人類偏好,以提升品質與同步性。

適用對象

此工具適合從事多模態 AI 的研究人員與開發者,特別是專注於文字轉音訊-影像生成以及不同感官模態同步的開發者。

主要亮點

  • 統一建模:將音訊與影像生成整合至單一優化框架中。
  • 多階段訓練:支援從音訊預訓練、音訊-影像 SFT,到最終透過 DPO 進行偏好對齊的完整流程。
  • 偏好資料集:包含 AV-DPO 偏好資料集,以提升與人類偏好的一致性。
  • 評估套件:提供 JavisBench 以全面評估音訊-影像對齊與品質。

相關

  • 專案
  • 專案
  • 專案
  • 專案