JavisVerse/JavisDiT

[ICLR 2026] Official implementation of JavisDiT and JavisDiT++ series.

解决的问题

JavisDiT++ 旨在解决联合音视频生成(JAVG)的挑战,特别是基于文本提示生成在语义和时间上均与音频对齐的视频的困难。

工作原理

该项目采用扩散 Transformer(DiT)架构生成带音视频。其包含以下关键技术革新:

  • 联合自注意力机制:在生成过程中实现音视频模态之间的密集交互。
  • 模态特定的 MoE(MS-MoE):优化各模态内的表示,提升生成质量。
  • 时间对齐的旋转位置编码(TA-RoPE):确保音视频标记之间的细粒度同步。
  • AV-DPO:一种直接偏好优化技术,用于使生成结果更符合人类偏好,从而提升质量与同步性。

适用人群

适用于从事多模态 AI 研究与开发的人员,特别是专注于文本到音视频生成以及不同感官模态同步的开发者。

核心亮点

  • 统一建模:将音视频生成整合到一个优化的统一框架中。
  • 多阶段训练:支持从音频预训练到音视频 SFT,再到最终通过 DPO 进行偏好对齐的完整流程。
  • 偏好数据集:包含 AV-DPO 偏好数据集,用于提升与人类偏好的对齐度。
  • 评估套件:提供 JavisBench 评估工具,全面评估音视频对齐与生成质量。

相关

  • 项目
  • 项目
  • 项目
  • 项目