AMAP-ML/DreamX-Creator

Democratizing Native Audio-Video Generation at 2K Resolution

解决的问题

DreamX-Creator 解决了同时生成高分辨率视频和同步音频的挑战。它解决了视觉与听觉流之间的错位问题,以及联合生成框架中缺乏原生 2K 分辨率的问题。

工作原理

该系统使用一个基础生成器,联合建模专用的视频和音频流。它采用门控跨模态注意力(Gated Cross-Modal Attention)和渐进式联合训练,实现音频与视频之间的双向交互。为提升质量,系统整合了音频-视频强化学习与模态感知多模态反馈,以增强语义一致性和同步性。最后,一个自回归 1 步 2K 修复器在保持原始内容和时间的基础上,将输出提升至 2K 分辨率。

适用人群

该框架专为从事原生多模态生成的研究人员和开发者设计,尤其适用于需要在高分辨率下生成同步音视频内容的用户。

主要亮点

  • 原生联合生成:同时建模音频和视频流,而非顺序生成。
  • 双向交互:使用门控跨模态注意力确保音视频同步。
  • 高分辨率:包含专用的 1 步修复器,将视频上采样至 2K 分辨率。
  • 强化学习增强:利用强化学习和多模态反馈优化视觉与音频质量。

相关

  • 项目
  • 项目
  • 项目
  • 项目