Hugging Face AI WebTV:構建自動化視訊與音樂合成串流

Hugging Face 已推出 AI WebTV,這是一個展示開源文字轉視訊與音樂合成模型整合以建立自動廣播串流的實驗示範。該項目作為當前生成式 AI 能力的技術示範與展示片,用於製作短片合成視訊序列及其伴隨音訊。

系統架構與管線

AI WebTV 使用一個管線,將高層次的人類想法轉換為連續的視訊與音訊串流。該流程從人類提供的基礎主題與想法開始,然後由大型語言模型(LLM)—具體為 ChatGPT—處理,以生成各種針對特定視訊鏡頭的個別提示詞。

視訊生成鏈條

核心視訊合成由 Zeroscope V2 驅動,該模型基於 ModelScope。生成流程通常遵循兩階段鏈條:

  1. 初始生成zeroscope_v2_576 模型會生成解析度為 576x320 的視訊片段。
  2. 上採樣:使用 zeroscope_v2_XL 的可選第二次通過可將視訊上採樣至 1024x576。此階段必須套用與初始生成相同的提示詞。

後處理與音訊

為了精煉視覺輸出並添加聽覺元素,管線會使用兩項額外工具:

  • 幀插值:FILM(大運動幀插值)演算法用於平滑過渡並修復小型渲染錯誤,尤其在相機平移或旋轉期間。
  • 音訊合成:音樂透過 MusicGen 家族的 musicgen-melody 模型生成。

廣播基礎設施

該系統使用 NodeJS 與 TypeScript 實作。它利用 Hugging Face Spaces 來託管模型,並透過 @gradio/client NPM 套件進行呼叫。最終廣播時,FFmpeg 用於讀取 .mp4 視訊和 .m4a 音訊檔案的播放清單,然後將其作為 FLV 串流發送至 RTMP 伺服器(具體為 node-media-server)。

能力與觀察

AI WebTV 示範凸顯了文字轉視訊模型擬真再現真實生活物理現象與多樣化藝術風格的能力。

動態場景模擬

文字轉視訊模型能合成流體、動物與車輛的運動。專案中的範例包括:

  • 蜜蜂在柔和散景背景的花朵周圍嗡嗡飛舞。* 灰熊在湍急的河流中捕到三文魚,水花濺濺。* 日出時,波浪衝擊岩石海岸。

風格與構圖

該系統展示了視覺風格的多樣性,從寫實電影鏡頭(例如黎明時的宇航員與拉瑪)到 Pixar 或 Studio Ghibli 風格的 3D 渲染動畫。

技術限制與失敗案例

儘管取得成功,該專案仍發現目前文字轉視訊合成中存在幾種反覆出現的失敗模式:

  • 方向錯誤:模型在運動方向上可能會遇到困難,有時會產生看似倒放的片段。* 渲染工件:寫實場景偶爾會出現垂直線或類似波浪的工件。* 提示詞洩漏:模型可能會將提示詞中的詞語實際插入圖像中。例如,提及 "IMAX" 或 "Canon EOS" 可能會導致這些詞語或物體在場景中以實體形式出現。* 屬性忽略:特定修飾詞(例如顏色「綠色」)有時會被模型忽略。

文字轉視訊提示詞的最佳實踐

基於 AI WebTV 實驗,Hugging Face 建議以下策略以提升輸出品質:

  • 使用視訊專用關鍵字:明確說明相機移動、角色方向、速度與方向,以避免隨機或倒放的動畫。* 確保跨場景一致性:在創建視訊序列時,於每個提示詞中包含詳盡細節,以保持顏色等元素在不同拍攝間的一致性。* 利用幀插值:使用如 FILM 的工具來平滑動畫並創建慢動作效果,這可以將渲染缺陷轉化為可接受的風格特徵。

Sources