Gemini Omni: Google DeepMind 邁向多模態影片創作的飛躍

生成式 AI 的領域正從靜態圖像生成轉向動態、可控的影片合成。Google DeepMind 的最新發布,Gemini Omni,代表了彌合推理與創作之間差距的一次重大嘗試。與以往主要專注於文字轉影片生成的模型不同,Gemini Omni 被定位為一個多模態創意引擎,允許用戶「從任何事物中創造任何事物」,並非常強調迭代式的對話式影片編輯。

其核心在於,Gemini Omni 的設計並非將影片視為一次性的輸出,而是一個活生生的專案。透過將 Gemini 的推理能力與先進的生成式影片工具相結合,它實現了一種工作流,讓用戶可以逐步細化其願景,在改變環境、動作或美學等特定元素的同時,保持場景的一致性。

Gemini Omni 的核心能力

Gemini Omni 在 AI 如何與影片數據和用戶意圖互動方面引入了幾項突破:

對話式迭代編輯

與其依賴單個複雜的提示詞來獲得完美結果,Gemini Omni 允許進行自然的、多輪對話。用戶可以建立一個場景,然後進行微調——例如,透過改變攝影機角度或讓某個物體變得不可見——而不會失去整體鏡頭的連貫性。這種「影片版的 Nano Banana」方法將 AI 從生成器轉變為協作編輯器。

多模態參考

Omni 最強大的功能之一是其將多種輸入類型合成到單一輸出的能力。用戶可以提供:

  • Images: 使用素描或照片作為結構或風格指南。
  • Video: 將動作或視角從一段剪輯轉移到新的角色或環境。
  • Audio: 將視覺變化與音軌的節奏同步,或添加由特定螢幕上動作觸發的音效。
  • Text: 指導複雜的敘事轉變或添加同步的螢幕文字。

世界知識與物理學整合

DeepMind 聲稱 Gemini Omni 利用了對物理學(重力、流體動力學和動能)的直覺理解以及現實世界的知識(歷史、科學和數學)來創建更可信的場景。這在從蛋白質摺疊的黏土動畫解說到複雜的大理石滾動模擬等範例中得到了展示。

技術評論與現實世界的限制

雖然宣傳材料呈現了無縫的體驗,但 Hacker News 上的技術社群對該模型的目前狀態提出了幾項關鍵點。

「物理學」差距

儘管聲稱遵循現實世界的物理學,但一些用戶注意到演示中的明顯失敗。一位觀察者指出,在滾動的大理石影片中,大理石偶爾會「無緣無故地跳起」或在沒有能量來源的情況下加速。另一位專門從事剛體模擬的開發者指出,該模型在處理不連續物理學時仍面臨困難,例如 Jenga 積木塔倒塌時,積木可能會在倒塌過程中發生形變或消失。

空間理解

批評者認為該模型缺乏深層的空間理解。一位用戶指出,當一個物體移動到視線之外然後返回時,幾何形狀往往會發生變化,這表明該模型優先考慮的是「漂亮」的像素,而非對 3D 空間的結構性理解。這導致了一些建議,即訓練方法可能過於廣泛,缺乏人類藝術家所採用的層級化學習(組成 $\rightarrow$ 視角 $\rightarrow$ 光影)。

性能與可訪問性

早期採用者報告了在推出時遇到的顯著摩擦,包括使用限制導致一些人甚至無法嘗試該模型,以及因登錄頁面大量使用自動播放影片而導致的瀏覽器崩潰。此外,一些用戶將 Gemini Omni Flash 與競爭對手如 Seedance 2.0 進行了不利的比較,就原始輸出品質而言是如此。

更廣泛的影響:倫理與產業

像 Gemini Omni 這類的工具的到來,引發了關於數位真實性與創意藝術未來更廣泛的辯論。

"So it's really good, and we have reason to believe, never again, anything that happens in a video. Unless there's a super-product somewhere to authenticate footage?"

為了應對這一點,Google 已將 SynthID 數位浮水印與 C2PA Content Credentials 整合到 Omni 的輸出中,以確保 AI 生成的內容可以被驗證。然而,對於好萊塢的顛覆與視覺藝術價值的貶低,這種存在主義式的恐懼仍然是觀察者們之間反覆出現的主題。

結論

Gemini Omni 是邁向未來的一個大膽步履,在那個未來,想像力與高保真影片之間的障礙幾乎不存在。雖然它在多模態合成與對話式控制方面表現出色,,但它仍然面臨生成式 AI 的經典障礙:維持嚴格的物理定律與真實的空間一致性。隨著它從實驗室突破轉向 Google Flow 與 YouTube Shorts 的創作者工具,焦點很可能會從「它能否生成影片」轉向「它能否維持世界的結構完整性」。

Sources