Gemini Omni 1.1 Flash 發佈說明 / 有什麼新功能

Gemini Omni 1.1 Flash 引入專業級影片可控性

Google 已發佈 Gemini Omni 1.1 Flash,這是一套生成式影片功能,旨在將 AI 影片製作從簡單的生成轉向專業級的控制。此次更新專注於提高影片編輯的精確度、透過低解析度草稿降低迭代成本,以及透過高解析度放大技術提升最終輸出品質。

增強的時間控制與場景延伸

Gemini Omni 1.1 Flash 透過允許開發者延伸現有影片場景,實現了更長的故事敘述。該模型現在可以分析多達 10 秒的前文內容——這比以往僅參考最後一秒的版本有了顯著提升——以維持視覺一致性與敘事流暢度。

  • 延伸限制: 影片可以以 10 秒為增量進行延伸。
  • 累計長度: 生成序列的總累計長度可達 40 秒。

透過關鍵影格插值實現精確的動作控制

為了消除跳接並實現複雜的攝影機運鏡,Omni 1.1 允許使用者指定鏡頭的第一幀與最後一幀。模型會生成在兩個關鍵影格之間進行插值的連續影片,從而實現:

  • 複雜的攝影機軌道運鏡: 繞著主體進行平滑轉換。
  • 縮放轉換: 無縫地進入或退出場景。
  • 循環片段: 創建完美無縫的循環影片。

生產效率:360p 草稿與 4K 放大

Omni 1.1 引入了分層解析度策略以優化開發週期,將原型設計階段與最終渲染分離。

360p 快速原型設計

開發者可以生成 360p 解析度的輕量級預覽。這些草稿的生成速度比標準 720p 解析度快達 60%,且成本僅為 720p 的三分之一,非常適合用於分鏡腳本迭代與快速渲染。

4K 專業輸出

對於最終製作,該模型支援 1080p 與 4K 的高解析度輸出,提供專業媒體部署所需的細節與清晰度。

多模態影片參考

Omni 1.1 支援包含影片參考的多模態輸入。使用者可以上傳多達 3 秒的參考影片以維持角色一致性與視覺情境。例如,開發者可以提供一個角色圖像與一段特定舞蹈的參考影片,模型就會將該角色的外貌應用於參考影片中所捕捉的動作。

社群觀點與技術評論

雖然技術能力非常顯著,但開發者社群針對這些工具的實際應用與限制提出了幾點看法:

可控性 vs. 原始品質

從業者之間日益達成共識,認為原始生成品質已不再是主要的差異化因素。正如一位使用者所指出,「原始生成品質正成為基本門檻;可控性可能才是更重要的戰場。」

草稿生成的非確定性

部分使用者對 360p 草稿功能可能會因生成式 AI 的非確定性本質而受到削弱表示擔憂。如果一個提示詞在 720p 或 4K 下產生的結果與 360p 不同,那麼草稿流程的效率就會降低。

缺失的功能需求

某些專業需求仍未得到解決。具體而言,將生成的影片與現有音訊同步(例如對錄製的對話進行對口型同步)是目前 Omni 1.1 系列中缺失的一項高度需求功能。

倫理與產業影響

使用者之間的討論強調了螢幕演員與配音演員可能面臨的失業風險,以及在包含人類主體的影片中持續存在的普遍「恐怖谷」效應。

Sources

相關