Gemini Omni Flash 發布
Gemini Omni Flash 發布
Google DeepMind 已宣布 Gemini Omni Flash,這是一種原生多模態模型,能夠實現高品質影片的創建與對話式編輯。該模型將 Gemini 的推理能力與創意生成結合,能讓使用者製作基於真實世界知識與物理定律的影片內容。
會話式影片編輯
Gemini Omni Flash 允許使用者使用建構於先前回合的自然語言指令來編輯影片。該模型在多次編輯中保持角色、物理與場景連續性的一致性。
- 環境轉換: 使用者可以在影片中改變特定元素或整個世界(例如,將雕塑轉變為氣泡)。
- 動作重新想像: 該模型可以修改現有動作、添加新角色或物件,或轉變錄製影片中的特定時刻。
- 迭代優化: 使用者可以透過多輪對話調整環境、相機角度、風格或特定細節,而不會失去原始場景的上下文。
知識基礎影片生成
Gemini Omni Flash 利用 Gemini 內部的歷史、科學與文化知識,超越簡單的模式匹配,朝著有意義的敘事發展。
- 改進的物理: 該模型展示對動能、重力與流體動力學的直觀理解,以創造更真實的運動,例如彈珠在鏈條反應軌道上滾動。
- 複雜的視覺解說: Omni 可從簡短提示生成教育內容,例如說明蛋白質摺疊的黏土動畫風格停止動作影片。
- 情境創意: 該模型能融合語言與圖像以遵循複雜指令,例如創建代表字母的 26 項目快速序列,具備特定視覺標記和伴隨音樂。
多模態輸入整合
Gemini Omni Flash 能從以下任意輸入的組合合成單個連貫的影片輸出:
- 文字: 場景和風格的自然語言描述。
- 圖像: 角色、場景或繪圖的參考圖像,以確保與特定願景的視覺一致。
- 影片: 用作起點或風格參考的現有影片片段。
- 音訊: 啟動時支援語音參考,其他音訊輸入類型將在未來版本中規劃。
數位頭像與安全
為了啟用個人化內容創作,使用者可以使用 Avatar 功能生成看起來和聽起來像他們自己的影片,使用他們自己的聲音。
為確保負責任的 AI 開發,Google 已實施以下防護措施:
- SynthID 透明水印: Gemini Omni 生成的所有影片都包含一個不可感知的數位水印,以驗證其 AI 來源。
- 驗證工具: 使用者可以透過 Gemini 應用程式、Google 搜尋以及 Chrome 中的 Gemini 驗證 AI 生成的內容。
- 受控音訊編輯: 編輯影片中音訊與語音的功能目前正在進行進一步測試,以確保負責任的部署。
可用性
Gemini Omni Flash 正在以下平台推出:
- 訂閱者: 全球 Google AI Plus、Pro 和 Ultra 訂閱者可透過 Gemini 應用程式和 Google Flow 使用。
- YouTube 使用者: 從 2026 年 5 月 17 日週起,YouTube Shorts 和 YouTube Create App 的使用者將免費獲得推出。
- 開發者: 開發者和企業客戶的 API 存取權將在未來幾週內提供。
Sources
- OriginalIntroducing Gemini Omni