Gemini Omni Flash リリース

Gemini Omni Flash リリース

Google DeepMindは、ネイティブにマルチモーダルなモデルであるGemini Omni Flashを発表しました。このモデルは、高品質なビデオの作成と会話ベースの編集を可能にします。Geminiの推論能力と創造的生成を統合することで、実際の知識と物理法則に基づいたビデオコンテンツをユーザーが作成できるようになります。

Conversational Video Editing

Gemini Omni Flashは、前のターンに基づく自然言語の指示を使ってビデオを編集できるようにします。このモデルは、複数の編集を通じてキャラクター、物理法則、シーンの連続性を維持します。

  • 環境変換: ユーザーはビデオ内の特定の要素または全体の世界を変更できます(例:彫刻をバブルに変換する)。
  • アクションの再構築: このモデルは既存のアクションを変更し、新しいキャラクターやオブジェクトを追加し、記録されたビデオ内の特定の瞬間を変換することができます。
  • 反復的改良: ユーザーはマルチターンの会話を通じて環境、カメラアングル、スタイル、または特定の詳細を調整でき、元のシーンのコンテキストを失うことなく行えます。

Knowledge-Grounded Video Generation

Gemini Omni Flashは、Geminiの歴史、科学、文化的背景に関する内部知識を活用し、単純なパターンマッチングを超えて意味のあるストーリーテリングへと進化させます。

  • 物理の改善: このモデルは、運動エネルギー、重力、流体力学の直感的な理解を示し、連鎖反応レール上のビー玉の転がりのようなより現実的な動きを作り出します。
  • 複雑なビジュアル説明: Omniは短いプロンプトから教育コンテンツを生成でき、たんぱく質の折りたたみを説明するクレイアニメーション風のストップモーションビデオなどが挙げられます。
  • コンテキストに基づく創造性: このモデルは言語とイメージを組み合わせて複雑な指示に従うことができ、特定の視覚マーカーと伴奏音楽を伴うアルファベットを表す26アイテムの高速シーケンスを作成するなどが挙げられます。

Multimodal Input Integration

Gemini Omni Flashは、以下の入力の任意の組み合わせから単一の統合されたビデオ出力を合成できます。

  • テキスト: シーンとスタイルの自然言語による説明。
  • 画像: 特定のビジョンに視覚的に合わせるためのキャラクター、シーン、または絵の参照画像。
  • ビデオ: 開始点またはスタイル参照として使用される既存のビデオクリップ。
  • オーディオ: ローンチ時に音声参照がサポートされ、その他のオーディオ入力タイプは今後のリリースで計画されています。

Digital Avatars and Safety

パーソナライズされたコンテンツ作成を可能にするため、ユーザーはアバター機能を利用して自分の声を使って自分自身のように見え聞こえるビデオを生成できます。

責任あるAI開発を確保するため、Googleは以下のセーフガードを実装しています。

  • SynthIDウォーターマーク: Gemini Omniによって生成されるすべてのビデオには、AI起源を確認するための知覚できないデジタルウォーターマークが含まれます。
  • 検証ツール: ユーザーはGeminiアプリ、Google Search、およびChromeのGeminiを通じてAI生成コンテンツを検証できます。
  • 制御されたオーディオ編集: ビデオ内のオーディオと音声を編集する機能は、責任ある展開を確保するために現在さらなるテストが行われています。

Availability

Gemini Omni Flashは以下のプラットフォームに順次提供されています。

  • サブスクライバー: Google AI Plus、Pro、およびUltraのグローバルなサブスクライバーは、GeminiアプリとGoogle Flowを通じて利用可能です。
  • YouTubeユーザー: 2026年5月17日の週から、YouTube ShortsおよびYouTube Createアプリのユーザーに無料で提供開始されます。
  • 開発者: 開発者およびエンタープライズ顧客向けのAPIアクセスは、今後数週間以内に提供される予定です。

Sources