Gemini Omni 1.1 Flash リリースノート / 新機能

Google DeepMind は、生成ビデオ制作をプロフェッショナルな用途で利用可能なものにするために設計された、生成ビデオ機能とクリエイティブ・コントロールのスイートである Gemini Omni 1.1 Flash を発表しました。Google AI Studio の Gemini API を通じて利用可能で、このアップデートは、メディア編集ソフトウェアやクリエイティブ・ツールを構築する開発者のために、制御性、反復速度、および出力品質の向上に焦点を当てています。

ナラティブの一貫性を高めるための強化されたシーン拡張

Gemini Omni 1.1 Flash を使用すると、ユーザーは既存のビデオ映像をシームレスに拡張できます。このモデルは、以前のモデルでは最後の 1 秒間のみを参照していたのに対し、最大 10 秒間の先行コンテキストを分析できるようになり、視覚的な一貫性とナラティブへの準拠を大幅に向上させます。

ビデオは 10 秒刻みで拡張でき、合計累積長は最大 40 秒に達します。

フレーム補間による精密なモーション・コントロール

Omni 1.1 は、ショットの開始フレームと終了フレームの両方を指定することを可能にします。モデルはこれら 2 つのキーフレーム間の連続的なビデオを生成し、これにより、複雑なカメラ・オービット、ズーム・トランジション、およびジャンプカットのないシームレスなループ・クリップの作成が容易になります。

360p ドラフトによる最適化されたプロトタイピング

反復プロセスを加速させるために、Omni 1.1 は 360p 解像度での軽量なプレビュー生成をサポートしています。これらのドラフトは、標準の 720p 解像度よりも最大 60% 高速に生成され、コストは 3 分の 1 に抑えられています。これにより、迅速なプロトタイピングやストーリーボードの反復に適しています。

プロフェッショナルな解像度とアップスケーリング

Omni 1.1 は、プロフェッショナルな制作に向けた高解像度出力をサポートしており、ビデオを 1080p または 4K 解像度にアップスケールする機能があります。

マルチモーダル・ビデオ・リファレンス

開発者は、マルチモーダル入力の一部として最大 3 秒間のビデオを含めることができます。これにより、モデルは、新しいコンテンツを生成する際に、アップロードされたビデオファイルから特定の動きやシーンを参照することで、キャラクターの一貫性と視覚的なコンテキストを維持できます。

利用可能性と統合

Gemini Omni 1.1 Flash は、以下の Google プラットフォームを通じて利用可能です:

  • Google AI Studio: ビルドとテストのための直接アクセス。
  • Gemini Enterprise Agent Platform: エンタープライズ開発者のためのデプロイメント・オプション。
  • Google Flow: Google AI Plus, Pro, および Ultra サブスクライバー向けに提供。
  • Gemini App: シーン拡張機能は、世界中の Google AI Plus, Pro, および Ultra サブスクライバー向けに利用可能です。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch