Grok Imagine Video 1.5 リリースノート

xAIは、動き、物理演算、およびオーディオ同期を改善した新しいimage-to-videoモデルであるGrok Imagine Video 1.5をリリースしました。このモデルは現在、xAI APIを通じて一般提供されており、grok.com、およびiOSとAndroidアプリケーションからアクセス可能です。

統合されたオーディオおよび音声生成

  • Synchronized Sound: Grok Imagine Video 1.5は、効果音、環境音、および対話を一度のパスで生成し、オーディオがアクションに正確に一致するようにします。
  • Speech Quality: このモデルは、よりクリアな音声と、オーディオと視覚要素間の改善された同期を提供します。

動きと物理演算の改善

  • Temporal Consistency: 動きはクリップの全編にわたって一貫性を保ち、視覚的な歪みを減少させます。
  • Physical Realism: このモデルは、生成されたビデオにおいて、より信憑性のある重みと勢いを表現します。

生成速度とパフォーマンス

  • Video 1.5 Fast: このバージョンは、以前のモデルと比較して生成速度をほぼ2倍に向上させています。
  • Performance Metrics: Grok Imagine Video 1.5 Fastは、6秒間の720pビデオを約25秒で生成でき、以前のイテレーションの40秒以上から時間を短縮しました。

クリエイティブ・ワークフローと生産性向上機能

xAIは、生産性を高めるためにGrok Imagineのインターフェースにいくつかの新しい機能を追加しています。

  • Projects: ユーザーは、左サイドバーにあるProjects内に作業を整理できるようになりました。
  • Multiple Agents: システムは並列処理をサポートしており、ユーザーは一つの生成が完了するのを待たずに、複数のプロンプトを同時に実行できます。
  • Search: ライブラリ検索機能が追加され、ユーザーが履歴をスクロールすることなく、特定の画像やビデオを簡単に見つけられるようになりました。

APIの利用可能性と技術仕様

Imagine Video 1.5は、現在xAI APIにおいてモデル識別子 grok-imagine-video-1.5 として一般提供されています。APIを使用すると、ユーザーは開始画像と動きの説明を提供し、希望する解像度と期間を選択できます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch