Imagine Video 1.5 with References リリースノート

xAIは、Imagine Video 1.5のアップデートを導入し、テキストからビデオへの生成機能、ネイティブ1080p解像度、および生成されたビデオ全体で一貫性を維持するための画像および音声リファレンス機能を追加しました。

Text-to-Video とネイティブ1080pのサポート

Imagine Video 1.5は、現在、text-to-videoとimage-to-videoの両方のワークフローにおいて、ネイティブ1080p生成をサポートしています。text-to-video機能により、ユーザーはテキストプロンプトのみからビデオコンテンツを生成できるようになり、開始画像の必要性がなくなりました。これは、xAIの画像生成とimage-to-video技術を組み合わせることで実現されています。

これらの機能は、grok.com/imagine、iOS、およびAndroidプラットフォームで一般的に利用可能です。

音声とキャラクターの一貫性

Imagine Video 1.5は、異なるシーン間での一貫性を確保するために、画像および音声リファレンスを使用することを可能にします。キャラクターの画像と音声リファレンスを提供することで、モデルはビデオ生成プロセス全体を通じて、キャラクターの同じ顔の特徴と声を維持します。

マルチリファレンス制御

モデルは現在、1回の生成につき最大7つのリファレンスをサポートしています。これにより、ユーザーは、顔、製品、または場所などの特定の要素を固定しながら、他のパラメータを変更することができます。ユーザーは以下のことが可能です:

  • キャラクターを維持し、シーンを変更する。
  • シーンを維持し、キャラクターを変更する。
    • キャラクターとシーンの両方を維持し、アクションのみを変更する。

APIの利用可能性と統合

画像リファレンス、text-to-video、およびネイティブ1080pは、現在、xAI APIのgrok-imagine-video-1.5モデルを通じて提供されています。音声リファレンスのサポートは、xAI salesへのリクエストを通じて利用可能です。

API実装例

開発者は、以下のPython SDK構造を使用してビデオ生成を実装できます:

import os
import xai_sdk

client = xai_sdk.Client(api_key=os.getenv("XAI_API_KEY"))

response = client.video.generate(
    prompt="Slow cinematic push-in as embers drift across the battlefield and the helmet's crest stirs in the wind",
    model="grok-imagine-video-1.5",
    reference_image_urls=["https://example.com/helmet.jpg"],
    duration=6,
    aspect_ratio="16:9",
    resolution="720p",
)

print(response.url)

利用可能時期

画像および音声リファレンスは、2026年7月31日より、米国のSuperGrok HeavyおよびSuperGrok Plusユーザー向けにgrok.com/imagineおよびiOSで利用可能となり、その後数日間で全ティアへ展開されます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch