Imagine Video 1.5 with References 发布说明

xAI 为 Imagine Video 1.5 引入了更新,增加了文本生成视频功能、原生 1080p 分辨率,以及使用图像和声音参考来保持生成视频一致性的能力。

文本生成视频与原生 1080p 支持

Imagine Video 1.5 现在支持文本生成视频和图像生成视频工作流的原生 1080p 生成。文本生成视频功能允许用户仅通过文本提示词生成视频内容,从而消除了对起始图像的需求。这是通过将 xAI 的图像生成与图像生成视频技术相结合实现的。

这些功能已在 grok.com/imagine、iOS 和 Android 平台上广泛可用。

声音与角色一致性

Imagine Video 1.5 支持使用图像和声音参考来确保不同场景之间的一致性。通过提供角色图像和声音参考,模型在整个视频生成过程中可以保持角色相同的面部特征和声音。

多重参考控制

该模型现在每次生成最多支持七个参考。这允许用户在改变其他参数的同时,锁定特定元素——例如面部、产品或地点。

用户可以:

  • 保持角色并更换场景。
  • 保持场景并更换角色。
    • 同时保持角色和场景,仅改变动作。

API 可用性与集成

图像参考、文本生成视频和原生 1080p 目前已通过 grok-imagine-video-1.5 模型在 xAI API 中上线。声音参考支持可通过 xAI 销售团队申请获取。

API 实现示例

开发者可以使用以下 Python SDK 结构来实现视频生成:

import os
import xai_sdk

client = xai_sdk.Client(api_key=os.getenv("XAI_API_KEY"))

response = client.video.generate(
    prompt="Slow cinematic push-in as embers drift across the battlefield and the helmet's crest stirs in the wind",
    model="grok-imagine-video-1.5",
    reference_image_urls=["https://example.com/helmet.jpg"],
    duration=6,
    aspect_ratio="16:9",
    resolution="720p",
)

print(response.url)

可用性

从 2026 年 7 月 31 日起,在美国,SuperGrok Heavy 和 SuperGrok Plus 用户可以在 grok.com/imagine 和 iOS 上使用图像和声音参考功能,随后几天内将推广至所有层级。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch