Grok 图像生成发布

xAI 推出了 Aurora,这是一款集成到 Grok 中的全新自回归图像生成模型。此次更新使 Grok 能够生成高质量图像,重点在于写实渲染和严格遵循文本指令,同时引入了针对图像到图像编辑的原生多模态支持。

Aurora 模型架构与训练

Aurora 被构建为一个自回归混合专家 (MoE) 网络。该模型旨在从交织文本和图像的数据中预测下一个 token。为了实现对世界的深度理解和高保真渲染,xAI 在源自互联网的数十亿个示例上对 Aurora 进行了训练。

核心图像生成能力

Aurora 使 Grok 能够在传统图像生成模型经常面临挑战的多个领域生成高质量图像。关键能力包括:

  • 真实世界实体渲染: 真实世界物体和实体的精确视觉细节。
  • 文本与 Logo 集成: 在图像中渲染准确文本和 Logo 的能力。
  • 人物肖像: 创建逼真的人类和名人肖像。
  • 多样化内容类型: 支持广泛的风格,从写实风景和赛博朋克城市到艺术素描和漫画风格插图。

多模态输入与图像编辑

除了文本到图像生成外,Aurora 还具备原生支持多模态输入的功能。这允许模型使用用户提供的图像作为灵感参考或作为编辑的直接目标。例如,用户可以提供一张猫的图片并提示模型“将猫变为动漫风格”,从而得到原图的风格化版本。

可用性与部署

截至 2024 年 12 月 9 日,这些图像生成能力已在特定国家的平台中可用。xAI 表示,该功能将在公告发布后的一周内向所有用户推出。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch