深入 xAI:构建 Grok Imagine 与视频代理的未来

核心论点:视觉智能由语言驱动

现代视频和图像生成改进的主要驱动力已不再是扩散过程本身,而是底层语言模型的智能。随着扩散技术的成熟,模型质量的“α”现在来源于语言模型的推理能力、重写提示词的能力,以及作为代理来协调生成过程的能力。

构建 Grok Imagine:三个月从零到一

Ethan He 于 2025 年中期加入 xAI,并在仅三个月内帮助交付了首个多模态视频模型 Grok Imagine 0.9。这一快速开发得益于以下关键因素:

  • 人才与沟通: 一个小而高密度的强大工程师团队降低了沟通开销,减少会议,使得团队能够专注于构建。
  • 基础设施与迭代速度: xAI 在数据和模型推理方面的坚实基础实现了极快的迭代周期。他指出,最大的质量提升往往来自修复数据和训练流水线中的小 bug,而非实现新算法。
  • 计算资源成为瓶颈: 随着高效编码模型的兴起,实现新想法的时间已从数周缩短到数小时,瓶颈重新回到可用于实验的计算资源上。

视频生成的技术流程

构建前沿视频模型遵循结构化的依赖顺序,始于图像生成。

1. 合成数据生成

由于互联网上的视频很少配有高质量、描述性的文本配对,合成数据至关重要。该过程使用视觉语言模型(VLM)为视频生成字幕。首次启动时,人工标注员需要对视频进行如此详细的描述,以至于盲人仅凭文本即可重建场景。

2. 压缩与标记化(VAE)

在原始像素上训练 Transformer 在计算上几乎不可能。相反,使用变分自编码器(VAE)或标记器将图像/视频映射到连续的潜在空间。

  • 时间压缩: 为处理视频庞大的 token 数量,模型常将时间维度压缩(例如,将四个时间 token 压缩为一个)。虽然这节省了上下文长度,但可能在实时应用中引入延迟。
  • 逐帧压缩: 这种方式更适合交互性和实时响应,但会显著增加上下文长度。

3. 扩散 Transformer

潜在空间建立后,训练一个扩散 Transformer 来去除视觉 token 的噪声。图像模型是视频模型的基础,因为它们训练成本更低,并提供更密集的语言与视觉之间的映射,视频模型据此进行引导。

通往世界模型与生成式 UI 的路径

Ethan 将“世界模型”定义为能够生成 实时、交互式、长时程视频 的系统。

生成式 UI 与 “Neural OS”

他设想未来传统界面将被生成式 UI 取代——用户意图直接映射到像素。诸如 “Flipbook” 与 “Neuro OS” 的示例展示了一个 AI 根据用户交互实时想象界面的世界,实质上用基于扩散的前端取代传统网页浏览的确定性后端。

解决长时程问题

大多数视频模型在长时间跨度上难以保持一致性。xAI 通过以下方式解决此问题:

  • 视频扩展: 保持所有先前生成片段的历史上下文,以确保角色和物体的一致性。
  • 参考到视频: 允许用户上传参考图像(角色、物体或场景),模型将其作为恒定条件,从而无需无限的上下文窗口。

向视频代理的转变

与其尝试构建一个处理所有任务的单一“全能模型”,未来在于 视频代理。在此范式中,前沿推理模型(如大型 LLM)充当协调者,将视频生成模型作为众多工具之一。

  • 迭代细化: 类似于人类艺术家,视频代理不会一次性生成最终作品。它可以生成片段、评估,然后使用 ffmpeg 或 Photoshop 等工具进行编辑、拼接和精炼。
  • 生产质量: 这种代理式方法是实现生产级质量的唯一可行路径,因为它将确定性编辑工具的精确性与生成模型的创造力相结合。

视频训练的经济学

训练大型视频模型的 GPU 成本与中等规模语言模型相当,但会带来巨大的存储和 I/O 挑战。存储数十 PB 的视频及其对应的潜在特征会导致 S3 存储和网络流出成本显著上升,使得数据加载和缓存成为关键的工程瓶颈。

Sources