apple-aiml-research/ml-flextok

FlexTok: Resampling Images into 1D Token Sequences of Flexible Length

解决的问题

FlexTok 解决了将图像表示为可变长度 1D 令牌序列的挑战。与传统的固定长度标记化不同,它允许将图像重新采样为可截断或调整的序列,而不会丢失重建所需的图像关键信息。

工作原理

FlexTok 使用编码器-解码器架构。编码器将图像转换为离散的令牌序列。解码器(一种修正流解码器)使用这些令牌来重建图像。一个关键特性是,这些令牌序列可以被截断(例如,从 256 个令牌中仅保留前 64 个),而模型仍能执行去令牌化,从缩短的序列中重建图像。

适用人群

该项目适用于从事多模态 AI、图像标记化和生成模型的研究人员和开发者,他们需要一种灵活的方式来将图像表示为序列,以用于 LLM 或其他基于序列的模型。

主要亮点

  • 灵活的令牌长度:能够在嵌套方式下截断令牌序列,同时保持重建能力。
  • 修正流解码器:采用修正流解码器,从令牌中实现高质量的图像重建。
  • 预训练模型:提供多种 FlexTok 标记器和 VAE(变分自编码器),具有不同的配置(例如,不同的编码器/解码器层数)和潜在通道。
  • Hugging Face 集成:可通过 Hugging Face Hub 轻松加载预训练检查点。

相关

  • 项目
  • 项目
  • 项目
  • 项目