apple-aiml-research/ml-flextok

FlexTok: Resampling Images into 1D Token Sequences of Flexible Length

解決的問題

FlexTok 解決了將影像表示為可變長度 1D 標記序列的挑戰。與傳統的固定長度標記化不同,它允許將影像重新取樣為可截斷或調整的序列,而不會遺失重建所需的影像關鍵資訊。

工作原理

FlexTok 使用編碼器-解碼器架構。編碼器將影像轉換為離散的標記序列。解碼器(一種修正流解碼器)使用這些標記來重建影像。一個關鍵特性是,這些標記序列可以被截斷(例如,從 256 個標記中僅保留前 64 個),而模型仍能執行去標記化,從縮短的序列中重建影像。

適用對象

此專案適用於從事多模態 AI、影像標記化和生成模型的研究人員與開發者,他們需要一種靈活的方式將影像表示為序列,以用於 LLM 或其他基於序列的模型。

主要亮點

  • 靈活的標記長度:能夠以巢狀方式截斷標記序列,同時保持重建能力。
  • 修正流解碼器:採用修正流解碼器,從標記中實現高品質的影像重建。
  • 預訓練模型:提供多種 FlexTok 標記器與 VAE(變分自編碼器),具有不同的配置(例如,不同的編碼器/解碼器層數)與潛在通道。
  • Hugging Face 集成:可透過 Hugging Face Hub 輕鬆載入預訓練檢查點。

相關

  • 專案
  • 專案
  • 專案
  • 專案