apple-aiml-research/ml-flextok
FlexTok: Resampling Images into 1D Token Sequences of Flexible Length
解決的問題
FlexTok 解決了將影像表示為可變長度 1D 標記序列的挑戰。與傳統的固定長度標記化不同,它允許將影像重新取樣為可截斷或調整的序列,而不會遺失重建所需的影像關鍵資訊。
工作原理
FlexTok 使用編碼器-解碼器架構。編碼器將影像轉換為離散的標記序列。解碼器(一種修正流解碼器)使用這些標記來重建影像。一個關鍵特性是,這些標記序列可以被截斷(例如,從 256 個標記中僅保留前 64 個),而模型仍能執行去標記化,從縮短的序列中重建影像。
適用對象
此專案適用於從事多模態 AI、影像標記化和生成模型的研究人員與開發者,他們需要一種靈活的方式將影像表示為序列,以用於 LLM 或其他基於序列的模型。
主要亮點
- 靈活的標記長度:能夠以巢狀方式截斷標記序列,同時保持重建能力。
- 修正流解碼器:採用修正流解碼器,從標記中實現高品質的影像重建。
- 預訓練模型:提供多種 FlexTok 標記器與 VAE(變分自編碼器),具有不同的配置(例如,不同的編碼器/解碼器層數)與潛在通道。
- Hugging Face 集成:可透過 Hugging Face Hub 輕鬆載入預訓練檢查點。
相關
- 專案
- 專案
- 專案
- 專案