apple-aiml-research/ml-flextok

FlexTok: Resampling Images into 1D Token Sequences of Flexible Length

何を解決するか

FlexTokは、柔軟な長さの1次元トークン列として画像を表現する課題に対処します。従来の固定長トークン化とは異なり、画像を切り詰めたり調整したりしても、再構成に必要な基本的な画像情報を失わずに、トークン列に再サンプリングできるようになります。

動作方法

FlexTokはエンコーダ-デコーダアーキテクチャを使用しています。エンコーダは画像を離散的なトークン列に変換します。デコーダは、これらのトークンを使用して画像を再構成するためのリクティファイドフロー・デコーダです。重要な特徴として、これらのトークン列は切り詰め可能(例:256トークンのうち最初の64トークンのみ保持)であり、短縮された列からもモデルがデトークン化して画像を再構成できる点です。

対象ユーザー

このプロジェクトは、マルチモーダルAI、画像トークン化、生成モデルに取り組む研究者や開発者向けです。特にLLMやその他のシーケンスベースのモデルに画像をシーケンスとして利用するための柔軟な表現方法が必要な方々に適しています。

主な特徴

  • 柔軟なトークン長: ネストされた形でトークン列を切り詰めながらも、再構成能力を維持できる。
  • リクティファイドフロー・デコーダ: トークンから高品質な画像再構成を実現するためのリクティファイドフロー・デコーダを採用。
  • 事前学習済みモデル: エンコーダ/デコーダのレイヤー数や潜在チャネル数が異なるさまざまな構成のFlexTokトークナイザーとVAE(変分自己符号化器)を提供。
  • Hugging Face統合: Hugging Face Hubから簡単に事前学習済みチェックポイントをロード可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト