kyegomez/Gemini

The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google

何を解決するか

このプロジェクトは、GoogleのGeminiにインスパイアされたマルチモーダルトランスフォーマーモデルのオープンソース実装を提供します。テキスト、画像、音声といった複数のモダリティを、個別のエンコーダーに頼らず、単一のトランスフォーマーアーキテクチャ内で処理・生成できるシステムの構築を目指しています。

動作方法

モデルはテキスト、音声、画像、動画を入力シーケンスとして受け取り、それらをトークンに変換します。従来の視覚トランスフォーマー(ViT)とは異なり、この実装では画像埋め込みを直接トランスフォーマーに供給します。入力タイプを区別するために、[IMG][AUDIO] などの特別なモダリティトークンを使用しています。アーキテクチャには、Flash Attention、QK norm、およびRotary Positional Embeddings(RoPE)といった複数の最適化技術が組み込まれており、LongGeminiバリアントではリングアテンション(Ring Attention)を用いて拡張されたコンテキストを実現しています。

対象ユーザー

テキスト、画像、音声データを混合して処理できるネイティブなマルチモーダルAIモデルの構築やトレーニングに興味を持つ開発者や研究者。

特徴

  • ネイティブなマルチモーダル性: 1つのトランスフォーマー内でテキスト、画像、音声を同時に処理。
  • 最適化されたパフォーマンス: Flash Attention、QK norm、およびKVキャッシュを実装し、効率的な推論を実現。
  • 拡張されたコンテキスト: リングアテンションを用いた LongGemini 実装を含む。
  • カスタムトークナイザー: Llamaトークナイザーを基盤とし、モダリティ固有のトークンを追加した MultimodalSentencePieceTokenizer を搭載。

関連

  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch