kyegomez/Gemini
The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google
何を解決するか
このプロジェクトは、GoogleのGeminiにインスパイアされたマルチモーダルトランスフォーマーモデルのオープンソース実装を提供します。テキスト、画像、音声といった複数のモダリティを、個別のエンコーダーに頼らず、単一のトランスフォーマーアーキテクチャ内で処理・生成できるシステムの構築を目指しています。
動作方法
モデルはテキスト、音声、画像、動画を入力シーケンスとして受け取り、それらをトークンに変換します。従来の視覚トランスフォーマー(ViT)とは異なり、この実装では画像埋め込みを直接トランスフォーマーに供給します。入力タイプを区別するために、[IMG] や [AUDIO] などの特別なモダリティトークンを使用しています。アーキテクチャには、Flash Attention、QK norm、およびRotary Positional Embeddings(RoPE)といった複数の最適化技術が組み込まれており、LongGeminiバリアントではリングアテンション(Ring Attention)を用いて拡張されたコンテキストを実現しています。
対象ユーザー
テキスト、画像、音声データを混合して処理できるネイティブなマルチモーダルAIモデルの構築やトレーニングに興味を持つ開発者や研究者。
特徴
- ネイティブなマルチモーダル性: 1つのトランスフォーマー内でテキスト、画像、音声を同時に処理。
- 最適化されたパフォーマンス: Flash Attention、QK norm、およびKVキャッシュを実装し、効率的な推論を実現。
- 拡張されたコンテキスト: リングアテンションを用いた
LongGemini実装を含む。 - カスタムトークナイザー: Llamaトークナイザーを基盤とし、モダリティ固有のトークンを追加した
MultimodalSentencePieceTokenizerを搭載。
関連
- Dispatch
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch