kyegomez/Gemini
The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google
解决的问题
该项目提供了一个受 Google Gemini 启发的多模态 Transformer 模型的开源实现。其目标是构建一个能够在单一 Transformer 架构中处理和生成多种模态(包括文本、图像和音频)的系统,而非依赖于每个模态的独立编码器。
工作原理
该模型将文本、音频、图像和视频作为输入序列,并将其转换为标记。与传统的视觉 Transformer(ViT)使用独立编码器不同,此实现直接将图像嵌入输入到 Transformer 中。它使用特殊模态标记(如 [IMG] 或 [AUDIO])来区分输入类型。该架构结合了多种优化技术,包括 Flash Attention、QK norm 和旋转位置嵌入(RoPE),并包含一个使用 Ring Attention 的 LongGemini 变体,以支持更长的上下文。
适用人群
对构建或训练能够原生处理交错文本、图像和音频数据的多模态 AI 模型的开发者和研究人员。
主要亮点
- 原生多模态性:在一个 Transformer 中同时处理文本、图像和音频。
- 优化性能:实现 Flash Attention、QK norm 和 KV 缓存,以实现高效推理。
- 扩展上下文:包含使用 Ring Attention 的
LongGemini实现。 - 自定义分词器:基于 Llama 分词器,添加了模态特定标记的
MultimodalSentencePieceTokenizer。
相关
- Dispatch
- 项目
- 项目
- 项目
- Dispatch