kyegomez/Gemini

The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google

解决的问题

该项目提供了一个受 Google Gemini 启发的多模态 Transformer 模型的开源实现。其目标是构建一个能够在单一 Transformer 架构中处理和生成多种模态(包括文本、图像和音频)的系统,而非依赖于每个模态的独立编码器。

工作原理

该模型将文本、音频、图像和视频作为输入序列,并将其转换为标记。与传统的视觉 Transformer(ViT)使用独立编码器不同,此实现直接将图像嵌入输入到 Transformer 中。它使用特殊模态标记(如 [IMG][AUDIO])来区分输入类型。该架构结合了多种优化技术,包括 Flash Attention、QK norm 和旋转位置嵌入(RoPE),并包含一个使用 Ring Attention 的 LongGemini 变体,以支持更长的上下文。

适用人群

对构建或训练能够原生处理交错文本、图像和音频数据的多模态 AI 模型的开发者和研究人员。

主要亮点

  • 原生多模态性:在一个 Transformer 中同时处理文本、图像和音频。
  • 优化性能:实现 Flash Attention、QK norm 和 KV 缓存,以实现高效推理。
  • 扩展上下文:包含使用 Ring Attention 的 LongGemini 实现。
  • 自定义分词器:基于 Llama 分词器,添加了模态特定标记的 MultimodalSentencePieceTokenizer

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • Dispatch