kyegomez/Gemini

The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google

解決的問題

本專案提供受 Google Gemini 啟發的多模態 Transformer 模型之開源實作。目標是建立一個能在單一 Transformer 架構中處理與生成多種模態(包括文字、影像與音訊)的系統,而非依賴各模態的獨立編碼器。

工作原理

模型將文字、音訊、影像與影片作為輸入序列,並轉換為標記。與傳統的視覺 Transformer(ViT)使用獨立編碼器不同,此實作直接將影像嵌入輸入至 Transformer。它使用特殊模態標記(如 [IMG][AUDIO])來區分輸入類型。架構整合了多種優化技術,包括 Flash Attention、QK norm 與旋轉位置嵌入(RoPE),並包含使用 Ring Attention 的 LongGemini 變體,以支援更長的上下文。

適用對象

對建構或訓練能原生處理交錯文字、影像與音訊資料的多模態 AI 模型之開發者與研究人員。

主要亮點

  • 原生多模態性:在單一 Transformer 中同時處理文字、影像與音訊。
  • 優化效能:實作 Flash Attention、QK norm 與 KV 快取,以實現高效推論。
  • 擴展上下文:包含使用 Ring Attention 的 LongGemini 實作。
  • 自訂分詞器:基於 Llama 分詞器,並加入模態特定標記的 MultimodalSentencePieceTokenizer

相關

  • Dispatch
  • 專案
  • 專案
  • 專案
  • Dispatch