kyegomez/Gemini
The open source implementation of Gemini, the model that will "eclipse ChatGPT" by Google
解決的問題
本專案提供受 Google Gemini 啟發的多模態 Transformer 模型之開源實作。目標是建立一個能在單一 Transformer 架構中處理與生成多種模態(包括文字、影像與音訊)的系統,而非依賴各模態的獨立編碼器。
工作原理
模型將文字、音訊、影像與影片作為輸入序列,並轉換為標記。與傳統的視覺 Transformer(ViT)使用獨立編碼器不同,此實作直接將影像嵌入輸入至 Transformer。它使用特殊模態標記(如 [IMG] 或 [AUDIO])來區分輸入類型。架構整合了多種優化技術,包括 Flash Attention、QK norm 與旋轉位置嵌入(RoPE),並包含使用 Ring Attention 的 LongGemini 變體,以支援更長的上下文。
適用對象
對建構或訓練能原生處理交錯文字、影像與音訊資料的多模態 AI 模型之開發者與研究人員。
主要亮點
- 原生多模態性:在單一 Transformer 中同時處理文字、影像與音訊。
- 優化效能:實作 Flash Attention、QK norm 與 KV 快取,以實現高效推論。
- 擴展上下文:包含使用 Ring Attention 的
LongGemini實作。 - 自訂分詞器:基於 Llama 分詞器,並加入模態特定標記的
MultimodalSentencePieceTokenizer。
相關
- Dispatch
- 專案
- 專案
- 專案
- Dispatch