IDEFICS: 開放再現最先進視覺語言模型
Hugging Face 已發布 IDEFICS (Image-aware Decoder Enhanced à la Flamingo with Interleaved Cross-attentionS),一種開放存取的視覺語言模型。IDEFICS 是 DeepMind's Flamingo 的開放再現,旨在為 AI 社群提供一個透明且開放存取的專有多模態模型替代方案。
模型功能與變體
IDEFICS 是一種多模態模型,能夠接受任意交錯的圖像與文字序列作為輸入並生成連貫的文字作為輸出。這使得模型能夠執行如回答圖像問題、描述視覺內容以及基於多張圖像創建故事等任務。
該模型提供兩種主要規模和兩種功能變體:
- 參數規模:90 億和 800 億參數。
- 模型變體:一個基礎版本和一個指令版本(例如
idefics-80B-instruct和idefics-9B-instruct),專門針對對話使用案例進行適應。
技術架構與基礎
IDEFICS 使用公開可用的模型和數據構建。它利用以下組件:
- 語言模型:LLaMA v1。
- 視覺編碼器:OpenCLIP。
這兩個預訓練模型透過由 Hugging Face 訓練的新初始化參數連接。雖然基礎模型被凍結,但這些連接參數是在 MIT 授權下發布的。
訓練數據與 OBELICS 數據集
IDEFICS 在多個開放數據集的混合上進行訓練,包括 Wikipedia、Public Multimodal Dataset 和 LAION。為了提升其能力,Hugging Face 建立並發布了 OBELICS,這是一個由網頁爬取的 1.41 億筆交錯圖像-文檔組成的新數據集,總共包含 3.53 億張圖像和 1150 億個標記。
倫理評估與透明度
為確保透明度和安全性,Hugging Face 遵循了一個以自我批判、透明和公平為重點的倫理憲章。發布過程包括:
- 紅隊測試:使用帶有圖像和文字的對抗性提示進行內部評估,以識別和緩解潛在偏見。
- 文件:發布在構建過程中遇到的技術經驗和錯誤,以提供社區學習資源。
- 工具:透過 Nomic AI 提供 OBELICS 數據集的互動視覺化。
授權與存取
IDEFICS 的存取受其基礎組件授權限制:
- CLIP-ViT-H-14-laion2B-s32B-b79K:根據 MIT 授權發布。
- llama-65b:根據非商業研究授權發布(需要提交 Meta 申請表)。
- 額外權重:新訓練的連接參數根據 MIT 授權發布。
IDEFICS 已整合到 transformers 庫中,使用者可透過 IdeficsForVisionText2Text 和 AutoProcessor 載入模型。