microsoft/XPretrain

Multi-modality pre-training

XPretrain – Microsoft Research 的多模態預訓練工具集

是什麼 – XPretrain 是用於 video‑language(影片-語言)與 image‑language(圖像-語言)對進行大規模預訓練的研究代碼與數據集集合。它整合了多個在頂尖會議(CVPR 2022, NeurIPS 2022, ICLR 2023)發表的模型,以及隨附的 HD‑VILA‑100M 數據集,全部來自 Microsoft 的 Multimedia Search & Mining (MSM) 部門。

關鍵組件

Modality Model / Dataset Paper (venue) What it does
Video‑Language HD‑VILA CVPR 2022 在 100 M‑clip HD‑VILA‑100M 數據集上進行高解析度影片-語言預訓練
Video‑Language LF‑VILA NeurIPS 2022 針對長影片(數分鐘長)進行預訓練
Video‑Language CLIP‑ViP ICLR 2023 透過增加時間池化模組,將圖像-語言 CLIP 範式適配到影片
Image‑Language Pixel‑BERT arXiv 2020 從原始像素訓練的端到端圖像-語言 Transformer
Image‑Language SOHO CVPR 2021 (oral) 使用量化視覺標記 (quantised visual tokens) 改進 Pixel‑BERT
Image‑Language VisualParsing NeurIPS 2021 基於 Transformer 的圖像-語言預訓練,具有解析目標

你可以獲得什麼

  • Code:每個模型的代碼(訓練腳本、模型定義、評估工具)位於子資料夾(hd-vila/, LF-VILA/, CLIP-ViP/ 等)。
  • Pre‑trained checkpoints:與論文同步發布的預訓練權重,可用於影片字幕生成 (video captioning)、影片問答 (video-question answering)、圖文檢索 (image-text retrieval) 等下游任務的微調。
  • HD‑VILA‑100M dataset:一個公開發布的高解析度影片-文本對集合,用於大規模預訓練。

典型使用場景

  • 研究人員在構建新的影片-語言模型時,可以從發布的權重開始,並在自己的數據上進行微調。
  • 從業者需要強大的影片-文本編碼器,用於影片搜尋、字幕生成或多模態檢索等任務。
  • 學術界人士在研究解析度、時間長度或標記量化 (token quantisation) 對多模態學習的影響時。

入門指南

  1. Clone 儲存庫:git clone https://github.com/microsoft/XPretrain.git
  2. 安裝所需的 Python 套件(README 指向各子資料夾內的 requirements.txt)。
  3. 按照特定模型目錄中的 README(例如 hd-vila/README.md)進行數據準備、訓練與推理指令。
  4. 針對數據集,從 hd-vila-100m/ 資料夾下載 HD‑VILA‑100M 檔案(連結已在該處提供)。

社群與貢獻

  • 接受 Microsoft 的 CLA 協議下的貢獻;當您開啟 PR 時,機器人會引導您完成流程。
  • 您可以針對預訓練模型提交 Issue 以尋求幫助;如有直接問題,請聯繫作者 Bei Liu 或 Jianlong Fu。

為什麼它很重要 XPretrain 將多個尖端的多模態預訓練流程整合在一起,讓社群能夠更容易地重現結果、基準測試新想法,並利用大規模影片-語言表示,而無需從頭開始構建龐大的訓練基礎設施。

相關

  • 專案
  • 專案
  • 專案
  • 專案