microsoft/XPretrain
Multi-modality pre-training
XPretrain – Microsoft Research 的多模態預訓練工具集
是什麼 – XPretrain 是用於 video‑language(影片-語言)與 image‑language(圖像-語言)對進行大規模預訓練的研究代碼與數據集集合。它整合了多個在頂尖會議(CVPR 2022, NeurIPS 2022, ICLR 2023)發表的模型,以及隨附的 HD‑VILA‑100M 數據集,全部來自 Microsoft 的 Multimedia Search & Mining (MSM) 部門。
關鍵組件
| Modality | Model / Dataset | Paper (venue) | What it does |
|---|---|---|---|
| Video‑Language | HD‑VILA | CVPR 2022 | 在 100 M‑clip HD‑VILA‑100M 數據集上進行高解析度影片-語言預訓練 |
| Video‑Language | LF‑VILA | NeurIPS 2022 | 針對長影片(數分鐘長)進行預訓練 |
| Video‑Language | CLIP‑ViP | ICLR 2023 | 透過增加時間池化模組,將圖像-語言 CLIP 範式適配到影片 |
| Image‑Language | Pixel‑BERT | arXiv 2020 | 從原始像素訓練的端到端圖像-語言 Transformer |
| Image‑Language | SOHO | CVPR 2021 (oral) | 使用量化視覺標記 (quantised visual tokens) 改進 Pixel‑BERT |
| Image‑Language | VisualParsing | NeurIPS 2021 | 基於 Transformer 的圖像-語言預訓練,具有解析目標 |
你可以獲得什麼
- Code:每個模型的代碼(訓練腳本、模型定義、評估工具)位於子資料夾(
hd-vila/,LF-VILA/,CLIP-ViP/等)。 - Pre‑trained checkpoints:與論文同步發布的預訓練權重,可用於影片字幕生成 (video captioning)、影片問答 (video-question answering)、圖文檢索 (image-text retrieval) 等下游任務的微調。
- HD‑VILA‑100M dataset:一個公開發布的高解析度影片-文本對集合,用於大規模預訓練。
典型使用場景
- 研究人員在構建新的影片-語言模型時,可以從發布的權重開始,並在自己的數據上進行微調。
- 從業者需要強大的影片-文本編碼器,用於影片搜尋、字幕生成或多模態檢索等任務。
- 學術界人士在研究解析度、時間長度或標記量化 (token quantisation) 對多模態學習的影響時。
入門指南
- Clone 儲存庫:
git clone https://github.com/microsoft/XPretrain.git。 - 安裝所需的 Python 套件(README 指向各子資料夾內的
requirements.txt)。 - 按照特定模型目錄中的 README(例如
hd-vila/README.md)進行數據準備、訓練與推理指令。 - 針對數據集,從
hd-vila-100m/資料夾下載 HD‑VILA‑100M 檔案(連結已在該處提供)。
社群與貢獻
- 接受 Microsoft 的 CLA 協議下的貢獻;當您開啟 PR 時,機器人會引導您完成流程。
- 您可以針對預訓練模型提交 Issue 以尋求幫助;如有直接問題,請聯繫作者 Bei Liu 或 Jianlong Fu。
為什麼它很重要 XPretrain 將多個尖端的多模態預訓練流程整合在一起,讓社群能夠更容易地重現結果、基準測試新想法,並利用大規模影片-語言表示,而無需從頭開始構建龐大的訓練基礎設施。
相關
- 專案
- 專案
- 專案
- 專案