microsoft/XPretrain

Multi-modality pre-training

XPretrain – 来自 Microsoft Research 的多模态预训练

是什么 – XPretrain 是一个用于视频-语言和图像-语言对进行大规模预训练的研究代码和数据集集合。它整合了在顶级会议(CVPR 2022, NeurIPS 2022, ICLR 2023)上发表的多个模型以及配套的 HD-VILA-100M 数据集,全部来自 Microsoft 的 Multimedia Search & Mining (MSM) 团队。

核心组件

模态 模型 / 数据集 论文 (会议) 功能
视频-语言 HD-VILA CVPR 2022 在 100 M-clip HD-VILA-100M 数据集上进行高分辨率视频-语言预训练
视频-语言 LF-VILA NeurIPS 2022 在长视频(分钟级)上进行预训练
视频-语言 CLIP-ViP ICLR 2023 通过添加时间池化模块,将图像-语言 CLIP 范式适配到视频
图像-语言 Pixel-BERT arXiv 2020 从原始像素训练的端到端图像-语言 Transformer
图像-语言 SOHO CVPR 2021 (oral) 使用量化视觉 Token 使用改进 Pixel-BERT
图像-语言 VisualParsing NeurIPS 2021 基于 Transformer 的图像-语言预训练,带有解析目标

你可以获得什么

  • 代码:每个模型的代码(训练脚本、模型定义、评估工具)都位于子文件夹中(hd-vila/, LF-VILA/, CLIP-ViP/ 等)。
  • 预训练权重:(随论文一同发布) 可用于在下游任务(如视频字幕生成、视频问答、图文检索等)上进行微调。
  • HD-VILA-100M 数据集 – 一个公开发布的用于大规模预训练的高分辨率视频-文本对集合。

典型使用场景

  • 研究人员在构建新的视频-语言模型时,可以从发布的权重开始,并在自己的数据上进行微调。
  • 从业者需要强大的视频-文本编码器,用于视频搜索、字幕生成或多模态检索等任务。
  • 学术界人士在研究分辨率、时间长度或 Token 量化对多模态学习的影响时。

入门指南

  1. 克隆仓库:git clone https://github.com/microsoft/XPretrain.git
  2. 安装所需的 Python 包(README 指向每个子文件夹内的 requirements.txt)。
  3. 按照特定模型目录中的 README(例如 hd-vila/README.md)进行数据准备、训练和推理命令。
  4. 对于数据集,从 hd-vila-100m/ 文件夹下载 HD-VILA-100M 文件(链接已在其中提供)。

社区与贡献

  • 接受在 Microsoft CLA 下进行的贡献;当你提交 PR 时,机器人会引导你完成流程。
  • 可以针对预训练模型提交 Issue 以寻求帮助;如有直接问题,请联系作者 Bei Liu 或 Jianlong Fu。

为什么它很重要 XPretrain 将多个最先进的多模态预训练流水线汇集在一起,使社区能够更轻松地复现结果、基准测试新想法,并利用大规模视频-语言表示,而无需从头开始构建庞大的训练基础设施。

相关

  • 项目
  • 项目
  • 项目
  • 项目