microsoft/XPretrain
Multi-modality pre-training
XPretrain – 来自 Microsoft Research 的多模态预训练
是什么 – XPretrain 是一个用于视频-语言和图像-语言对进行大规模预训练的研究代码和数据集集合。它整合了在顶级会议(CVPR 2022, NeurIPS 2022, ICLR 2023)上发表的多个模型以及配套的 HD-VILA-100M 数据集,全部来自 Microsoft 的 Multimedia Search & Mining (MSM) 团队。
核心组件
| 模态 | 模型 / 数据集 | 论文 (会议) | 功能 |
|---|---|---|---|
| 视频-语言 | HD-VILA | CVPR 2022 | 在 100 M-clip HD-VILA-100M 数据集上进行高分辨率视频-语言预训练 |
| 视频-语言 | LF-VILA | NeurIPS 2022 | 在长视频(分钟级)上进行预训练 |
| 视频-语言 | CLIP-ViP | ICLR 2023 | 通过添加时间池化模块,将图像-语言 CLIP 范式适配到视频 |
| 图像-语言 | Pixel-BERT | arXiv 2020 | 从原始像素训练的端到端图像-语言 Transformer |
| 图像-语言 | SOHO | CVPR 2021 (oral) | 使用量化视觉 Token 使用改进 Pixel-BERT |
| 图像-语言 | VisualParsing | NeurIPS 2021 | 基于 Transformer 的图像-语言预训练,带有解析目标 |
你可以获得什么
- 代码:每个模型的代码(训练脚本、模型定义、评估工具)都位于子文件夹中(
hd-vila/,LF-VILA/,CLIP-ViP/等)。 - 预训练权重:(随论文一同发布) 可用于在下游任务(如视频字幕生成、视频问答、图文检索等)上进行微调。
- HD-VILA-100M 数据集 – 一个公开发布的用于大规模预训练的高分辨率视频-文本对集合。
典型使用场景
- 研究人员在构建新的视频-语言模型时,可以从发布的权重开始,并在自己的数据上进行微调。
- 从业者需要强大的视频-文本编码器,用于视频搜索、字幕生成或多模态检索等任务。
- 学术界人士在研究分辨率、时间长度或 Token 量化对多模态学习的影响时。
入门指南
- 克隆仓库:
git clone https://github.com/microsoft/XPretrain.git。 - 安装所需的 Python 包(README 指向每个子文件夹内的
requirements.txt)。 - 按照特定模型目录中的 README(例如
hd-vila/README.md)进行数据准备、训练和推理命令。 - 对于数据集,从
hd-vila-100m/文件夹下载 HD-VILA-100M 文件(链接已在其中提供)。
社区与贡献
- 接受在 Microsoft CLA 下进行的贡献;当你提交 PR 时,机器人会引导你完成流程。
- 可以针对预训练模型提交 Issue 以寻求帮助;如有直接问题,请联系作者 Bei Liu 或 Jianlong Fu。
为什么它很重要 XPretrain 将多个最先进的多模态预训练流水线汇集在一起,使社区能够更轻松地复现结果、基准测试新想法,并利用大规模视频-语言表示,而无需从头开始构建庞大的训练基础设施。
相关
- 项目
- 项目
- 项目
- 项目