facebookresearch/eb_jepa
An open source library designed to provide community examples of Joint Embedding Predictive Architectures (JEPAs). It contains code and examples for learning representations from images, video, and action-conditioned video, as well as planning using JEPA-based models.
解决的问题
EB-JEPA 是一个旨在帮助研究人员和开发者学习预测与规划表示的库。它实现了能量基联合嵌入预测架构(JEPA),使模型能够在无需生成每个像素的情况下,预测数据(如图像或视频)的未来状态或表示,转而关注数据的底层结构。
工作原理
该库提供了一个联合嵌入预测架构的框架。包含多种模态的实现:
- Image JEPA:从无标签图像(如 CIFAR-10)中学习自监督表示,并在分类任务上进行评估。
- Video JEPA:预测帧序列中的下一个图像表示。
- AC Video JEPA:将 JEPA 与世界建模和模拟环境(Two Rooms)中的规划相结合。
适用人群
主要面向从事自监督学习、世界模型以及视觉和机器人/规划任务中预测架构的 AI 研究人员和开发者。
特色亮点
- 自监督学习:从图像和视频的无标签数据中学习。
- 世界建模与规划:包含在模拟环境中进行规划的示例。
- Conda/uv 包管理:支持现代 Python 包管理,便于安装。
- H100 GPU 优化:默认配置针对高端 GPU 进行调优,同时支持旧硬件的灵活性。
相关
- 项目
- 项目
- 项目
- 项目
- 项目