facebookresearch/eb_jepa

An open source library designed to provide community examples of Joint Embedding Predictive Architectures (JEPAs). It contains code and examples for learning representations from images, video, and action-conditioned video, as well as planning using JEPA-based models.

解决的问题

EB-JEPA 是一个旨在帮助研究人员和开发者学习预测与规划表示的库。它实现了能量基联合嵌入预测架构(JEPA),使模型能够在无需生成每个像素的情况下,预测数据(如图像或视频)的未来状态或表示,转而关注数据的底层结构。

工作原理

该库提供了一个联合嵌入预测架构的框架。包含多种模态的实现:

  • Image JEPA:从无标签图像(如 CIFAR-10)中学习自监督表示,并在分类任务上进行评估。
  • Video JEPA:预测帧序列中的下一个图像表示。
  • AC Video JEPA:将 JEPA 与世界建模和模拟环境(Two Rooms)中的规划相结合。

适用人群

主要面向从事自监督学习、世界模型以及视觉和机器人/规划任务中预测架构的 AI 研究人员和开发者。

特色亮点

  • 自监督学习:从图像和视频的无标签数据中学习。
  • 世界建模与规划:包含在模拟环境中进行规划的示例。
  • Conda/uv 包管理:支持现代 Python 包管理,便于安装。
  • H100 GPU 优化:默认配置针对高端 GPU 进行调优,同时支持旧硬件的灵活性。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目