facebookresearch/eb_jepa

An open source library designed to provide community examples of Joint Embedding Predictive Architectures (JEPAs). It contains code and examples for learning representations from images, video, and action-conditioned video, as well as planning using JEPA-based models.

해결하는 문제

EB-JEPA는 예측 및 계획을 위한 표현을 학습하는 데 도움을 주는 라이브러리입니다. 에너지 기반 공동 임베딩 예측 아키텍처(JEPA)를 구현하여, 이미지나 동영상과 같은 데이터의 미래 상태나 표현을 모든 픽셀을 생성할 필요 없이 예측할 수 있게 해줍니다. 대신 데이터의 근본적인 구조에 집중합니다.

작동 방식

이 라이브러리는 공동 임베딩 예측 아키텍처를 위한 프레임워크를 제공합니다. 다양한 모달리티에 대한 구현이 포함되어 있습니다:

  • Image JEPA: 레이블이 없는 이미지(예: CIFAR-10)에서 자기지도 학습 표현을 학습하고 분류 작업에서 평가합니다.
  • Video JEPA: 프레임 시퀀스에서 다음 이미지 표현을 예측합니다.
  • AC Video JEPA: JEPA를 세계 모델링과 시뮬레이션 환경(두 방)에서의 계획과 결합합니다.

대상 사용자

자기지도 학습, 세계 모델, 시각 및 로봇/계획 작업을 위한 예측 아키텍처에 종사하는 AI 연구자 및 개발자를 주요 대상으로 합니다.

주요 특징

  • 자기지도 학습: 이미지 및 동영상에서 레이블이 없는 데이터로부터 학습합니다.
  • 세계 모델링 및 계획: 시뮬레이션 환경에서의 계획 예제를 포함합니다.
  • Conda/uv 패키지 관리: 설치를 쉽게 하기 위한 현대적인 Python 패키지 관리 지원.
  • H100 GPU 최적화: 고성능 GPU를 위한 기본 설정이 최적화되어 있으며, 구형 하드웨어에도 유연하게 대응 가능합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트