facebookresearch/eb_jepa

An open source library designed to provide community examples of Joint Embedding Predictive Architectures (JEPAs). It contains code and examples for learning representations from images, video, and action-conditioned video, as well as planning using JEPA-based models.

解決的問題

EB-JEPA 是一個旨在幫助研究人員與開發者學習預測與規劃表示的程式庫。它實作了能量基聯合嵌入預測架構(JEPA),讓模型能在不需要生成每個像素的情況下,預測資料(如影像或影片)的未來狀態或表示,轉而專注於資料的底層結構。

工作原理

此程式庫提供聯合嵌入預測架構的框架。包含多種模態的實作:

  • Image JEPA:從無標籤影像(例如 CIFAR-10)中學習自監督表示,並在分類任務上進行評估。
  • Video JEPA:預測影像序列中的下一個影像表示。
  • AC Video JEPA:將 JEPA 與世界模型及模擬環境(Two Rooms)中的規劃結合。

適用對象

主要針對從事自監督學習、世界模型,以及視覺與機器人/規劃任務中預測架構的 AI 研究人員與開發者。

特色亮點

  • 自監督學習:從影像與影片的無標籤資料中學習。
  • 世界模型與規劃:包含在模擬環境中進行規劃的範例。
  • Conda/uv 套件管理:支援現代 Python 套件管理,安裝輕鬆。
  • H100 GPU 優化:預設設定針對高階 GPU 優化,同時具備對舊型硬體的彈性支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案