facebookresearch/eb_jepa
An open source library designed to provide community examples of Joint Embedding Predictive Architectures (JEPAs). It contains code and examples for learning representations from images, video, and action-conditioned video, as well as planning using JEPA-based models.
解決的問題
EB-JEPA 是一個旨在幫助研究人員與開發者學習預測與規劃表示的程式庫。它實作了能量基聯合嵌入預測架構(JEPA),讓模型能在不需要生成每個像素的情況下,預測資料(如影像或影片)的未來狀態或表示,轉而專注於資料的底層結構。
工作原理
此程式庫提供聯合嵌入預測架構的框架。包含多種模態的實作:
- Image JEPA:從無標籤影像(例如 CIFAR-10)中學習自監督表示,並在分類任務上進行評估。
- Video JEPA:預測影像序列中的下一個影像表示。
- AC Video JEPA:將 JEPA 與世界模型及模擬環境(Two Rooms)中的規劃結合。
適用對象
主要針對從事自監督學習、世界模型,以及視覺與機器人/規劃任務中預測架構的 AI 研究人員與開發者。
特色亮點
- 自監督學習:從影像與影片的無標籤資料中學習。
- 世界模型與規劃:包含在模擬環境中進行規劃的範例。
- Conda/uv 套件管理:支援現代 Python 套件管理,安裝輕鬆。
- H100 GPU 優化:預設設定針對高階 GPU 優化,同時具備對舊型硬體的彈性支援。
相關
- 專案
- 專案
- 專案
- 專案
- 專案