Kaixhin/imitation-learning

Imitation learning algorithms

解決的問題

本專案提供一個統一的框架,用於實現與基準測試各種深度模仿學習(IL)演算法。它解決了透過模仿專家示範來訓練代理執行任務的挑戰,讓研究人員能在標準機器人環境中比較不同的 IL 方法。

運作方式

該程式庫使用軟演員-評論家(SAC)作為基礎強化學習演算法,並實作多種模仿學習技術,包括:

  • AdRIL, DRIL, GAIL, GMMIL, PWIL, 和 RED
  • 行為克隆(BC) 用於預訓練。

支援多種設定,例如僅狀態模仿、吸收狀態指標,以及混合代理與專家資料。已在使用 D4RL 專家資料的 Gym MuJoCo 環境中進行基準測試。

適用對象

主要針對需要可靠、標準化方式測試與評估不同模仿學習演算法的強化學習與機器人領域的研究人員與開發者。

特色亮點

  • 全面的演算法套件:包含 GAIL 和 RED 等廣泛的 IL 演算法。
  • 彈性配置:提供豐富的超參數,用於判別器、獎勵塑造(AIRL)與損失函數(BCE、Mixup、PUGAIL)。
  • 整合基準測試:內建支援 Gym MuJoCo 與 D4RL 資料集。
  • 超參數最佳化:透過 Ax 與 Hydra 支援貝葉斯最佳化,以找出不同軌跡數量下的最佳設定。
  • 平行執行:可同時在多個環境中執行訓練。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案