facebookresearch/ReAgent
A platform for Reasoning systems (Reinforcement Learning, Contextual Bandits, etc.)
解決的問題
ReAgent 提供一個完整的應用式強化學習(RL)平台,專為大規模分散式任務設計,且無需模擬器。它解決了在資料批次上離線訓練策略,並安全部署至真實環境的挑戰。
運作方式
基於 Python 與 PyTorch 建構,模型服務使用 TorchScript。平台整合了深度強化學習的完整工作流程,包括資料預處理、特徵轉換、分散式訓練與優化服務。為應對缺乏模擬器的情況,它專注於離策略演算法,並使用反事實策略評估(CPE)來估計新策略的效能,而無需先部署。
適用對象
適用於需要離線強化學習訓練與安全策略部署的大規模最佳化與推薦系統領域的開發者與研究人員。
主要亮點
- 廣泛的演算法支援:包含經典離策略演算法(DQN、TD3、SAC、PPO)、推薦系統強化學習(Seq2Slate、SlateQ)以及多臂/上下文 Bandits。
- 反事實評估:實作 Doubly Robust 與 MAGIC 等技術,用於離線評估策略。
- 真實世界應用工具:提供領域分析工具以分析特徵重要性,以及行為克隆功能,可安全啟動策略學習。
- 端到端工作流程:涵蓋從資料預處理到分散式訓練與模型服務的全部流程。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch