NovaSky-AI/SkyRL
SkyRL: A Modular Full-stack RL Library for LLMs
解決的問題
SkyRL 是一個模組化全棧式程式庫,旨在讓大語言模型(LLMs)的強化學習(RL)更易於存取且高效。它特別針對訓練能處理長時程、現實世界任務的智能體所面臨的挑戰,這些任務涉及多輪工具使用,例如程式設計、SQL 產生與終端互動。
如何運作
SkyRL 由幾個專用元件組成:
- skyrl:一個用於本地硬體上 RL 訓練的整合式程式庫,結合了模組化訓練框架(
skyrl-train)與 Tinker API 的跨平台後端(skyrl-tx)。 - skyrl-agent:專注於優化與擴展多輪工具使用 LLM 在長時程任務上的流程的智能體層。
- skyrl-gym:使用 Gymnasium API 實作的 RL 環境集合,提供數學、程式設計、搜尋與 SQL 等任務。
適用對象
此程式庫專為開發 RL 調校 LLM 的 AI 研究人員與開發者設計,特別適合關注代理工作流程、工具使用能力與長時程問題解決的使用者。
主要特色
- Tinker API 支援:實作了 Tinker API 的後端,讓使用者能在自己的 GPU 上執行為該 API 所撰寫的訓練腳本。
- 模組化架構:提供獨立的訓練框架、代理層與環境庫(Gymnasium API)。
- 長時程導向:針對 SWE-Bench 與終端使用代理等現實世界任務進行優化。
- 線上策略蒸餾:支援進階的 RL 技術,如線上策略蒸餾與具飛行中權重更新的完全非同步 RL。
相關
- 專案
- 專案
- 專案
- 專案
- 專案