agentscope-ai/Trinity-RFT
Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).
解決的問題
Trinity-RFT 提供一個統一且彈性的框架,用於大型語言模型(LLM)的強化微調(RFT)。透過將經驗生成、模型更新與資料管理分離,簡化了利用強化學習提升 LLM 能力的流程。
工作原理
此框架由三個核心組件構成:
- Explorer:處理智能體與環境的互動,產生經驗資料。
- Trainer:根據收集的資料,透過最小化損失來更新模型權重。
- Buffer:管理資料流程,負責在整個 RFT 生命周期中進行資料處理、清理與增強。
支援多種 RFT 模式,包括同步/非同步、在策略/離策略、線上/離線強化學習,並允許在不同裝置上獨立擴展 rollout 與訓練。
適用對象
- 希望為特定領域訓練 LLM 驅動智能體的 智能體應用開發者。
- 希望使用即插即用模組實現並驗證新 RL 算法的 強化學習研究人員。
- 專注於建立 RFT 資料集與複雜資料流程(包含人機協同情境)的 資料工程師。
主要特色
- 支援智能體強化學習:可直接訓練智能體應用,包含多步驟工作流程,以及使用 AgentScope 等框架開發的應用。
- 全面的演算法支援:實作多種演算法,包括 PPO、GRPO、DPO、SFT,以及 CHORD 和 REC 等專用變體。
- 全生命週期資料流程:具備主動資料管理功能,支援優先排序、清理,並原生支援多任務聯合學習。
- 彈性部署:支援 VLM 訓練、LoRA,以及無本地 GPU 用戶使用的 Tinker 後端。
相關
- 專案
- 專案
- 專案
- 專案
- 專案