agentscope-ai/Trinity-RFT

Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).

解決的問題

Trinity-RFT 提供一個統一且彈性的框架,用於大型語言模型(LLM)的強化微調(RFT)。透過將經驗生成、模型更新與資料管理分離,簡化了利用強化學習提升 LLM 能力的流程。

工作原理

此框架由三個核心組件構成:

  • Explorer:處理智能體與環境的互動,產生經驗資料。
  • Trainer:根據收集的資料,透過最小化損失來更新模型權重。
  • Buffer:管理資料流程,負責在整個 RFT 生命周期中進行資料處理、清理與增強。

支援多種 RFT 模式,包括同步/非同步、在策略/離策略、線上/離線強化學習,並允許在不同裝置上獨立擴展 rollout 與訓練。

適用對象

  • 希望為特定領域訓練 LLM 驅動智能體的 智能體應用開發者
  • 希望使用即插即用模組實現並驗證新 RL 算法的 強化學習研究人員
  • 專注於建立 RFT 資料集與複雜資料流程(包含人機協同情境)的 資料工程師

主要特色

  • 支援智能體強化學習:可直接訓練智能體應用,包含多步驟工作流程,以及使用 AgentScope 等框架開發的應用。
  • 全面的演算法支援:實作多種演算法,包括 PPO、GRPO、DPO、SFT,以及 CHORD 和 REC 等專用變體。
  • 全生命週期資料流程:具備主動資料管理功能,支援優先排序、清理,並原生支援多任務聯合學習。
  • 彈性部署:支援 VLM 訓練、LoRA,以及無本地 GPU 用戶使用的 Tinker 後端。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案