TsinghuaC3I/MARTI

A Framework for LLM-based Multi-Agent Reinforced Training and Inference

解決的問題

MARTI 解決了使用強化學習(RL)訓練基於大語言模型(LLM)的多智能體系統(MAS)的困難。它提供了一種可擴展的方法來管理複雜的多智能體互動與獎勵分配,同時將實際的策略訓練分散到各個智能體上。其最新版本 MARTI-v2 特別針對程式碼生成等複雜推理任務,這些任務中標準的 token 級優化往往難以奏效。

工作原理

該框架基於集中式互動與分散式訓練的原則。它由三個核心模組組成:用於互動的多智能體世界、用於信用分配的集中式獎勵機制,以及用於策略更新的單一智能體訓練器。

MARTI-v2 引入了 MARS²(多智能體樹搜尋強化學習),透過非同步多智能體樹搜尋,利用自適應節點擴展與精煉,更系統地探索解空間。為穩定長序列(高達 32K token)的訓練,它採用 GSPO 損失進行序列級優化,並使用截斷重要性採樣(TIS)來修正 vLLM 引擎帶來的取樣偏差。

適用對象

需要為複雜推理、數學或程式碼生成任務構建協作式 LLM 智能體團隊的 AI 研究人員與開發者,他們需要一個強大的強化學習基礎設施。

主要亮點

  • 多智能體樹搜尋:實現對推理軌跡的高效探索,以發現高品質解決方案。
  • 異質訓練:支援同時訓練不同模型(如 Qwen3 和 AreaL),並賦予其獨立的角色與策略。
  • 多樣化的強化學習演算法支援:相容 PPO、GRPO、REINFORCE++ 和 TTRL。
  • 靈活的工作流程:內建對圖形結構工作流程(如多智能體辯論、Agent 鏈、混合智能體)的支援。
  • 基礎設施整合:基於 OpenRLHF 建構,支援 vLLM 以實現快速推理與訓練。

相關

  • 專案
  • 專案
  • 專案
  • 專案