TsinghuaC3I/MARTI

A Framework for LLM-based Multi-Agent Reinforced Training and Inference

解决的问题

MARTI 解决了使用强化学习(RL)训练基于大语言模型(LLM)的多智能体系统(MAS)的困难。它提供了一种可扩展的方法来管理复杂的多智能体交互和奖励分配,同时将实际的策略训练分散到各个智能体上。其最新版本 MARTI-v2 特别针对代码生成等复杂推理任务,这些任务中标准的 token 级优化往往难以奏效。

工作原理

该框架基于集中式交互与分布式训练的原则。它由三个核心模块组成:用于交互的多智能体世界、用于信用分配的集中式奖励机制,以及用于策略更新的单智能体训练器。

MARTI-v2 引入了 MARS²(多智能体树搜索强化学习),通过异步多智能体树搜索,利用自适应节点扩展和精炼,更系统地探索解空间。为稳定长序列(高达 32K token)的训练,它采用 GSPO 损失进行序列级优化,并使用截断重要性采样(TIS)来纠正 vLLM 引擎带来的采样偏差。

适用人群

需要为复杂推理、数学或代码生成任务构建协作式 LLM 智能体团队的 AI 研究人员和开发者,他们需要一个强大的强化学习基础设施。

主要亮点

  • 多智能体树搜索:实现对推理轨迹的高效探索,以发现高质量解决方案。
  • 异构训练:支持同时训练不同模型(如 Qwen3 和 AreaL),并赋予其独立的角色和策略。
  • 多样化的强化学习算法支持:兼容 PPO、GRPO、REINFORCE++ 和 TTRL。
  • 灵活的工作流:内置对图结构工作流(如多智能体辩论、Agent 链、混合智能体)的支持。
  • 基础设施集成:基于 OpenRLHF 构建,支持 vLLM 以实现快速推理和训练。

相关

  • 项目
  • 项目
  • 项目
  • 项目