TsinghuaC3I/MARTI
A Framework for LLM-based Multi-Agent Reinforced Training and Inference
解决的问题
MARTI 解决了使用强化学习(RL)训练基于大语言模型(LLM)的多智能体系统(MAS)的困难。它提供了一种可扩展的方法来管理复杂的多智能体交互和奖励分配,同时将实际的策略训练分散到各个智能体上。其最新版本 MARTI-v2 特别针对代码生成等复杂推理任务,这些任务中标准的 token 级优化往往难以奏效。
工作原理
该框架基于集中式交互与分布式训练的原则。它由三个核心模块组成:用于交互的多智能体世界、用于信用分配的集中式奖励机制,以及用于策略更新的单智能体训练器。
MARTI-v2 引入了 MARS²(多智能体树搜索强化学习),通过异步多智能体树搜索,利用自适应节点扩展和精炼,更系统地探索解空间。为稳定长序列(高达 32K token)的训练,它采用 GSPO 损失进行序列级优化,并使用截断重要性采样(TIS)来纠正 vLLM 引擎带来的采样偏差。
适用人群
需要为复杂推理、数学或代码生成任务构建协作式 LLM 智能体团队的 AI 研究人员和开发者,他们需要一个强大的强化学习基础设施。
主要亮点
- 多智能体树搜索:实现对推理轨迹的高效探索,以发现高质量解决方案。
- 异构训练:支持同时训练不同模型(如 Qwen3 和 AreaL),并赋予其独立的角色和策略。
- 多样化的强化学习算法支持:兼容 PPO、GRPO、REINFORCE++ 和 TTRL。
- 灵活的工作流:内置对图结构工作流(如多智能体辩论、Agent 链、混合智能体)的支持。
- 基础设施集成:基于 OpenRLHF 构建,支持 vLLM 以实现快速推理和训练。
相关
- 项目
- 项目
- 项目
- 项目