TsinghuaC3I/MARTI

A Framework for LLM-based Multi-Agent Reinforced Training and Inference

해결하는 문제

MARTI는 강화학습(RL)을 사용하여 대규모 언어 모델(LLM) 기반의 다중 에이전트 시스템(MAS)을 훈련하는 어려움을 해결합니다. 복잡한 다중 에이전트 상호작용과 보상 배분을 확장 가능한 방식으로 관리하면서, 실제 정책 훈련은 개별 에이전트에 분산합니다. 최신 버전인 MARTI-v2는 표준 토큰 수준 최적화가 부족한 복잡한 추론 작업(예: 코드 생성)에 특화되어 있습니다.

작동 방식

이 프레임워크는 중앙 집중적 상호작용과 분산 훈련의 원칙에 기반합니다. 세 가지 핵심 모듈로 구성됩니다: 상호작용을 위한 다중 에이전트 월드, 보상 할당을 위한 중앙 집중적 보상, 정책 업데이트를 위한 단일 에이전트 트레이너.

MARTI-v2는 MARS² (다중 에이전트 트리 탐색 RL) 을 도입하여, 적응형 노드 확장과 정교화를 통해 비동기 다중 에이전트 트리 탐색을 사용하여 해 공간을 더 체계적으로 탐색합니다. 긴 시퀀스(최대 32K 토큰)에 대한 훈련을 안정화하기 위해 시퀀스 수준 최적화를 위한 GSPO 손실과 vLLM 엔진에서 발생하는 샘플링 편향을 보정하기 위한 Truncated Importance Sampling (TIS)을 사용합니다.

대상 사용자

복잡한 추론, 수학, 코드 생성 작업을 위한 협업형 LLM 에이전트 팀을 구축하는 AI 연구자 및 개발자로, 강화학습을 위한 견고한 인프라가 필요한 분들입니다.

주요 특징

  • 다중 에이전트 트리 탐색: 고품질 해결책 탐색을 위한 추론 경로의 효율적 탐색을 가능하게 합니다.
  • 이질적 훈련: Qwen3 및 AreaL과 같은 서로 다른 모델을 독립된 역할과 전략으로 동시에 훈련할 수 있습니다.
  • 다양한 RL 알고리즘 지원: PPO, GRPO, REINFORCE++, TTRL과 호환됩니다.
  • 유연한 워크플로우: 그래프 기반 워크플로우인 다중 에이전트 토론, Chain-of-Agents, Mixture-of-Agents를 내장 지원합니다.
  • 인프라 통합: OpenRLHF 기반으로 구축되었으며, vLLM을 지원하여 빠른 추론과 훈련을 가능하게 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트