hello-diana/MASCOT

EMNLP 2026 Main Conference Paper: MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems (https://arxiv.org/abs/2601.14230)

해결하는 문제

MASCOT은 다중 에이전트 LLM 시스템에서 발생하는 '성격 붕괴'와 '사회적 동조' 문제를 해결합니다. 이러한 시스템에서는 에이전트들이 고유한 정체성을 잃고 일반적인 어시스턴트 행동으로 회귀하거나, 생산적이지 않은 방식으로 서로 동의하며(에코 챔버) 보완적인 시각을 제공하지 않습니다.

작동 방식

MASCOT은 개인의 정체성과 그룹 역학의 균형을 위해 이중 최적화 전략을 사용합니다:

  1. 성격 인식 행동 정렬: 개별 '스피커' 에이전트는 AI 피드백 기반 강화학습(RLAIF) 파이프라인을 통해 미세 조정됩니다. 이 과정은 후보 응답 생성, 기준 기반 LLM 심사자에 의한 점수 매기기, 성격 보상 모델 훈련, 그리고 그룹 상대적 정책 최적화(GRPO)를 통한 스피커 정책 최적화를 포함합니다.
  2. 협업 대화 최적화: '디렉터' 에이전트는 대화를 조율하기 위해 훈련됩니다. 디렉터는 다음 스피커를 선택하고, 자연어 지시(스피커, 행동, 톤 지정)를 제공합니다. 디렉터는 그룹 수준의 보상 기반 GRPO로 최적화되어 중복되지 않고 보완적인 대화를 보장합니다.

대상 사용자

정서적 지원과 같은 감정적 환경이나 직장 회의와 같은 공동 전문 환경에서 사회적 협업형 AI 동반자를 개발하는 연구자 및 개발자.

주요 특징

  • 이중 최적화: 개별 성격 충실도 훈련과 그룹 상호작용 조율을 분리합니다.
  • 디렉터 조율: 전용 메타에이전트를 사용해 턴 테이킹과 톤을 관리하여 중복 기여를 방지합니다.
  • 저자원 훈련: 스피커 및 디렉터 정책에 LoRA 어댑터를 사용하여 학습 가능한 파라미터를 최소화(0.187%)합니다.
  • 포괄적인 파이프라인: 에피소드 생성, 보상 모델링, GRPO/DPO 훈련, 평가를 포함하는 자체 포함형 워크플로우를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트