hello-diana/MASCOT

EMNLP 2026 Main Conference Paper: MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems (https://arxiv.org/abs/2601.14230)

何を解決するか

MASCOTは、マルチエージェントLLMシステムにおける「キャラクターの崩壊」と「社会的同調」の問題に対処します。これらのシステムでは、エージェントが独自の個性を失い、一般的なアシスタントの振る舞いに回帰するか、あるいは生産的でない形で互いに同意し合う(エコーチェンバー)ことで、補完的な視点を提供しなくなります。

動作方法

MASCOTは、個々のアイデンティティとグループダイナミクスのバランスを取るために、二段階最適化戦略を使用します:

  1. キャラクター意識型行動整合:個々の「スピーカー」エージェントは、AIフィードバックからの強化学習(RLAIF)パイプラインを使用して微調整されます。これは、候補応答の生成、基準に基づくLLMジャッジによるスコア付け、キャラクター報酬モデルの訓練、およびグループ相対的ポリシー最適化(GRPO)によるスピーカーポリシーの最適化を含みます。
  2. 協働対話最適化:「ディレクター」エージェントは会話の調整を学習します。ディレクターは次のスピーカーを選定し、自然言語による指示(スピーカー、行動、トーンを指定)を提供します。ディレクターは、グループレベルの報酬に基づいてGRPOで最適化され、重複しない、補完的な対話を保証します。

対象ユーザー

感情的支援のような状況や、職場ミーティングのような共同プロフェッショナル環境で、社会的協働型AIコンパニオンを開発している研究者や開発者。

主な特徴

  • 二段階最適化:個々のキャラクターの忠実度の訓練とグループ連携の調整を分離します。
  • ディレクターの調整:専用のメタエージェントを用いてターンの管理とトーンを制御し、重複した貢献を防ぎます。
  • リソース効率の高い訓練:スピーカーとディレクターのポリシーにLoRAアダプターを使用し、トレーナブルパラメータを最小限(0.187%)に抑えます。
  • 包括的なパイプライン:エピソード生成、報酬モデリング、GRPO/DPO訓練、評価を含む自己完結型のワークフローを提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト