hello-diana/MASCOT

EMNLP 2026 Main Conference Paper: MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems (https://arxiv.org/abs/2601.14230)

解決的問題

MASCOT 解決多智能體 LLM 系統中的「人格崩塌」與「社交迎合」問題。在這些系統中,智能體經常失去其獨特身份,退化為通用助理行為,或只是無建設性地彼此附和(回音室效應),而非提供補充性觀點。

工作原理

MASCOT 採用雙層最佳化策略,平衡個體身份與群體動態:

  1. 人格感知的行為對齊:使用 AI 反饋強化學習(RLAIF)管道對個別「發言者」智能體進行微調。此過程包括生成候選回應、使用基於評分標準的 LLM 判官進行評分、訓練人格獎勵模型,並透過群體相對策略最佳化(GRPO)最佳化發言者策略。
  2. 協作對話最佳化:訓練一個「導演」智能體來協調對話。導演選擇下一位發言者,並提供自然語言指令(指定發言者、動作與語氣)。導演根據群體級獎勵使用 GRPO 進行最佳化,以確保對話不重複、具補充性。

適用對象

致力於在情感支持等情感場景,或職場會議等協作專業環境中建構社會協作型 AI 同伴的研究人員與開發者。

主要亮點

  • 雙層最佳化:將個體人格一致性訓練與群體互動協調分離。
  • 導演協調:使用專用元智能體管理發言順序與語氣,防止重複貢獻。
  • 低資源訓練:對發言者與導演策略使用 LoRA 適配器,將可訓練參數降至最低(0.187%)。
  • 完整流程:包含自包含的工作流程,涵蓋劇集生成、獎勵建模、GRPO/DPO 訓練與評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案