hello-diana/MASCOT
EMNLP 2026 Main Conference Paper: MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems (https://arxiv.org/abs/2601.14230)
解决的问题
MASCOT 解决了多智能体 LLM 系统中的「人格坍塌」和「社交迎合」问题。在这些系统中,智能体常常失去其独特身份,退化为通用助手行为,或只是无建设性地彼此附和(回音室效应),而非提供互补视角。
工作原理
MASCOT 采用双层优化策略,平衡个体身份与群体动态:
- 人格感知的行为对齐:使用 AI 反馈强化学习(RLAIF)管道对个体「发言者」智能体进行微调。该过程包括生成候选回复、使用基于评分标准的 LLM 判官进行评分、训练人格奖励模型,并通过群体相对策略优化(GRPO)优化发言者策略。
- 协作对话优化:训练一个「导演」智能体来协调对话。导演选择下一个发言者,并提供自然语言指令(指定发言者、动作和语气)。导演基于群体级奖励使用 GRPO 进行优化,以确保对话不重复、具有互补性。
适用对象
致力于在情感支持等情感场景,或职场会议等协作专业环境中构建社会协作型 AI 同伴的研究人员和开发者。
主要亮点
- 双层优化:将个体人格一致性训练与群体互动协调分离。
- 导演协调:使用专用元智能体管理发言顺序和语气,防止重复贡献。
- 低资源训练:对发言者和导演策略使用 LoRA 适配器,将可训练参数降至最低(0.187%)。
- 完整流水线:包含自包含的工作流,涵盖剧集生成、奖励建模、GRPO/DPO 训练和评估。
相关
- 项目
- 项目
- 项目
- 项目
- 项目