MiniMax M2 代理对齐与泛化

MiniMax M2 通过实施交错思考和专注于全轨迹泛化的数据管道来解决高基准分数与实际效用之间的差距。这种方法确保模型在各种工具、脚手架框架和不可预测的环境扰动中保持鲁棒性。

长时序任务的交错思考

MiniMax M2 采用“交错思考”,即模型的内部独白贯穿整个任务,而不仅仅是在开始时发生。这一架构选择之所以至关重要,主要有两个原因:

  • 保持专注: 复杂的代理任务涉及长上下文;持续思考使模型能够在较长时间范围内保持连贯性并遵循指令。
  • 适应扰动: 工具输出会引入不可预测的外部变化。交错思考使模型能够不断重新评估其状态,诊断错误,并适应来自环境的新信息。

为了获得最佳性能,用户必须保留完整的会话历史,包括所有思考步骤,因为 M2 依赖此上下文作为其记忆。

通过全轨迹扰动实现泛化

虽然最初的开发侧重于“工具扩展”(增加工具种类),但 MiniMax 发现这仅提高了基准分数,并在环境或脚手架发生变化时无法确保稳定性。团队得出结论,真正的代理泛化需要在整个操作空间中适应扰动,而不仅仅是工具集。

为了实现这一点,MiniMax 开发了一个用于 全轨迹泛化 的数据管道,训练模型在以下方面的变化中保持稳定:

  • 工具信息: 可用的工具集及其描述。
  • 系统提示: 定义代理的规则和角色。
  • 用户提示: 用户提供的具体目标。
  • 环境: 底层的 API、代码库和文件。
  • 工具响应: 工具在每一步返回的实际数据。

内部测试表明,这种方法使得 M2 能够在使用不太知名或“冷启动”脚手架框架时(这些框架在训练期间不是主要关注点)泛化其工具调用和指令遵循能力。

Sources