MiniMax M2 エージェントのアライメントと一般化

MiniMax M2 は、インターリーブド思考とフル軌道一般化に焦点を当てたデータパイプラインを実装することにより、高いベンチマークスコアと実際のユーティリティの間のギャップを解消するように設計されています。このアプローチにより、さまざまなツール、 scaffolding フレームワーク、予測不能な環境の摂動に対してモデルが堅牢であることが保証されます。

長時間帯タスクのためのインターリーブド思考

MiniMax M2 は「インターリーブド思考」を利用しており、モデルの内部独白はタスクの開始時だけでなく、タスク全体を通じて行われます。このアーキテクチャの選択は、以下の2つの主要な理由から重要です:

  • 焦点の維持: 複雑なエージェントタスクは長いコンテキストを含みます;継続的な思考により、モデルは長い時間枠にわたって一貫性を保ち、指示に従うことができます。
  • 摂動への適応: ツールの出力は予測不能な外部変化をもたらします。インターリーブド思考により、モデルは常に自身の状態を再評価し、エラーを診断し、環境からの新しい情報に適応することができます。

最適なパフォーマンスを得るためには、ユーザーは M2 がこれをメモリとして依存しているため、思考ステップすべてを含むフルセッション履歴を保持する必要があります。

フル軌道摂動による一般化

初期の開発では「ツールスケーリング」(ツールの種類を増やすこと) に焦点が当てられていましたが、MiniMax はこれがベンチマークスコアの向上だけをもたらし、環境や scaffolding が変わったときの安定性を保証しないことを発見しました。チームは、真のエージェントの一般化には、ツールセットだけでなく、運用空間全体にわたる摂動への適応が必要だと結論付けました。

これを達成するために、MiniMax は フル軌道一般化 向けのデータパイプラインを開発し、以下の領域での変化に対してモデルが安定するように訓練しました:

  • ツール情報: 利用可能なツールセットとその説明。
  • システムプロンプト: エージェントを定義するルールとペルソナ。
  • ユーザープロンプト: ユーザーが提供する具体的な目標。
  • 環境: 基礎となる API、コードベース、ファイル。
  • ツールレスポンス: 各ステップでツールによって返される実際のデータ。

内部テストによると、このアプローチにより、トレーニング中の主要な焦点ではなかった不明瞭または「コールドスタート」の scaffolding フレームワークを使用している場合でも、M2 はツール呼び出しと指示従従能力を一般化することができます。

Sources