MiniMax M2 代理對齊與泛化
交錯思考用於長時程任務
MiniMax M2 透過實施交錯思考和專注於完整軌跡泛化的資料管道,旨在解決高基準分數與真實世界實用性之間的差距。此方法確保模型在各種工具、腳手架框架和不可預測的環境擾動中保持穩健。
- 保持專注: 複雜的代理任務涉及長上下文;持續思考使模型能夠在長時程內保持連貫性並遵循指令。
- 適應擾動: 工具輸出會引入不可預測的外部變化。交錯思考使模型能夠不斷重新評估其狀態,診斷錯誤,並適應來自環境的新資訊。
為了達到最佳性能,使用者必須保留完整的會話歷史,包括所有思考步驟,因為 M2 依賴此上下文作為其記憶。
透過完整軌跡擾動實現泛化
雖然最初的開發專注於「工具縮放」(增加工具種類),但 MiniMax 發現這僅提升了基準分數,並在環境或腳手架變化時無法確保穩定性。團隊得出結論:真正的代理泛化需要適應整個操作空間中的擾動,而不僅僅是工具集。
為此,MiniMax 開發了一個用於 完整軌跡泛化 的資料管道,訓練模型在以下領域的變化中保持穩定:
- 工具資訊: 可用的工具集及其描述。
- 系統提示: 定義代理的規則和人設。
- 使用者提示: 使用者提供的具體目標。
- 環境: 基礎的 API、程式碼庫和檔案。
- 工具回應: 工具在每一步驟返回的實際資料。
內部測試顯示,此方法使 M2 能夠在使用訓練期間非主要焦點的晦澀或「冷啟動」腳手架框架時,泛化其工具調用和遵循指令的能力。