InternLM/InternBootcamp
Official implement on InternBootCamp
解決的問題
InternAgentHarness(亦稱 InternBootcamp)提供一個可擴展的合成環境框架,用於訓練與評估 LLM 代理。它超越靜態基準,創造可執行、可互動且可驗證的任務環境,讓模型能從真實的工具呼叫、狀態回饋與多輪互動中學習。
工作原理
此框架將代理任務封裝為可訓練的環境實例。每個任務由四個核心元件組成:
- 指令生成:產生任務目標、初始狀態與輸入上下文。
- 工具執行:提供代理可呼叫且可驗證的外部工具。
- 互動控制:管理模型與環境之間的多輪通訊流程。
- 獎勵計算:根據最終結果與中間過程提供回饋信號。
它包含一個 BootCampCLI,可自動將任務設定轉換為互動式代理流程,支援批次軌跡收集、SFT 資料過濾、RL 滾動與故障分析。
適用對象
希望建構代理訓練環境、評估模型工具使用能力,或收集多輪互動軌跡以改善任務設計的研究人員與開發者。
主要亮點
- 多輪工具呼叫:專為需要在 RL 框架內進行非同步工具呼叫與狀態控制的複雜推理任務設計。
- 可驗證環境:包含電池設計、機器人軌跡規劃、金融預測與德州撲克等多種任務範例。
- 分散式工具伺服器:採用主-工作節點架構,支援跨多台機器的高併發工具執行。
- 閉環工作流程:將評估、資料產生與訓練整合為單一迭代循環。
相關
- 專案
- 專案
- 專案
- 專案
- 專案