InternLM/InternBootcamp

Official implement on InternBootCamp

解决的问题

InternAgentHarness(又称 InternBootcamp)提供了一个可扩展的合成环境框架,用于训练和评估 LLM 代理。它超越了静态基准,创建了可执行、可交互且可验证的任务环境,使模型能够从真实的工具调用、状态反馈和多轮交互中学习。

工作原理

该框架将代理任务封装为可训练的环境实例。每个任务由四个核心组件构成:

  1. 指令生成:生成任务目标、初始状态和输入上下文。
  2. 工具执行:提供代理可调用且可验证的外部工具。
  3. 交互控制:管理模型与环境之间的多轮通信流程。
  4. 奖励计算:基于最终结果和中间过程提供反馈信号。

它包含一个 BootCampCLI,可自动将任务配置转换为交互式代理流程,支持批量轨迹收集、SFT 数据过滤、RL 滚动和故障分析。

适用人群

希望构建代理训练环境、评估模型工具使用能力,或收集多轮交互轨迹以改进任务设计的研究人员和开发者。

主要亮点

  • 多轮工具调用:专为需要在 RL 框架内进行异步工具调用和状态控制的复杂推理任务设计。
  • 可验证环境:包含电池设计、机器人轨迹规划、金融预测和德州扑克等多种任务示例。
  • 分布式工具服务器:采用主-从架构,支持跨多台机器的高并发工具执行。
  • 闭环工作流:将评估、数据生成和训练整合为一个单一的迭代循环。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目