InternLM/InternBootcamp
Official implement on InternBootCamp
解决的问题
InternAgentHarness(又称 InternBootcamp)提供了一个可扩展的合成环境框架,用于训练和评估 LLM 代理。它超越了静态基准,创建了可执行、可交互且可验证的任务环境,使模型能够从真实的工具调用、状态反馈和多轮交互中学习。
工作原理
该框架将代理任务封装为可训练的环境实例。每个任务由四个核心组件构成:
- 指令生成:生成任务目标、初始状态和输入上下文。
- 工具执行:提供代理可调用且可验证的外部工具。
- 交互控制:管理模型与环境之间的多轮通信流程。
- 奖励计算:基于最终结果和中间过程提供反馈信号。
它包含一个 BootCampCLI,可自动将任务配置转换为交互式代理流程,支持批量轨迹收集、SFT 数据过滤、RL 滚动和故障分析。
适用人群
希望构建代理训练环境、评估模型工具使用能力,或收集多轮交互轨迹以改进任务设计的研究人员和开发者。
主要亮点
- 多轮工具调用:专为需要在 RL 框架内进行异步工具调用和状态控制的复杂推理任务设计。
- 可验证环境:包含电池设计、机器人轨迹规划、金融预测和德州扑克等多种任务示例。
- 分布式工具服务器:采用主-从架构,支持跨多台机器的高并发工具执行。
- 闭环工作流:将评估、数据生成和训练整合为一个单一的迭代循环。
相关
- 项目
- 项目
- 项目
- 项目
- 项目