InternLM/InternBootcamp
Official implement on InternBootCamp
해결하는 문제
InternAgentHarness(또는 InternBootcamp)는 LLM 에이전트의 훈련 및 평가를 위한 확장 가능한 합성 환경 프레임워크를 제공합니다. 정적 벤치마크를 넘어서, 실행 가능하고 상호작용 가능하며 검증 가능한 작업 환경을 만들어 모델이 실제 도구 호출, 상태 피드백, 다중 라운드 상호작용을 통해 학습할 수 있도록 합니다.
작동 방식
이 프레임워크는 에이전트 작업을 훈련 가능한 환경 인스턴스로 캡슐화합니다. 각 작업은 네 가지 핵심 구성 요소로 구성됩니다:
- 지시사항 생성: 작업 목표, 초기 상태, 입력 컨텍스트를 생성합니다.
- 도구 실행: 에이전트가 호출할 수 있고 검증 가능한 외부 도구를 제공합니다.
- 상호작용 제어: 모델과 환경 간의 다중 라운드 통신 흐름을 관리합니다.
- 보상 계산: 최종 결과와 중간 과정을 기반으로 피드백 신호를 제공합니다.
또한 BootCampCLI 를 포함하여 작업 구성 설정을 인터랙티브한 에이전트 흐름으로 자동 변환하고, 배치 트래잭터리 수집, SFT 데이터 필터링, RL 롤아웃, 실패 분석을 가능하게 합니다.
대상 사용자
에이전트 훈련 환경을 구축하거나, 모델의 도구 사용 능력을 평가하거나, 작업 설계 개선을 위한 다중 라운드 상호작용 트래잭터리를 수집하고자 하는 연구자 및 개발자.
주요 특징
- 다중 라운드 도구 호출: RL 프레임워크 내에서 비동기 도구 호출과 상태 제어가 필요한 복잡한 추론 작업에 특화.
- 검증 가능한 환경: 배터리 설계, 로봇 궤적 계획, 금융 예측, 텍사스 홀덤 등 다양한 작업 예제 포함.
- 분산 도구 서버: 마스터-워커 아키텍처를 통해 여러 머신에서 고병렬 도구 실행을 지원.
- 클로즈드 루프 워크플로우: 평가, 데이터 생성, 훈련을 하나의 반복 주기로 통합.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트