microsoft/Orchard
Orchard: An Open-Source Agentic Modeling Framework
해결하는 문제
Orchard는 AI 에이전트를 연구하고 훈련하기 위한 표준화되고 확장 가능한 환경을 제공합니다. 이는 에이전트가 실제 배포 하네스(harness)로 전환되지 않는 단순화된 환경에서 훈련되는 "train-deploy mismatch" 문제를 해결합니다. 안정적인 Kubernetes-native 샌드박스 서비스를 제공함으로써, 연구자들이 소프트웨어 엔지니어링, 브라우저 네비게이션, 개인 비서와 같은 다양한 도메인에 걸쳐 이식 가능한 "레시피(recipes)"(SFT 및 RL 훈련 방법)를 개발할 수 있도록 합니다.
작동 방식
프레임워크는 세 가지 주요 계층으로 나뉩니다:
- Orchard Env: 격리된 컨테이너의 수명 주기를 관리하는 Kubernetes-native 샌드박스 서비스입니다. 명령 실행, 파일 I/O 및 네트워크 격리를 위한 REST API와 Python SDK를 제공하여, 에이전트가 특정 훈련 스택 없이도 샌드박스와 상호작용할 수 있도록 합니다.
- Trainer: 에이전트 정책을 최적화하는 데 사용되는 RL 훈련 스택(
slime라이브러리의 포크 버전)입니다. - Recipes: on-policy distillation 및 process rewards와 같은 기술을 사용하여 특정 작업을 위한 에이전트를 훈련하기 위한 기반을 사용하는 특정 연구 구현체(예: Orchard-SWE, Orchard-GUI, Orchard-Claw)입니다.
대상 사용자
에이전틱 모델링(agentic modeling), 강화 학습(RL), 그리고 소프트웨어 또는 웹 환경에서 복잡한 다중 턴 상호작용이 가능한 자율 에이전트 생성을 연구하는 AI 연구자 및 개발자입니다.
주요 특징
- 고성능: 낮은 명령 실행 지연 시간(0.28s)과 1,000개의 샌드박스를 병렬로 실행할 수 있는 능력.
- Harness-Agnostic: 모든 샌드박스에 인기 있는 에이전트 하네스(
codex및claude)를 사전 설치하여, 이들 사이를 쉽게 전환할 수 있습니다. - 멀티모달 지원: 소프트웨어 엔지니어링(SWE) 및 멀티모달 브라우저 네비게이션(GUI) 작업을 위한 데이터셋을 포함합니다.
- 교차 일반화(Crossover Generalization): Orchard Env에서 훈련된 에이전트는 훈련 중에 보지 못한 하네스로 전환될 때 더 나은 성능을 보여줍니다.
- 비용 효율성: 관리형 샌드박스 서비스보다 훨씬 저렴하며, 특히 스팟 인스턴스(spot instances)를 사용할 때 더욱 그렇습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트