microsoft/Orchard

Orchard: An Open-Source Agentic Modeling Framework

它解决了什么问题

Orchard 为研究和训练 AI Agent 提供了一个标准化、可扩展的环境。它解决了“训练与部署不匹配”的问题,即 Agent 在简化的环境中进行训练,而这些环境无法转化到真实的部署框架中。通过提供一个稳定的、Kubernetes 原生的沙箱服务,它允许研究人员开发“配方”(SFT 和 RL 训练方法),这些配方可以在软件工程、浏览器导航和个人助手等不同领域之间移植。

工作原理

该框架分为三个主要层:

  1. Orchard Env:一个 Kubernetes 原生的沙箱服务,用于管理隔离容器的生命周期。它提供 REST API 和 Python SDK 用于命令执行、文件 I/O 和网络隔离,允许 Agent 在不需要特定训练栈的情况下与沙箱进行交互。
  2. Trainer:一个 RL 训练栈(slime 库的一个分支),用于优化 Agent 策略。
  3. Recipes:特定的研究实现(例如 Orchard-SWE、Orchard-GUI、Orchard-Claw),利用该基础架构,通过 On-policy distillation 和 Process rewards 等技术来训练执行特定任务的 Agent。

适用对象

专注于 Agent 建模、强化学习 (RL) 以及创建能够在软件或 Web 环境中进行复杂多轮交互的自主 Agent 的 AI 研究人员和开发人员。

亮点

  • 高性能:低命令执行延迟 (0.28s),并具备并行启动 1,000 个沙箱的能力。
  • 框架无关:在每个沙箱中预装了流行的 Agent 框架(如 codexclaude),使其易于切换。
  • 多模态支持:包含用于软件工程 (SWE) 和多模态浏览器导航 (GUI) 任务的数据集。
  • 跨领域泛化:在 Orchard Env 上训练的 Agent 在迁移到训练期间未见过的框架时,表现出更好的性能。
  • 成本效益高:比托管沙箱服务便宜得多,尤其是在使用 Spot 实例时。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目