microsoft/Orchard
Orchard: An Open-Source Agentic Modeling Framework
它解决了什么问题
Orchard 为研究和训练 AI Agent 提供了一个标准化、可扩展的环境。它解决了“训练与部署不匹配”的问题,即 Agent 在简化的环境中进行训练,而这些环境无法转化到真实的部署框架中。通过提供一个稳定的、Kubernetes 原生的沙箱服务,它允许研究人员开发“配方”(SFT 和 RL 训练方法),这些配方可以在软件工程、浏览器导航和个人助手等不同领域之间移植。
工作原理
该框架分为三个主要层:
- Orchard Env:一个 Kubernetes 原生的沙箱服务,用于管理隔离容器的生命周期。它提供 REST API 和 Python SDK 用于命令执行、文件 I/O 和网络隔离,允许 Agent 在不需要特定训练栈的情况下与沙箱进行交互。
- Trainer:一个 RL 训练栈(
slime库的一个分支),用于优化 Agent 策略。 - Recipes:特定的研究实现(例如 Orchard-SWE、Orchard-GUI、Orchard-Claw),利用该基础架构,通过 On-policy distillation 和 Process rewards 等技术来训练执行特定任务的 Agent。
适用对象
专注于 Agent 建模、强化学习 (RL) 以及创建能够在软件或 Web 环境中进行复杂多轮交互的自主 Agent 的 AI 研究人员和开发人员。
亮点
- 高性能:低命令执行延迟 (0.28s),并具备并行启动 1,000 个沙箱的能力。
- 框架无关:在每个沙箱中预装了流行的 Agent 框架(如
codex和claude),使其易于切换。 - 多模态支持:包含用于软件工程 (SWE) 和多模态浏览器导航 (GUI) 任务的数据集。
- 跨领域泛化:在 Orchard Env 上训练的 Agent 在迁移到训练期间未见过的框架时,表现出更好的性能。
- 成本效益高:比托管沙箱服务便宜得多,尤其是在使用 Spot 实例时。
相关
- 项目
- 项目
- 项目
- 项目
- 项目