microsoft/Orchard

Orchard: An Open-Source Agentic Modeling Framework

它解決了什麼問題

Orchard 提供了一個標準化、可擴展的環境,用於研究和訓練 AI agent。它解決了「訓練與部署不匹配」的問題,即 agent 在簡化的環境中進行訓練,而這些環境無法轉換到真實世界的部署架構中。透過提供一個穩定的、Kubernetes-native 的沙盒服務,它允許研究人員開發可跨不同領域(如軟體工程、瀏覽器導航和個人助理)移植的「配方」(SFT 和 RL 訓練方法)。

它是如何運作的

該框架分為三個主要層級:

  1. Orchard Env: 一個 Kubernetes-native 的沙盒服務,負責管理隔離容器的生命週期。它提供 REST API 和 Python SDK,用於指令執行、檔案 I/O 和網路隔離,讓 agent 可以與沙盒互動,而不需要特定的訓練技術棧。
  2. Trainer: 一個 RL 訓練技術棧(slime 函式庫的分支)用於優化 agent 策略。
  3. Recipes: 特定的研究實作(例如 Orchard-SWE、Orchard-GUI、Orchard-Claw),利用基礎架構來訓練 agent 執行特定任務,並使用如 on-policy distillation 和 process rewards 等技術。

對象是誰

專注於 agentic modeling、強化學習 (RL) 以及開發能夠在軟體或網頁環境中進行複雜多輪互動的自主 agent 的 AI 研究人員和開發人員。

重點摘要

  • 高效能: 低指令執行延遲 (0.28s) 並具備同時啟動 1,000 個沙盒的能力。
  • 架構無關性: 在每個沙盒中預裝了熱門的 agent 架構(如 codexclaude),使其易於切換。
  • 多模態支援: 包含軟體工程 (SWE) 和多模態瀏覽器導航 (GUI) 任務的資料集。
  • 跨領域泛化能力: 在 Orchard Env 上訓練的 agent 在遷移到訓練期間未見過的架構時,展現出更好的性能。
  • 成本效益: 比託管式沙盒服務顯著更便宜,特別是在使用 spot instances 時。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案