CUGA 在 Hugging Face:讓可設定的 AI 代理普及化

IBM Research 已宣布發布 CUGA(可設定通用代理),這是一個專為企業使用場景設計的開源 AI 代理框架。CUGA 透過抽象化編排複雜性並提供可設定的通用架構,以解決常見的代理失誤,例如脆弱性和工具濫用,適用於跨網頁和 API 環境的多步驟任務。

代理基準測試中的最先進性能

CUGA 在領先的產業基準測試中對自主代理達成了頂尖結果:

  • AppWorld: 在排行榜上排名第一,基準測試包含 457 個 API 的 750 個真實世界任務。
  • WebArena: 被評為頂尖代理,從 2025 年 2 月到 2025 年 9 月保持第一名,展示了在各種應用領域中的先進電腦使用能力。

技術架構與核心能力

CUGA 採用結構化的任務執行方法來防止幻覺並管理複雜性。該架構遵循特定的管道:

  1. 意圖解釋: 聊天層解釋使用者的訊息並根據上下文構建目標。
  2. 任務規劃: 任務規劃與控制元件將目標分解為結構化的子任務。
  3. 動態任務賬本: 子任務透過支援重新規劃的賬本以程式化方式追蹤,以確保穩健執行。
  4. 專門執行: 子任務會委派給專門的代理。例如,API 代理會使用內部推理迴圈生成偽代碼指令,然後在安全沙盒中執行程式碼。
  5. 工具註冊表: 系統使用一個工具註冊表,解析並理解超越標準 MCP 協議的工具能力,以確保精確的編排。

主要功能

  • 可設定的推理模式: 使用者可以透過選擇從快速啟發式到深度規劃的模式來平衡效能、成本與延遲。
  • 電腦使用: 框架允許在單一工作流程中無縫結合 UI 互動與 API 呼叫。
  • 多工具整合: CUGA 透過 OpenAPI 規格、MCP 伺服器和 LangChain 整合工具,支援 REST API、Python 函式和自訂協議。
  • 可組合性: CUGA 可以暴露為其他代理的工具,實現巢狀推理與多代理協作。
  • 實驗性功能: 持續開發包括可設定的政策、用於企業安全的人類回圈指令,以及「save-and-reuse」功能,以捕捉重複任務的成功執行軌跡。

開源生態系統與模型彈性

CUGA 在 Apache 2.0 授權 下發布,可於 cuga.dev 和 GitHub 取得。該框架設計為與模型無關,使開發者能選擇最適合其需求的開放模型。

CUGA 已使用開放模型進行測試,例如 gpt-oss-120bLlama-4-Maverick-17B-128E-Instruct-fp8。為了優化其規劃與驗證步驟所需的重複推理,CUGA 利用如 Groq 這樣的高效能推理平台,該平台使用 LPUs (語言處理單元) 來降低延遲與成本。根據來源,開放模型比封閉替代方案便宜 80-90%。

整合與可存取性

為了降低代理開發的門檻,CUGA 提供了多個整合點:

  • Langflow 整合: 從 Langflow 1.7.0 開始,CUGA 包含一個專用的小工具,允許使用者透過低程式碼、視覺拖放介面構建多工具代理。
  • Hugging Face Spaces 示範: 在 Hugging Face Spaces 上提供即時示範,展示一個具有 20 個預設工具的小型 CRM 系統,用於銷售資料查詢和 API 互動,以及用於測試預設政策的工作區檔案存取。

Sources