CUGA 在 Hugging Face 上:让可配置的 AI 智能体普及

IBM Research 宣布发布 CUGA(可配置通用智能体),这是一个专为企业使用场景设计的开源 AI 智能体框架。CUGA 通过抽象编排复杂性并提供可配置的通用架构,旨在解决诸如脆性和工具滥用等常见智能体故障,以支持跨 Web 和 API 环境的多步骤任务。

智能体基准测试中的最先进性能

CUGA 在领先的行业基准测试中实现了顶级结果,这些基准测试针对自主智能体:

  • AppWorld: 在排行榜上排名第一,该基准测试包含 457 个 API 的 750 个真实世界任务。
  • WebArena: 被评为顶级智能体,从 2025 年 2 月到 2025 年 9 月一直保持排名第一的位置,展示了在各种应用领域中的高级计算机使用能力。

技术架构与核心能力

CUGA 采用结构化的任务执行方法来防止幻觉并管理复杂性。架构遵循特定的流水线:

  1. 意图解释: 聊天层解释用户的消息并基于上下文构建目标。
  2. 任务规划: 任务规划与控制组件将目标分解为结构化的子任务。
  3. 动态任务账本: 子任务通过支持重新规划的账本以编程方式跟踪,以确保稳健执行。
  4. 专用执行: 子任务被委托给专用智能体。例如,API 智能体使用内部推理循环生成伪代码指令,然后在安全沙箱中执行代码。
  5. 工具注册表: 系统使用一个工具注册表,解析并理解超出标准 MCP 协议的工具能力,以确保精确的编排。

关键特性

  • 可配置的推理模式: 用户可以通过选择从快速启发式到深度规划的模式来平衡性能、成本和延迟。
  • 计算机使用: 框架允许在单个工作流中无缝组合 UI 交互和 API 调用。
  • 多工具集成: CUGA 通过 OpenAPI 规范、MCP 服务器和 LangChain 集成工具,支持 REST API、Python 函数和自定义协议。
  • 可组合性: CUGA 可以暴露为其他智能体的工具,实现嵌套推理和多智能体协作。
  • 实验性功能: 持续开发包括可配置策略、用于企业安全的人机交互指令,以及“保存并重用”功能,以捕获成功的执行轨迹以供重复任务使用。

开源生态与模型灵活性

CUGA 在 Apache 2.0 license 下发布,可在 cuga.dev 和 GitHub 获得。该框架设计为与模型无关,使开发者可以选择最适合其需求的开源模型。

CUGA 已在诸如 gpt-oss-120bLlama-4-Maverick-17B-128E-Instruct-fp8 等开源模型上进行测试。为了优化其规划和验证步骤所需的重复推理,CUGA 利用如 Groq 这样的高性能推理平台,Groq 使用 LPUs (Language Processing Units) 来降低延迟和成本。根据来源,开源模型相比封闭替代方案可以便宜 80%-90%。

集成与可访问性

为了降低智能体开发的入门门槛,CUGA 提供了几个集成点:

  • Langflow 集成: 从 Langflow 1.7.0 开始,CUGA 包含一个专用的小部件,允许用户使用低代码、可视化拖放界面构建多工具智能体。
  • Hugging Face Spaces 演示: 在 Hugging Face Spaces 上提供一个实时演示,展示一个具有 20 个预配置工具的小型 CRM 系统,用于销售数据查询和 API 交互,以及访问工作区文件以测试预定义策略。

Sources