Hugging Face 开放响应推理标准

Hugging Face 推出了 Open Responses,这是一项开放的推理标准,旨在取代传统的 Chat Completion 格式,以更好地支持自主的代理工作流。该标准由 OpenAI 发起,并得到 Hugging Face 生态系统的支持,为开发者提供了一种在不同模型提供商之间实现推理、工具使用和多步骤代理循环的一致方式。

Open Responses 概览

Open Responses 是 Responses API(由 OpenAI 于 2025 年 3 月推出)的开源扩展。它旨在解决基于回合的 Chat Completion 格式与现代 AI 代理在长期推理、规划和行动方面的需求之间的不匹配。

  • Statelessness: 标准默认是无状态的,尽管它支持对需要的提供商进行加密推理。
  • Standardized Configuration: 它使用标准化的模型配置参数。
  • Semantic Event Streaming: 流式传输被建模为一系列语义事件,而不是原始文本或对象增量。
  • Extensibility: 标准允许针对各个模型提供商的特定可配置参数。

客户端和提供商的技术实现

Open Responses 规范了提供商与客户端之间如何传达推理和状态变化。

推理可视化

Open Responses 引入了三个可选字段用于推理项,以提供对模型思考过程的更高透明度:

  1. content:原始推理轨迹。
  2. encrypted_content:提供商特定的受保护内容。
  3. summary:原始轨迹的清理后版本。

虽然之前的 Responses API 迭代主要公开摘要和加密内容,Open Responses 允许提供商公开原始推理流,从而在支持的情况下让客户端处理原始推理。

可观测性与状态

该标准支持更丰富的状态变化和负载,以提升可观测性。例如,托管的代码解释器可以发出特定的 interpreting 状态,为用户和代理提供对长时间运行操作的更好可视性。

路由与编排

Open Responses 将 模型提供商(提供推理的)和 路由器(中间编排者)区分开来。客户端可以在请求中指定提供商及其特定的 API 选项,使路由器能够使用统一的端点在多个上游提供商之间编排请求。

工具集成与代理循环

Open Responses 原生支持内部和外部工具,并将“代理循环”形式化,以实现自主任务完成。

工具类别

  • Internal Tools: 托管在模型提供商基础设施内部的工具(例如 Google Drive 集成或 OpenAI 的文件搜索)。提供商在无需开发者介入的情况下管理执行和检索。
  • External Tools: 在提供商系统之外实现的工具,例如 MCP 服务器或客户端函数。

代理循环过程

Open Responses 将推理、工具调用和响应生成的循环过程形式化。该过程遵循以下步骤:

  1. API 接收用户请求并对模型进行采样。
  2. 如果模型发出工具调用,API 执行该调用(内部或外部)。
  3. 将工具结果反馈给模型,以继续推理。
  4. 循环重复,直至模型发出完成信号。

对于内部托管的工具,提供商管理整个循环,这意味着复杂工作流(例如搜索文档、摘要并起草电子邮件)可以在单个请求中完成。开发者可以使用 max_tool_calls 限制迭代次数,使用 tool_choice 限定可用工具,从而控制此行为。

可用性

Open Responses 目前可在 Hugging Face 推理提供商中使用,早期访问版本已托管在 Hugging Face Spaces 上。

Sources