Hugging Face 開放回應推論標準
Hugging Face 推出了 Open Responses,一項開放的推論標準,旨在取代傳統的 Chat Completion 格式,以更好地支援自主代理工作流程。此標準由 OpenAI 發起,並得到 Hugging Face 生態系統的支持,為開發者提供在不同模型供應商之間實作推理、工具使用與多步驟代理迴圈的一致方式。
Open Responses 概覽
Open Responses 是 Responses API(於 2025 年 3 月由 OpenAI 推出)的開源擴充。它旨在解決回合制 Chat Completion 格式與現代 AI 代理在長期推理、規劃與行動需求之間的不匹配。
Open Responses 標準的主要技術特徵包括:
- Statelessness(無狀態):此標準預設為無狀態,雖然對於需要的供應商也支援加密推理。
- Standardized Configuration(標準化設定):使用標準化的模型設定參數。
- Semantic Event Streaming(語意事件串流):串流被建模為一系列語意事件,而非原始文字或物件差異。
- Extensibility(可擴充性):標準允許為個別模型供應商設定可配置的參數。
客戶端與供應商的技術實作
Open Responses 正式化了推理與狀態變更在供應商與客戶端之間的傳遞方式。
推理可見性
Open Responses 引入了三個可選欄位,用於提供模型思考過程的更高透明度:
content:原始推理追蹤。encrypted_content:供應商特定的受保護內容。summary:原始追蹤的淨化版本。
雖然先前的 Responses API 版本主要公開摘要與加密內容,Open Responses 允許供應商公開原始推理串流,讓客戶端在支援時能處理原始推理資料。
可觀測性與狀態
標準支援更豐富的狀態變更與負載,以提升可觀測性。例如,託管的 Code Interpreter 可以發出特定的 interpreting 狀態,讓使用者與代理更清楚長時間運行的操作情況。
路由與協調
Open Responses 區分 Model Providers(提供推論的供應商)與 Routers(中介協調者)。客戶端可以在請求中指定供應商與供應商特定的 API 選項,讓路由器能以一致的端點在多個上游供應商之間協調請求。
工具整合與代理迴圈
Open Responses 原生支援內部與外部工具,並正式化了「代理迴圈」以完成自主任務。
工具類別
- Internal Tools(內部工具):託管於模型供應商的基礎設施內(例如 Google Drive 整合或 OpenAI 的檔案搜尋)。供應商負責執行與取得,開發者無需介入。
- External Tools(外部工具):在供應商系統之外實作,如 MCP 伺服器或客戶端函式。
代理迴圈流程
Open Responses 正式化了一個重複的推理、工具呼叫與回應產生循環。流程遵循以下步驟:
- API 接收使用者請求並從模型抽樣。
- 若模型發出工具呼叫,API 執行該呼叫(內部或外部)。
- 工具結果回饋給模型以持續推理。
- 迴圈持續,直至模型發出完成訊號。
對於內部託管的工具,供應商管理整個迴圈,意味著複雜工作流程(例如搜尋文件、摘要、撰寫電子郵件)可在單一請求中完成。開發者可使用 max_tool_calls 限制迭代次數,並透過 tool_choice 限制可使用的工具。
可用性
Open Responses 目前可於 Hugging Face Inference Providers 使用,早期存取版本亦託管於 Hugging Face Spaces。