Hugging Face Open Responses 추론 표준
Hugging Face는 기존 Chat Completion 형식을 대체하고 자율적인 에이전트형 워크플로우를 보다 잘 지원하도록 설계된 오픈 추론 표준인 Open Responses를 도입했습니다. 이 표준은 OpenAI가 시작하고 Hugging Face 생태계가 지원하며, 개발자들이 다양한 모델 제공자에 걸쳐 추론, 도구 사용 및 다단계 에이전트 루프를 구현할 수 있는 일관된 방법을 제공합니다.
Open Responses 개요
Open Responses는 Responses API(2025년 3월 OpenAI가 출시)의 오픈소스 확장판입니다. 이는 턴 기반 Chat Completion 형식과 장기적인 추론, 계획, 행동을 수행하는 현대 AI 에이전트의 요구 사이의 불일치를 해소하는 것을 목표로 합니다.
Key technical characteristics of the Open Responses standard include:
- Statelessness: 표준은 기본적으로 무상태이며, 필요에 따라 암호화된 추론을 지원합니다.
- Standardized Configuration: 표준화된 모델 구성 파라미터를 사용합니다.
- Semantic Event Streaming: 스트리밍은 원시 텍스트나 객체 델타가 아니라 일련의 의미론적 이벤트로 모델링됩니다.
- Extensibility: 표준은 개별 모델 제공자에 특화된 구성 파라미터를 허용합니다.
클라이언트 및 제공자를 위한 기술 구현
Open Responses는 제공자와 클라이언트 간에 추론 및 상태 변화가 전달되는 방식을 형식화합니다.
추론 가시성
Open Responses는 모델의 사고 과정을 보다 투명하게 보여주기 위해 추론 항목에 대해 세 가지 선택적 필드를 도입합니다:
content: 원시 추론 트레이스.encrypted_content: 제공자별 보호된 콘텐츠.summary: 원시 트레이스의 정제된 버전.
이전 Responses API 버전은 주로 요약과 암호화된 콘텐츠만 노출했지만, Open Responses는 제공자가 원시 추론 스트림을 노출하도록 허용하여, 지원되는 경우 클라이언트가 원시 추론을 처리할 수 있게 합니다.
관측 가능성 및 상태
표준은 관측성을 향상시키기 위해 보다 풍부한 상태 변화와 페이로드를 지원합니다. 예를 들어, 호스팅된 Code Interpreter는 특정 interpreting 상태를 발생시켜 사용자와 에이전트가 장기 실행 작업을 더 잘 파악할 수 있게 합니다.
라우팅 및 오케스트레이션
Open Responses는 Model Providers(추론을 제공하는 주체)와 Routers(중간 오케스트레이터)를 구분합니다. 클라이언트는 요청에 제공자와 제공자별 API 옵션을 지정할 수 있으며, 이를 통해 라우터는 일관된 엔드포인트를 사용해 여러 상위 제공자에 걸친 요청을 오케스트레이션할 수 있습니다.
도구 통합 및 에이전트 루프
Open Responses는 내부 및 외부 도구를 모두 기본적으로 지원하며, 자율적인 작업 수행을 위한 "agentic loop"를 형식화합니다.
도구 카테고리
- Internal Tools: 모델 제공자의 인프라 내에 호스팅됩니다(예: Google Drive 통합 또는 OpenAI의 파일 검색). 제공자가 실행 및 검색을 관리하므로 개발자가 개입할 필요가 없습니다.
- External Tools: 제공자 시스템 외부에서 구현됩니다(예: MCP 서버 또는 클라이언트 측 함수).
에이전트 루프 프로세스
Open Responses는 추론, 도구 호출, 응답 생성의 반복 사이클을 형식화합니다. 프로세스는 다음 단계로 진행됩니다:
- API가 사용자 요청을 받고 모델에서 샘플링합니다.
- 모델이 도구 호출을 내보내면 API가 이를 실행합니다(내부 또는 외부).
- 도구 결과가 모델에 다시 전달되어 추론을 지속합니다.
- 모델이 완료를 신호할 때까지 루프가 반복됩니다.
내부 호스팅 도구의 경우 제공자가 전체 루프를 관리하므로 복잡한 워크플로(예: 문서 검색, 요약, 이메일 초안 작성)를 단일 요청으로 완료할 수 있습니다. 개발자는 max_tool_calls로 반복 횟수를 제한하고 tool_choice로 사용 가능한 도구를 제한하여 이 동작을 제어할 수 있습니다.
가용성
Open Responses는 현재 Hugging Face Inference Providers와 함께 사용할 수 있으며, 조기 액세스 버전이 Hugging Face Spaces에 호스팅되어 있습니다.