Netomi가 에이전트 시스템을 기업에 확장 – OpenAI에서 얻은 교훈

TL;DR

Netomi는 저지연 도구 사용을 위한 GPT‑4.1과 깊은 다단계 계획을 위한 GPT‑5.2를 결합한 프로덕션‑그레이드 에이전트 플랫폼을 발표했으며, 3초 미만 응답 시간, 98 % 의도 분류 정확도, 그리고 기업 규모의 내장 거버넌스를 구현했습니다.

Lesson 1 – 이상적인 흐름이 아닌 실제 복잡성을 위해 구축

결론: 기업 AI 에이전트는 모호하고 다중 시스템 요청을 처리해야 하므로 Netomi는 상태를 지속하고, 도구 사용을 강제하며, 단계별 계획을 수행할 수 있는 거버넌스된 오케스트레이션 파이프라인의 핵심에 OpenAI 모델을 배치합니다.

  • Netomi의 Agentic OS는 빠른 추론 및 도구 호출을 위해 GPT‑4.1을, 더 깊은 계획이 필요할 때는 GPT‑5.2를 통해 요청을 라우팅합니다.
  • 플랫폼은 OpenAI가 권장하는 프롬프트 패턴을 따릅니다:
    • 지속성 알림은 긴 워크플로우 전반에 걸쳐 GPT‑5.2의 추론을 유지합니다.
    • 명시적 도구 사용 기대치는 GPT‑4.1이 권위 있는 API를 호출하도록 강제함으로써 환상을 억제합니다.
    • 구조화된 계획은 GPT‑5.2를 활용해 다단계 작업을 설계하고 실행합니다.
    • 에이전트 기반 풍부 미디어 결정은 GPT‑5.2가 도구가 이미지, 비디오 또는 양식을 반환해야 할 때 신호를 보냅니다.
  • 항공사 사례에서 단일 고객 문의는 요금 규칙 확인, 로열티 혜택 계산, 티켓 변경, 그리고 항공 운영 조정을 포함할 수 있어 상황 인식과 컨텍스트 기반 앙상블 아키텍처의 필요성을 보여줍니다.

“항공사에서는 상황이 매분 변합니다. AI는 고객이 처한 장면을 추론해야 하며, 단일 작업만 수행해서는 안 됩니다.” – Puneet Mehta, CEO, Netomi.

Lesson 2 – 기업 지연 기대치를 충족하기 위해 모든 것을 병렬화

결론: 급증하는 부하에서도 사용자 신뢰를 얻기 위해 Netomi는 모델 추론과 도구 호출을 동시에 실행하여 엔드‑투‑엔드 지연을 임계값 이하로 유지합니다.

  • 기존 파이프라인은 순차적(분류 → 검색 → 검증 → 도구 호출 → 생성)입니다. Netomi의 동시성 프레임워크는 이러한 단계들을 겹쳐 실행하며, GPT‑4.1의 빠른 첫 토큰 시간과 안정적인 스트리밍 도구 호출을 활용합니다.
  • GPT‑5.2는 깊은 추론이 필요한 워크플로우 부분에만 호출되어 지연 병목 현상을 방지합니다.
  • DraftKings의 피크 이벤트 동안 시스템은 3초 미만 응답을 유지하면서 초당 40,000건 이상의 동시 요청을 처리했고, 계정, 결제, 지식 조회, 규제 검증 전반에 걸쳐 98 % 의도 분류 정확도를 유지했습니다.

“AI는 우리가 가장 중요한 순간에 고객을 지원하는 방식의 핵심이자 필수 요소입니다.” – Paul Liberman, 공동 설립자 및 운영 담당 부사장, DraftKings.

Lesson 3 – 거버넌스를 런타임에 내재화

결론: 신뢰할 수 있는 기업 AI는 실행 레이어에 거버넌스가 내장되어야 하며, Netomi의 런타임은 자동으로 검증하고 정책을 적용하며 불확실성이 발생할 때 안전하게 백업합니다.

  • 스키마 검증은 실행 전 모든 도구 호출을 OpenAPI 계약과 대조합니다.
  • 정책 적용은 추론 중에 주제 필터, 브랜드 제한, 규정 준수 규칙을 인라인으로 적용합니다.
  • PII 보호는 전처리 및 응답 생성 단계에서 민감 데이터를 감지하고 마스킹합니다.
  • 결정론적 백업은 모호한 의도나 낮은 신뢰도의 예측을 사전 승인된 안전 행동으로 라우팅합니다.
  • 런타임 가시성은 토큰 추적, 추론 단계, 도구 체인 로그를 실시간 디버깅 및 감사 가능하도록 노출합니다.
  • 연간 약 200만 건의 제공자 요청을 처리하는 치과 보험 배포에서, 거버넌스 레이어는 대량 개방 등록 기간 동안 규제 위험을 방지했습니다.

“우리는 에이전트가 불확실성에 도달하면 정확히 어떻게 안전하게 물러날지 알 수 있도록 시스템을 구축했습니다.” – Puneet Mehta, CEO, Netomi.

기업‑준비 에이전트 시스템을 위한 청사진

결론: OpenAI의 GPT‑4.1과 GPT‑5.2를 거버넌스된 병렬 실행 엔진과 결합하면 속도, 정확성, 컴플라이언스를 만족하는 프로덕션‑그레이드 에이전트 스택을 제공할 수 있습니다.

  • 속도: 극한 부하에서도 3초 미만 지연.
  • 정확성: 대규모에서 98 % 의도 분류.
  • 거버넌스: 내장 스키마 검증, 정책 적용, PII 보호, 결정론적 백업, 완전한 가시성.
  • 확장성: 항공, 게임, 보험 등 다양한 도메인에서 초당 40 k 이상의 동시 요청 처리.

이 원칙들은 프로토타입 챗봇에서 신뢰할 수 있는 기업‑그레이드 AI 에이전트로 전환하려는 모든 조직에 반복 가능한 로드맵을 제공합니다.

결과 요약

  • 트래픽이 많은 이벤트 동안 3초 미만 응답 시간.
  • 대규모에서 98 % 의도 분류 정확도.
  • 초당 40,000건 이상의 동시 요청 급증 지원.
  • 결정론적 백업 및 정책 적용이 포함된 런타임 내 거버넌스.
  • United Airlines와 DraftKings를 포함한 Fortune 500 고객에 대한 성공적인 배포.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • 프로젝트