OpenAI 사내 데이터 에이전트 내부 살펴보기
OpenAI는 회사의 방대한 내부 데이터 플랫폼 전반에 걸쳐 데이터 탐색 및 분석을 간소화하도록 설계된 맞춤형 내부 전용 AI 데이터 에이전트를 개발했습니다. 자연어 인터페이스와 정교한 다층 컨텍스트 시스템을 결합함으로써, 이 에이전트는 엔지니어링, 데이터 사이언스, 재무, 연구 부서의 직원들이 복잡한 질문에서 실행 가능한 인사이트로 몇 분 안에 전환할 수 있게 합니다.
엔드투엔드 자율 데이터 분석
OpenAI 데이터 에이전트는 초기 데이터 탐색 및 SQL 생성부터 노트북과 보고서의 게시에 이르기까지 전체 분석 워크플로우를 처리합니다. 고정된 스크립트를 따르는 전통적인 도구와 달리, 이 에이전트는 폐쇄 루프, 자체 학습 프로세스를 사용하여 실시간으로 자신의 진행 상황을 평가합니다. 중간 결과가 잘못된 경우(예: 조인 오류로 인해 쿼리가 0행을 반환하는 경우) 에이전트는 실패를 조사하고 접근 방식을 조정한 뒤 전체 컨텍스트를 유지하면서 분석을 다시 시도합니다.
6계층 컨텍스트 아키텍처
정확성을 보장하고 사용자 수 오추정이나 내부 용어 오해와 같은 일반적인 실패를 방지하기 위해, 에이전트는 여섯 개의 구별된 컨텍스트 레이어에 기반합니다:
1. 테이블 사용
에이전트는 스키마 메타데이터(컬럼 이름 및 데이터 타입)와 테이블 계보를 활용하여 데이터셋 간의 관계를 이해합니다. 또한 과거 쿼리를 수집하여 테이블이 일반적으로 어떻게 조인되고 조회되는지를 추론합니다.
2. 인간 주석
도메인 전문가들은 테이블 및 컬럼에 대한 선별된 설명을 제공하여 비즈니스 의미, 의도 및 스키마만으로는 추론할 수 없는 주의 사항을 포착합니다.
3. Codex 강화
테이블에 대한 코드 수준 정의를 도출함으로써, 에이전트는 파이프라인 로직을 통해 데이터가 어떻게 구성되는지를 이해합니다. 이를 통해 유사해 보이는 테이블을 구분하고(예: 테이블이 1차 파티 ChatGPT 트래픽만 포함하는지 여부) 데이터의 최신성 및 세분성을 파악할 수 있습니다.
4. 조직 지식
에이전트는 Slack, Google Docs, Notion과 통합되어 제품 출시, 신뢰성 사고, 내부 코드명, 표준 메트릭 정의 등에 대한 컨텍스트를 가져옵니다. 이 정보는 엄격한 접근 제어가 적용된 검색 서비스로 관리됩니다.
5. 메모리
에이전트는 눈에 띄지 않는 수정, 필터 및 제약 조건을 보존하는 메모리 시스템을 구현합니다. 사용자가 에이전트를 수정하거나 미묘한 차이가 발견될 때, 에이전트는 이를 학습으로 저장하여 향후 쿼리가 보다 정확한 기준에서 시작하도록 합니다.
6. 런타임 컨텍스트
이전 컨텍스트가 오래되었거나 없을 경우, 에이전트는 데이터 웨어하우스에 실시간 쿼리를 발행하고 Airflow, Spark와 같은 다른 데이터 플랫폼 시스템과 통신하여 스키마를 검증하고 데이터를 실시간으로 이해합니다.
기술 구현 및 확장성
OpenAI는 일일 오프라인 파이프라인을 사용해 70,000개 이상의 데이터셋과 600페타바이트 규모의 데이터를 관리합니다. 이 파이프라인은 사용량, 주석 및 Codex 강화를 정규화된 형태로 집계한 뒤, 이를 OpenAI Embeddings API를 통해 임베딩으로 변환합니다. 쿼리 시점에 에이전트는 **Retrieval-Augmented Generation (RAG)**을 활용해 가장 관련성 높은 컨텍스트만을 가져와 낮은 실행 지연 시간을 보장합니다.
평가 및 품질 관리
품질 저하를 방지하기 위해 OpenAI는 선별된 질문-답변 쌍을 기반으로 한 체계적인 평가 프레임워크를 사용합니다. 각 쌍은 자연어 질문과 “골든” SQL 쿼리로 구성됩니다. 에이전트가 생성한 SQL과 결과 데이터는 Evals 채점자를 사용해 골든 세트와 비교되며, 이는 올바른 결과를 도출하는 SQL의 구문 변형도 고려합니다.
보안 및 권한
에이전트는 패스스루 인터페이스 레이어로 작동합니다. 기존 OpenAI 보안 및 접근 제어 모델을 상속하고 적용하므로, 사용자는 이미 명시적인 권한을 가진 테이블만 조회할 수 있습니다.
주요 엔지니어링 교훈
OpenAI는 내부 에이전트 개발 과정에서 세 가지 주요 교훈을 확인했습니다:
- Tool Consolidation: 너무 많은 중복 도구를 제공하면 에이전트가 혼란스러워졌으며, 도구 호출을 제한하고 통합함으로써 신뢰성이 향상되었습니다.
- High-Level Guidance: 경직되고 규정적인 프롬프트는 결과를 악화시켰습니다. 고수준 목표로 전환하고 GPT-5의 추론 능력에 의존함으로써 보다 견고한 결과를 얻었습니다.
- Code-Centric Meaning: 스키마가 형태를 설명하는 반면, 데이터의 진정한 의미는 파이프라인 코드에 존재합니다. Codex를 사용해 코드베이스를 크롤링함으로써 테이블에 무엇이 포함되어 있는지와 언제 사용해야 하는지에 대한 가장 정확한 이해를 얻었습니다.
도구 스택
에이전트는 외부 개발자에게 제공되는 동일한 도구들을 사용해 구축되었습니다, 포함:
- GPT-5 flagship model: 핵심 추론을 위한 모델.
- Codex: 코드 수준 테이블 강화를 위해.
- Evals API: 체계적인 회귀 테스트를 위해.
- Embeddings API: 컨텍스트 검색을 위해.