OpenAI와 PNNL, 연방 허가 절차 가속화 파트너십

OpenAI와 미국 에너지부 산하 태평양 북서부 국립 연구소(PNNL)는 코딩 에이전트를 활용해 중요한 인프라의 연방 허가 절차를 어떻게 가속화할 수 있는지 평가하기 위해 파트너십을 맺었습니다. 이번 협업은 에너지, 교통, 물 시스템에 대한 검토 과정을 현대화하여 환경 및 기술 검토와 관련된 수년간의 지연을 줄이는 것을 목표로 합니다.

NEPA 초안 작성에서의 잠재적 효율성 향상

일반화된 코딩 에이전트를 사용하면 국가 환경 정책법(NEPA) 문서 하위 섹션의 초안 작성 시간을 1시간에서 5시간까지 단축할 수 있으며, 이는 전체 초안 작성 시간의 최대 15% 감소에 해당합니다. 이 결과는 18개 연방 기관의 NEPA 문서 섹션을 아우르는 대표적인 초안 작성 작업에 대해 19명의 주제 전문가가 수행한 평가를 기반으로 합니다.

DraftNEPABench 벤치마크

정부 업무 흐름에서 AI 성능을 평가하기 위해 OpenAI와 PNNL은 환경 영향 평가서 초안 작성과 같은 작업을 평가하도록 설계된 벤치마크인 DraftNEPABench를 개발했습니다.

기술 구현

파트너십은 일반화된 코딩 에이전트(특히 Codex CLI)를 사용해 GPT-5와 같은 추론 모델의 성능을 끌어내는 방안을 탐구했습니다. 모델에 명령줄 인터페이스 접근 권한을 제공함으로써, 에이전트는 손수 만든 휴리스틱에 의존하기보다 일반적인 문제 해결 전략을 적용할 수 있습니다. 이 에이전트에게 부여된 과제는 다음과 같습니다:

  • 수백 페이지에 걸친 문서 전반에 걸쳐 기술 및 규제 내용을 종합하기.
  • 여러 엔지니어링, 환경, 규제 소스에 걸쳐 사실을 검증하기.
  • 특정 법적·기술적 기준을 충족하는 구조화된 보고서를 초안 작성하기.

연방 인프라에 대한 함의

허가 절차를 가속화하는 것은 미국의 경제 경쟁력과 보다 안전하고 책임감 있는 인프라 개발에 필수적이라고 평가됩니다. 목표는 연방 검토를 거치는 인프라 프로젝트의 평균 승인 시간을 몇 개월에서 몇 주로 단축하는 것입니다.

초안 작성 외에도 코딩 에이전트를 활용하면 정적 PDF를 동적으로 생성되는 웹 기반 보고서와 인터랙티브 시각화로 전환할 수 있어, 인간 검토자의 검증 과정을 단순화합니다. 이러한 전환을 통해 정부 직원은 고차원적인 판단, 감독 및 복잡한 의사결정에 집중하고, AI 에이전트는 시간 소모적인 초안 작성 작업을 담당하게 됩니다.

제한 사항 및 범위

이 벤치마크는 충분히 정의된 초안 작성 작업과 제공된 컨텍스트를 기반으로 모델 능력을 평가하며, 실제 허가 결정에 필요한 완전한 모호성 및 재량권을 다루지는 않습니다. 주요 제한 사항은 다음과 같습니다:

  • Reference Accuracy: 일부 오류는 모델의 실패라기보다 오래된 참고 문헌이나 약한 평가 기준에 기인한 것으로 확인되었습니다.
  • Source Material Dependency: 모델은 명시적으로 지시받지 않는 한 불완전하거나 일관성 없거나 오래된 소스 자료를 표시하지 않을 수 있습니다.
  • Human Iteration: 실제 현장 성능은 전문가 피드백과 반복적인 개선이 통합될 것으로 기대되므로, 이 자체 포함된 벤치마크 작업보다 높을 것으로 예상됩니다.

향후 개발

OpenAI는 연방 기관이 중요한 인프라의 허가 절차를 간소화하도록 설계된 PermitAI 애플리케이션을 개선하는 데 PNNL을 지속적으로 지원하고 있습니다.

Sources