신뢰할 수 있는 에이전트형 AI 시스템 구축: Bayer의 PRINCE 플랫폼 사례 연구

요약

Bayer는 구조화된 데이터베이스와 비구조화된 PDF 보고서에 흩어져 있는 대용량 전임상 데이터를 접근하는 문제를 해결하기 위해 Preclinical Information Center (PRINCE)를 개발했습니다. 에이전트형 Retrieval‑Augmented Generation (RAG) 시스템을 구현함으로써 Bayer는 기본 키워드 검색 도구에서 복잡한 추론, 데이터 검색 및 규제 초안을 작성할 수 있는 능동적인 연구 보조자로 전환했습니다. 핵심 교훈은 생산 단계의 에이전트형 AI가 규제 환경에서 신뢰성을 확보하려면 컨텍스트 엔지니어링(모델이 보는 것을 제어)과 하네스 엔지니어링(모델이 행동하는 방식을 제어)의 조합이 필요하다는 점입니다.

PRINCE의 진화: 검색에서 행동으로

PRINCE는 전임상 연구 요구 사항의 복잡성이 증가함에 따라 세 가지 전략적 단계로 발전했습니다:

  1. Search(검색): 고립된 구조화된 연구 메타데이터를 통합하여 검색 가능한 형태로 제공하는 통합 게이트웨이.
  2. Ask(질문): RAG를 통합해 비구조화된 데이터, 특히 과거 PDF 연구 보고서에 대해 자연어 질의를 가능하게 함.
  3. Do(실행): 현재의 에이전트형 단계로, 다중 에이전트 시스템을 활용해 복잡한 워크플로를 조정하고 규제 문서를 초안 작성함.

기술 아키텍처 및 오케스트레이션

PRINCE는 FastAPI 애플리케이션과 React UI로 구축되었으며, 백엔드 오케스트레이션에 LangGraph를 사용합니다. 시스템은 PostgreSQL(에이전트 실행 상태)과 DynamoDB(애플리케이션 수준 상태)를 통해 상태를 관리합니다.

다중 에이전트 워크플로

시스템은 "컨텍스트 오염"을 방지하고 조정성을 향상시키기 위해 특수화된 에이전트 계층 구조를 사용합니다:

  • 사용자 의도 명확화: 검색이 시작되기 전에 모호성을 해결하고 관련 데이터 소스를 제안하는 "빠른 실패" 메커니즘 역할.
  • Think & Plan (프로세스 반성): 시스템이 자신의 진행 방향을 평가하고 도메인별 옵션 라이브러리에서 가장 적합한 도구를 선택하는 전용 추론 공간.
  • Researcher Agent: RAG(Amazon OpenSearch를 통한 비구조화된 PDF)와 Text-to-SQL(Amazon Athena를 통한 구조화된 메타데이터)를 결합한 하이브리드 검색기.
  • Reflection Agent (데이터 반성): 검색된 데이터가 질의에 답하기에 충분한지 평가. 부족한 부분이 있으면 Think & Plan 에이전트에 후속 질문을 생성.
  • Writer Agent: 최종 답변을 종합하며, 모든 주장이 원본 문서와 페이지 번호에 대한 세부 인용으로 뒷받침되도록 보장.

신뢰성과 신뢰를 위한 엔지니어링

규제된 제약 환경에서는 정확성과 검증 가능성이 절대적으로 요구됩니다. Bayer는 시스템이 제한되고 관찰 가능하도록 여러 "하네스 엔지니어링" 패턴을 구현했습니다.

컨텍스트 규율

더 큰 컨텍스트 윈도우가 가능함에도 불구하고 PRINCE는 엄격한 컨텍스트 엔지니어링을 적용합니다. 서로 다른 에이전트는 서로 다른 정보 하위 집합을 받습니다: Think & Plan을 위한 계획 컨텍스트, Researcher를 위한 검색 컨텍스트, Reflection Agent를 위한 증거 컨텍스트, Writer를 위한 종합 컨텍스트. 이는 모델이 조정하기 어려워지는 것을 방지하고 디버깅을 단순화합니다.

복원력 및 오류 복구

복잡한 다단계 작업 중 전체 시스템 장애를 방지하기 위해 아키텍처에 다음을 포함합니다:

  • 상태 지속성: LangGraph 체크포인터가 상태를 Postgres에 저장하여 실패가 발생한 정확한 노드부터 시스템을 재개할 수 있게 함.
  • LLM 폴백: 기본 모델이 여러 번 재시도 후 실패하면 시스템이 자동으로 대체 모델이나 공급자로 전환해 서비스 연속성을 유지.
  • 사용자 주도 재시도: 사용자는 실패한 질의를 수동으로 재시도할 수 있으며, 시스템은 지속된 상태를 통해 이전에 성공한 단계는 건너뜁니다.

검증 및 평가

신뢰는 이중 평가 전략을 통해 유지됩니다:

  • 데이터셋 평가: Langfuse에 큐레이션된 전문가 데이터셋을 사용해 Faithfulness, Answer Relevancy, Context Relevancy를 측정.
  • 실시간 트래픽 평가: 실제 사용자 질의에 대한 일일 배치 작업을 수행해 환각 현상과 실제 성능을 모니터링.

데이터 품질 향상

역사적 메타데이터가 종종 불완전하거나 오류가 있기 때문에 Bayer는 **Named Entity Recognition (NER)**을 활용한 유틸리티 시스템을 개발했습니다. 이 시스템은 PDF에서 엔터티(예: 화합물명, 용량)를 추출해 Amazon Athena 데이터베이스를 자동으로 풍부하게 합니다. 무결성을 유지하기 위해 각 추출에 신뢰도 점수를 부여하며, 높은 신뢰도 업데이트는 자동으로 적용하고 낮은 신뢰도는 인간 검토를 위해 표시합니다.

비판적 분석 및 커뮤니티 관점

기술 아키텍처는 포괄적이지만, 커뮤니티 논의에서는 이러한 시스템의 실용성에 대해 몇 가지 논쟁점이 제기됩니다:

  • 성능 격차: 일부 비평가들은 연결된 연구 논문을 인용하며 챗봇이 사용자 요구를 완전히 충족시키는 능력이 평균 점수 3.1/5.0에 불과하다고 지적, 고도화된 에이전트형 아키텍처도 완전한 유용성을 제공하기 어렵다고 주장.
  • 데이터 vs. 에이전트 튜닝: 산업 실무자들은 "작업의 99%"가 에이전트 튜닝보다 데이터 정제에 있다고 주장, 깨끗한 데이터베이스가 복잡한 에이전트 계층보다 더 큰 영향을 미친다고 강조.
  • 아키텍처 "감각": 일부 개발자는 Researcher, Writer, Reflection 에이전트로의 분해가 경험적 근거에 기반한 것인지, 아니면 단순히 "만족스러운 흐름도"에 불과해 더 간단한 프롬프트 전략보다 불필요한 복잡성을 추가하는지 의문을 제기.

요약

Bayer는 LangGraph와 다중 에이전트 아키텍처를 활용한 에이전트형 RAG 시스템인 PRINCE를 개발해 복잡한 전임상 약물 발견 데이터를 신뢰할 수 있는 대화형 연구 보조자로 전환했습니다.

제목

신뢰할 수 있는 에이전트형 AI 시스템 구축: Bayer의 PRINCE 플랫폼 사례 연구

Sources